four security & privacy problems for LLM services: ① model extraction (distillation attack) defense — adversaries distill a near-equivalent model through API queries; defenses include detecting abnormal high-frequency similar queries, output watermarking, withholding logits/long answers and rate-limiting suspicious accounts; ② poisoning defense — malicious samples mixed into training/fine-tuning data plant backdoors triggered by specific inputs; control data provenance, run pre-training poison detection (dedup, filtering, clustering) and watch for post-training behavior drift; ③ PII redaction — sanitize both inputs and outputs with regex + NER to detect and replace names, ID numbers, phone numbers and addresses; ④ compliance — training and user data must follow GDPR and similar laws, with assessments for cross-border transfer; differential privacy guarantees neighboring datasets are indistinguishable:
Pr[M(D)∈S]≤eϵPr[M(D′)∈S].