LLM 服务的安全与隐私四大问题: ① 模型窃取(蒸馏攻击)防护——对手通过 API 查询蒸馏出近似能力的模型,防护包括检测异常高频相似查询、输出水印、限制返回 logits/长答案、对可疑账户限流封禁;② 投毒防护——训练/微调数据中混入恶意样本会在特定触发词下开后门,需控制数据来源、训练前做毒样本检测(去重/过滤/聚类),上线后监控行为偏移;③ PII 脱敏——输入与输出双侧都过脱敏管线,用正则 + NER 识别并替换姓名、证件号、手机号、地址等;④ 数据合规——训练与用户数据遵守 GDPR 等法规,跨境传输做评估与备案;差分隐私从机制上保证相邻数据集的输出不可区分:
Pr[M(D)∈S]≤eϵPr[M(D′)∈S]。