返回 AI 基础设施 思维导图
中文·English
🖥️ AI 基础设施ID: security-privacy

安全与隐私

Security & Privacy
🎯核心定义
LLM 服务的安全与隐私四大问题: ① 模型窃取(蒸馏攻击)防护——对手通过 API 查询蒸馏出近似能力的模型,防护包括检测异常高频相似查询、输出水印、限制返回 logits/长答案、对可疑账户限流封禁;② 投毒防护——训练/微调数据中混入恶意样本会在特定触发词下开后门,需控制数据来源、训练前做毒样本检测(去重/过滤/聚类),上线后监控行为偏移;③ PII 脱敏——输入与输出双侧都过脱敏管线,用正则 + NER 识别并替换姓名、证件号、手机号、地址等;④ 数据合规——训练与用户数据遵守 GDPR 等法规,跨境传输做评估与备案;差分隐私从机制上保证相邻数据集的输出不可区分: Pr[M(D)S]eϵPr[M(D)S]\Pr[\mathcal{M}(D) \in S] \le e^{\epsilon} \Pr[\mathcal{M}(D') \in S]
💡使用场景
对外提供 API/产品的模型、处理用户数据的应用、有合规审计要求的业务;面试常问蒸馏攻击怎么防、投毒怎么发现、脱敏放在链路哪个位置、GDPR 与数据出境怎么评估。
解决的核心痛点
模型是核心资产,蒸馏攻击让对手以远低于训练的成本(仅靠查询接口)窃取近似能力,等于绕过整套定价与竞品壁垒;投毒后门比训练更难发现,且能精准控制模型在特定输入下的输出;PII 泄漏面临 GDPR 最高全球营收 4% 的罚款与信任崩塌;差分隐私把“可识别的个人数据”转化为统计噪声,在合规的同时保住模型效用,让数据可用但不可识别。
🎯5 个高频面试考点 (Exam Points)
1
蒸馏攻击/模型窃取的原理?API 侧有哪些防护手段(检测/水印/限流)?
2
数据投毒如何发生、训练前怎么检测、上线后如何发现后门行为?
3
PII 脱敏放在管线哪个位置?输入脱敏与输出脱敏为什么都要?
4
GDPR 对训练数据与推理数据的要求?数据出境如何进行合规评估?
5
差分隐私的直觉与公式 Pr[M(D)S]eϵPr[M(D)S]\Pr[\mathcal{M}(D) \in S] \le e^{\epsilon} \Pr[\mathcal{M}(D') \in S]?ε 越小越好还是越大越好,怎么权衡效用?
📖 关联深度指南:📄 security-and-privacy
更新于 2026-08-12
🎯
检验攻克程度:针对「安全与隐私」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点监控与可观测性下一个知识点模型风险治理

🔗 更多 AI 基础设施 知识点卡片

激活显存估算Agent 运行时(跨模块)弹性伸缩与成本优化检查点与故障恢复