M8-063M8: ML Systems, Engineering & ResearchPrivacy & AI ComplianceEasy
Mastery:

Privacy & AI Compliance: 解释差分隐私的核心思想与 (epsilon, delta) 的含义。

📐 Mathematical Definition
Pr⁡[M(D)∈S]≤eϵPr⁡[M(D′)∈S]+δ\Pr[\mathcal M(D)\in S]\le e^{\epsilon}\Pr[\mathcal M(D')\in S]+\delta
⚡ Executive Summary
Core Concept: 通过向查询结果加噪,使仅相差一条记录的相邻数据集输出分布几乎不可区分;(ε,δ) 量化隐私损失,ε 越小隐私越强但效用越低。

📌 Key Takeaways

  • •
    相邻数据集——仅相差一条记录的两个数据集 D 与 D'
  • •
    ε(隐私预算)——越小隐私越强、噪声越大、效用越低;δ 为失败概率的松弛
  • •
    机制——拉普拉斯机制(纯 ε-DP)、高斯机制((ε,δ)-DP)
  • •
    组合定理——多次查询的隐私损失可累加(基本组合、高级组合、RDP)
  • •
    DP-SGD——训练时逐样本梯度裁剪 + 加噪,提供训练级 DP 保证

📐 Mathematical Derivations

数学机理:<strong>差分隐私(differential privacy, DP)</strong>——(1) <strong>定义</strong>——机制 M 满足 (ε,δ)-DP,若对任意<strong>相邻数据集</strong> D、D'(仅差一条记录)与任意输出集合 S:Pr[M(D) ∈ S] ≤ e^ε · Pr[M(D') ∈ S] + δ。(2) <strong>直觉</strong>——(a) <strong>不可区分性</strong>——无论某人的数据是否在数据集里,输出分布几乎相同 → 攻击者无法判断某人是否在数据中(抗成员推断);(b) <strong>e^ε</strong> 是分布比值的上界;(c) <strong>δ</strong> 是允许的松弛(以小概率突破该界)。(3) <strong>参数含义</strong>——(a) <strong>ε 越小</strong> → 隐私越强(分布越接近)但<strong>噪声越大、效用越低</strong>;(b) <strong>ε 越大</strong> → 效用越高但隐私越弱;(c) <strong>δ</strong> ——通常取远小于 1/n(n 为记录数),代表'灾难性泄露'的概率上界。(4) <strong>机制</strong>——(a) <strong>拉普拉斯机制</strong>——对灵敏度为 Δf 的查询加 Lap(Δf/ε) 噪声,满足纯 ε-DP;(b) <strong>高斯机制</strong>——加高斯噪声,满足 (ε,δ)-DP(σ 由 ε、δ、Δf 决定);(c) <strong>灵敏度(sensitivity)</strong>——单条记录改变输出的最大幅度,决定噪声量。(5) <strong>组合定理</strong>——(a) <strong>基本组合</strong>——k 次 ε-DP 查询总计 kε;(b) <strong>高级组合</strong>——考虑查询相关性,给出更紧的界(随 sqrt(k) 增长);(c) <strong>Rényi DP</strong>——更紧的组合用于深度学习。(6) <strong>DP-SGD</strong>——(a) <strong>逐样本梯度裁剪</strong>(限制单样本影响 = 灵敏度);(b) <strong>加高斯噪声</strong>;(c) <strong>隐私会计</strong>——累积各步的隐私损失;(d) <strong>结果</strong>——训练得到的模型满足 DP 保证。(7) <strong>局部 vs 中心 DP</strong>——(a) <strong>中心(global)</strong>——可信聚合器加噪(噪声小、效用高);(b) <strong>局部(local)</strong>——每个用户在客户端加噪(无需信任服务器,但噪声大、效用低)。(8) <strong>权衡</strong>——(a) <strong>隐私-效用曲线</strong>——ε 与模型精度/查询精度的权衡;(b) <strong>实践取值</strong>——ε 常在 1-10(视场景),但需结合威胁模型;(c) <strong>不是越小越好</strong>——ε→0 时噪声无穷大,输出无信息。<strong>与其他问题的关系</strong>——(a) 与成员推断攻击(DP 是其防御);(b) 与联邦学习(可结合);(c) 与数据最小化(互补原则);(d) 与合规审计(DP 是技术性合规证据)。<strong>度量</strong>——(a) 隐私预算 ε(累计消耗);(b) 效用损失(精度下降);(c) 抗 MIA 的优势(攻击者准确率接近随机)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>DP 提供的是可证明的隐私保证</strong>——而非启发式匿名化;面试中能写出定义式是深度理解的标志。② <strong>ε 不是越小越好</strong>——ε→0 噪声无穷大,效用归零,需按威胁模型定。③ <strong>组合定理使预算有限</strong>——多次查询会累积消耗,需隐私会计。④ <strong>DP-SGD 是训练级保证</strong>——裁剪 + 加噪,代价是精度下降。⑤ <strong>中心 DP 效用高于局部 DP</strong>——但需要可信聚合器。⑥ <strong>DP 抗成员推断</strong>——因为无法区分某记录是否在数据中。⑦ <strong>面试要点</strong>——被问怎么保护隐私,应给出'<strong>差分隐私定义(相邻数据集不可区分)+ 机制(拉普拉斯/高斯)+ 组合与预算 + DP-SGD + 中心 vs 局部 + 隐私-效用权衡</strong>';能写出定义式与指出 ε 不是越小越好是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    以为 ε 越小越好(效用归零)
  • ✕
    忽略隐私预算的组合消耗
🎯 Interviewer Follow-ups
  • ?
    ε 越小意味着什么?为什么不是越小越好?
  • ?
    为什么差分隐私能抵抗成员推断攻击?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM8-062: Reliability & Graceful Degradation: 解释幂等性与精确一次语义的实现。📋Back to BankNext →M8-064: Privacy & AI Compliance: 解释 PII 识别与脱敏的处理流程。