M8-064M8: ML Systems, Engineering & ResearchPrivacy & AI ComplianceEasy
Mastery:
Privacy & AI Compliance: 解释 PII 识别与脱敏的处理流程。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 流程为检测(正则/词典/NER/分类器)→ 分类(直接/间接标识符)→ 脱敏(掩码/哈希/泛化/合成/加噪)→ 访问控制与审计。
📌 Key Takeaways
- •检测——正则(邮箱/电话/身份证)、词典、NER 模型、分类器;多方法融合提升召回
- •分类——直接标识符(姓名/证件号)与准标识符(邮编/生日/性别,可组合重识别)
- •脱敏——掩码、令牌化、哈希加盐、泛化(年龄→区间)、合成数据、加噪
- •可逆与不可逆——令牌化可逆(需密钥与访问控制),哈希/掩码不可逆
- •审计——记录谁在何时访问了哪些 PII,支持合规取证
📐 Mathematical Derivations
数学机理:<strong>PII 处理流水线</strong>——(1) <strong>检测(detect)</strong>——(a) <strong>正则/规则</strong>——邮箱、电话、身份证、信用卡号(高精度、低召回);(b) <strong>词典</strong>——姓名/机构名单(需维护);(c) <strong>NER 模型</strong>——命名实体识别(人名/地名/机构),泛化好但需训练;(d) <strong>分类器</strong>——判断文本是否含 PII;(e) <strong>融合</strong>——多方法取并集(提升召回)、投票(提升精度)。(2) <strong>分类(classify)</strong>——(a) <strong>直接标识符(direct identifiers)</strong>——单独即可识别(姓名、证件号、电话、邮箱);(b) <strong>准标识符(quasi-identifiers)</strong>——单独不能识别但组合可重识别(邮编 + 生日 + 性别,经典的 Sweeney 案例可唯一识别 87% 美国人);(c) <strong>敏感属性</strong>——健康、宗教、性取向等(即使不含标识符也需保护)。(3) <strong>脱敏(transform)</strong>——(a) <strong>掩码(masking)</strong>——替换为占位符(如 138<strong>**5678);(b) </strong>令牌化(tokenization)<strong>——用随机令牌替换,映射表受访问控制(</strong>可逆<strong>);(c) </strong>哈希(hashing)<strong>——单向(</strong>不可逆<strong>),但需</strong>加盐(salt)<strong>防彩虹表/字典攻击;(d) </strong>泛化(generalization)<strong>——降低精度(年龄 27 → 20-30,邮编 10001 → 100</strong>);(e) <strong>合成(synthesis)</strong>——生成统计特性相似但非真实的替代数据;(f) <strong>加噪(perturbation)</strong>——扰动数值(可结合 DP);(g) <strong>k-匿名</strong>——保证每条记录至少与 k-1 条不可区分(对泛化的要求)。(4) <strong>访问控制与审计(audit)</strong>——(a) <strong>最小权限</strong>——只有必要角色可访问原始 PII;(b) <strong>审计日志</strong>——记录访问者、时间、数据对象;(c) <strong>合规取证</strong>——支持监管审计。(5) <strong>重识别风险</strong>——(a) <strong>组合攻击</strong>——准标识符组合 + 外部数据(选民名册)→ 重识别;(b) <strong>链接攻击</strong>——跨数据集链接;(c) <strong>对策</strong>——泛化 + k-匿名 + DP + 限制发布粒度。(6) <strong>工程要点</strong>——(a) <strong>左移</strong>——在数据入湖/入训练集前就脱敏(而非查询时才脱敏);(b) <strong>不可逆优先</strong>——能用不可逆就不用可逆;(c) <strong>密钥管理</strong>——令牌化/加密的密钥需 HSM/KMS 保护;(d) <strong>保留期限</strong>——TTL 与定期清除;(e) <strong>测试</strong>——脱敏规则需测试(避免漏检或过度脱敏破坏数据价值)。<strong>与其他问题的关系</strong>——(a) 与数据最小化(只收集必要的);(b) 与差分隐私(更强保证);(c) 与成员推断(重识别攻击);(d) 与合规审计。<strong>度量</strong>——(a) 检测召回/精度;(b) 重识别风险(k-匿名度);(c) 脱敏覆盖率;(d) 审计日志完整率。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>准标识符的组合是重识别的主因</strong>——邮编+生日+性别即可唯一定位;面试中能举出 Sweeney 案例是深度理解的标志。② <strong>哈希必须加盐</strong>——否则可被彩虹表反查。③ <strong>令牌化可逆需严格访问控制</strong>——不可逆优先。④ <strong>脱敏应左移</strong>——在入湖/入训练前处理。⑤ <strong>检测需平衡召回与精度</strong>——漏检是合规风险,过度脱敏破坏数据价值。⑥ <strong>k-匿名不足以防组合攻击</strong>——DP 提供更强保证。⑦ <strong>面试要点</strong>——被问怎么做 PII 保护,应给出'<strong>检测(正则/NER/分类器)→ 分类(直接/准标识符)→ 脱敏(掩码/令牌化/加盐哈希/泛化/k-匿名)→ 访问控制与审计</strong>';能指出准标识符组合与哈希加盐是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕只做直接标识符脱敏(忽略准标识符组合)
- ✕哈希不加盐(可被反查)
🎯 Interviewer Follow-ups
- ?为什么准标识符的组合也可能导致重识别?
- ?哈希脱敏为什么要加盐?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.