M7-100M7: Retrieval, Ranking & RecSysOnline Metrics & GuardrailsHard
Mastery:
Online Metrics & Guardrails: 解释多重比较与序贯检验(FDR / alpha spending)。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 多指标/多次看数据会推高假阳性率;用 FDR/Bonferroni 校正多重比较,用 alpha spending 处理序贯检验。
📌 Key Takeaways
- •多重比较:m 个指标同时检验 → FWER≈1−(1−α)^m
- •校正:Bonferroni(α/m,保守)、FDR(BH,更宽松)
- •序贯检验:多次偷看数据 → 用 alpha spending 分配 α
📐 Mathematical Derivations
数学机理:<strong>多重比较问题</strong>——(1) <strong>FWER(Family-Wise Error Rate)</strong>——'<strong>至少一个</strong>假阳性'的概率;若检验 m 个独立指标、每个 α=0.05,则 FWER=1−(1−α)^m;(a) m=10 → FWER≈40%;(b) m=50 → FWER≈92%;(c) <strong>后果</strong>——'某个指标显著'很可能是偶然。(2) <strong>校正方法</strong>——(a) <strong>Bonferroni</strong>——每个检验用 α/m;<strong>优点</strong>——简单、严格控制 FWER;<strong>缺点</strong>——<strong>过于保守</strong>(尤其 m 大时,功效极低);(b) <strong>FDR(False Discovery Rate,Benjamini-Hochberg)</strong>——控制'<strong>被拒绝的假设中假阳性的比例</strong>'(而非'至少一个假阳性');<strong>做法</strong>——把 p 值排序、与 (i/m)·q 比较;<strong>优点</strong>——(i) 比 Bonferroni <strong>宽松</strong>(功效更高);(ii) 适合'探索性'分析(多个指标);<strong>缺点</strong>——不严格控制 FWER(允许少量假阳性);(c) <strong>Holm</strong>(Bonferroni 的改进,逐步法);(d) <strong>分层/预注册</strong>——(i) <strong>预注册主指标</strong>(只对主指标检验);(ii) <strong>分层检验</strong>(先主指标、通过再看次要);<strong>优点</strong>——避免'多重比较'(因为只检验一个主指标)。(3) <strong>序贯检验(sequential testing)</strong>——(a) <strong>问题</strong>——若在实验过程中<strong>多次偷看数据</strong>(每天看一次),则'当结果显著时停止'会<strong>推高假阳性</strong>(因为每次看都是一次'检验');(b) <strong>量化</strong>——若偷看 10 次,假阳性率可从 5% 升到 ~20%;(c) <strong>后果</strong>——'早停的显著结果'不可靠。(4) <strong>Alpha spending(alpha 消耗)</strong>——(a) <strong>做法</strong>——把总的 α(如 0.05)<strong>分配到各次检验</strong>(如 O'Brien-Fleming 边界:早期用很小的 α、后期用较大的 α);(b) <strong>特点</strong>——所有检验的'累积 α'不超过总 α;(c) <strong>优点</strong>——(i) 允许'中期分析'(早停);(ii) 控制总体假阳性率;(d) <strong>变体</strong>——(i) <strong>O'Brien-Fleming</strong>(早期严格、后期宽松——适合'不想早期停');(ii) <strong>Pocock</strong>(各次等 α——适合'想早期停');(iii) <strong>信息时间</strong>(按样本量比例分配 α)。(5) <strong>其他</strong>——(a) <strong>组序贯设计(group sequential)</strong>;(b) <strong>贝叶斯方法</strong>(后验概率而非 p 值);(c) <strong>Always-valid p-values</strong>(任何时间都可看)。<strong>与其他问题的关系</strong>——(a) 与'样本量计算'(同一实验设计框架);(b) 与'护栏指标'(护栏多则需校正);(c) 与'统计显著性'(M5 的评估题)。<strong>实践建议</strong>——(a) <strong>预注册主指标</strong>(避免多重比较);(b) <strong>多指标用 FDR</strong>(比 Bonferroni 宽松);(c) <strong>早停用 alpha spending</strong>(控制假阳性);(d) <strong>不要'无计划地偷看'</strong>;(e) <strong>记录'偷看次数'</strong>(用于校正);(f) <strong>贝叶斯/always-valid</strong>(更灵活的选择)。<strong>度量</strong>——(a) 校正后的显著性;(b) 假阳性率(模拟验证);(c) 功效(校正后的检出力);(d) 早停的可靠性。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'FWER≈1−(1−α)^m'是实用的量化</strong>——10 个指标时约 40%;面试中能给出是深度理解的标志。② <strong>'FDR 比 Bonferroni 宽松'</strong>——适合探索性分析(多指标);Bonferroni 过于保守。③ <strong>'偷看数据推高假阳性'</strong>——这是最常见的实验陷阱;故需 alpha spending。④ <strong>'预注册主指标'是根本解法</strong>——只检验一个主指标则无多重比较问题。⑤ <strong>'O'Brien-Fleming 早期严格'</strong>——适合'不想早期停'的场景;Pocock 相反。⑥ <strong>面试要点</strong>——被问'多指标/早停怎么办',应给出'<strong>FWER 与 FDR + Bonferroni vs FDR + 序贯检验与 alpha spending + 预注册主指标</strong>';能给出'FWER≈1−(1−α)^m'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕多指标不做校正(假阳性)
- ✕无计划地偷看数据并早停(假阳性推高)
🎯 Interviewer Follow-ups
- ?为什么'偷看数据'会推高假阳性?
- ?FDR 与 FWER 的差异?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.