返回 DS 数据科学家 思维导图
中文·English
📈 DS 数据科学家ID: ds-p-hacking-peeking-msprt

P-hacking 偷窥与序贯检验 mSPRT

P-hacking, Peeking & mSPRT Sequential
🎯核心定义
连续监控偷窥问题导致的第一类错误严重膨胀 (Continuous Monitoring / Peeking Problem & False-Positive Inflation) 与基于鞅论的混合序贯概率比检验 (Mixture Sequential Probability Ratio Test, mSPRT) 是现代工业 A/B 实验平台防御 P-hacking、实现合法“随时查看随时早停”的核心统计学理论;偷窥陷阱定理:如果在实验运行期间每天反复查看 pp 值并在 p<0.05p < 0.05 时立即提前终止实验,即使在零假设 H0H_0(完全无效果)下,累积假阳性率会在 30 天内从标称的 5% 剧烈膨胀至 30%~40% 以上;防御方案:1) 预注册固定样本量停止规则 (Fixed Horizon Testing: 严格禁止提前下结论);2) 序贯检验界限 (Group Sequential Design: O'Brien-Fleming / Pocock 边界调整);3) 连续序贯检验 (mSPRT / 沃尔德序贯检验在鞅测度下的扩展): 构造时刻有效的检验统计量与置信序列 (Always-valid pp-values & Confidence Sequences),在保证族错误率 α\le \alpha 前提下支持实时早停。
💡使用场景
顶级科技公司(Netflix, Uber, Airbnb, 字节跳动)A/B 实验平台实时告警监控、高风险业务功能快速止损。
解决的核心痛点
业务团队喜欢天天盯着看仪表盘,一看到 p<0.05p < 0.05 就兴奋上线导致大量假突破;mSPRT 与序贯检验从数学上消除了偷窥带来的假阳性膨胀。
🎯5 个高频面试考点 (Exam Points)
1
数学推导为什么布朗运动 (Brownian Motion) 的首达时间 (First Hitting Time) 会导致连续偷窥下的累积第一类错误随时间单调递增逼近 100%?
2
详细推导 mSPRT (Mixture Sequential Probability Ratio Test) 中利用非负鞅 (Non-negative Martingale) 与 Doob 最大值不等式控制总体错误率 α\le \alpha 的数学证明?
3
Alpha-Spending 函数 (Lan-DeMets α\alpha-spending / O'Brien-Fleming): 如何在预先设定的 KK 个检查节点上动态分配 α\alpha 预算?
4
恒有效置信区间 (Always-Valid Confidence Intervals): 为什么其区间宽度随时间样本量增加逐渐收敛,且在任意停时 (Stopping Time τ\tau) 下覆盖真实效应的概率恒 1α\ge 1-\alpha
5
工业权衡:在业务实际中,什么时候应选用 mSPRT 序贯检验(如严重指标下跌快速止损),什么时候应坚持固定周期双周实验(如留存类长效指标)?
更新于 2026-08-14
🎯
检验攻克程度:针对「P-hacking 偷窥与序贯检验 mSPRT」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点样本量公式严格推导与 MDE 估算下一个知识点多重比较校正:Bonferroni vs FDR

🔗 更多 DS 数据科学家 知识点卡片

假设检验、两类错误与功效权衡Bootstrap 非参数重采样与置信区间CUPED 方差缩减严格数学推导样本比例失衡 SRM 卡方检测排查