M1-045M1: Mathematics & Statistics FundamentalsHypothesis TestingHard
Mastery:
Hypothesis Testing: 什么是序贯检验与 peeking 问题?如何正确做序贯实验。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 反复查看并随时停止会极大抬高假阳性;需用 alpha-spending 或 always-valid 方法。
📌 Key Takeaways
- •固定时长实验是简单解法
- •Sequential test / group sequential / mSPRT 允许安全 peeking
📐 Mathematical Derivations
peeking 问题的数学本质:经典假设检验的 α 是<strong>一次性</strong>检验的假阳性率,其推导假设检验只做一次。若在数据累积过程中反复检验并在任一次显著时停止(optional stopping),假阳性率会随检验次数单调上升——对布朗运动式的随机游走,连续监控下的最终假阳性率趋向 <strong>1</strong>(因为随机游走几乎必然会在某个时刻越过任意有限阈值)。直觉上,这相当于把'一次抽样'变成'多次抽样取最大',而最大值的分布远比单次抽样极端。这是 A/B 测试中'跑三天看到显著就上线'的经典陷阱。
🏭 Production Trade-offs
三类正确做法:① <strong>固定时长/固定样本量</strong>——最简单的解法,预先用功效分析定 n,跑满再分析一次;缺点是无法提前止损(若效应明显为负也只能跑完)。② <strong>Group Sequential(分组序贯)</strong>——预先指定 k 次中期分析,用 <strong>alpha-spending</strong> 函数(如 O'Brien-Fleming)分配 α 预算,早期检验用更严阈值(因为早期数据少、波动大),总 α 仍为 0.05。这是临床试验的标准做法。③ <strong>Always-valid 推断</strong>——用 <strong>mSPRT</strong>(混合序贯概率比检验)或 <strong>confidence sequences</strong> 构造在任何停止时刻都有效的置信区间,可随时查看而不失真;代价是区间略宽(功效略低)。补充说明:<strong>贝叶斯 A/B 在一定程度上规避该问题</strong>——后验随数据更新是合法的,P(p_A>p_B) 不会因反复查看而系统性失真(但若用后验做频繁的'上线/不上线'决策仍需考虑预期损失)。
⚠️ Common Interview Pitfalls
- ✕跑几天看到显著就停止(peeking 导致假阳性膨胀)
- ✕认为贝叶斯方法完全无需考虑停止规则
🎯 Interviewer Follow-ups
- ?为什么 peeking 会抬高假阳性?
- ?贝叶斯 A/B 能否规避这个问题?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.