M1-045M1: Mathematics & Statistics FundamentalsHypothesis TestingHard
Mastery:

Hypothesis Testing: 什么是序贯检验与 peeking 问题?如何正确做序贯实验。

📐 Mathematical Definition
alpha spending: α(t) 随累计信息量分配,∑α(t)=α\text{alpha spending}:\ \alpha(t)\ \text{随累计信息量分配,}\sum\alpha(t)=\alpha
⚡ Executive Summary
Core Concept: 反复查看并随时停止会极大抬高假阳性;需用 alpha-spending 或 always-valid 方法。

📌 Key Takeaways

  • •
    固定时长实验是简单解法
  • •
    Sequential test / group sequential / mSPRT 允许安全 peeking

📐 Mathematical Derivations

peeking 问题的数学本质:经典假设检验的 α 是<strong>一次性</strong>检验的假阳性率,其推导假设检验只做一次。若在数据累积过程中反复检验并在任一次显著时停止(optional stopping),假阳性率会随检验次数单调上升——对布朗运动式的随机游走,连续监控下的最终假阳性率趋向 <strong>1</strong>(因为随机游走几乎必然会在某个时刻越过任意有限阈值)。直觉上,这相当于把'一次抽样'变成'多次抽样取最大',而最大值的分布远比单次抽样极端。这是 A/B 测试中'跑三天看到显著就上线'的经典陷阱。

🏭 Production Trade-offs

三类正确做法:① <strong>固定时长/固定样本量</strong>——最简单的解法,预先用功效分析定 n,跑满再分析一次;缺点是无法提前止损(若效应明显为负也只能跑完)。② <strong>Group Sequential(分组序贯)</strong>——预先指定 k 次中期分析,用 <strong>alpha-spending</strong> 函数(如 O'Brien-Fleming)分配 α 预算,早期检验用更严阈值(因为早期数据少、波动大),总 α 仍为 0.05。这是临床试验的标准做法。③ <strong>Always-valid 推断</strong>——用 <strong>mSPRT</strong>(混合序贯概率比检验)或 <strong>confidence sequences</strong> 构造在任何停止时刻都有效的置信区间,可随时查看而不失真;代价是区间略宽(功效略低)。补充说明:<strong>贝叶斯 A/B 在一定程度上规避该问题</strong>——后验随数据更新是合法的,P(p_A>p_B) 不会因反复查看而系统性失真(但若用后验做频繁的'上线/不上线'决策仍需考虑预期损失)。
⚠️ Common Interview Pitfalls
  • ✕
    跑几天看到显著就停止(peeking 导致假阳性膨胀)
  • ✕
    认为贝叶斯方法完全无需考虑停止规则
🎯 Interviewer Follow-ups
  • ?
    为什么 peeking 会抬高假阳性?
  • ?
    贝叶斯 A/B 能否规避这个问题?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-044: Hypothesis Testing: 什么是多重比较问题?常见校正方法有哪些。📋Back to BankNext →M1-046: Confidence Intervals & Bootstrap: 解释置信区间的频率派含义,以及它与 p-value 的关系。