M1-050M1: Mathematics & Statistics FundamentalsConfidence Intervals & BootstrapHard
Mastery:
Confidence Intervals & Bootstrap: 如何用 bootstrap 做 A/B 测试的显著性判断?有什么坑。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 对两组分别重采样,计算差值分布的分位数;坑:重尾、极小样本、多重指标、重复抽样需固定随机种子。
📌 Key Takeaways
- •差值法比分别构造 CI 再比较更正确
- •计算成本高,需缓存/并行
- •不能替代实验设计(功效/分流/污染)
📐 Mathematical Derivations
正确做法:① 对 A、B 两组<strong>分别</strong>做有放回重采样(各 n_A、n_B 次);② 每次计算统计量差值 Δ*_b=stat(A*_b)−stat(B*_b)(注意是<strong>差值分布</strong>,而非分别构造两个 CI);③ 取 Δ* 分布的分位数作为差值的置信区间,或计算 P(Δ*>0)(单侧)与 (1+min(2P(Δ*≤0), 2P(Δ*≥0)))(双侧 p 值)。<strong>关键点:必须对差值做 bootstrap</strong>,因为两组独立时 Var(A−B)=Var(A)+Var(B),而'分别构造 CI 再比较'会忽略协方差且无法给出差值的精确区间——这正是'两个 CI 重叠但不显著'这一常见困惑的根源(CI 重叠与否是比显著性检验<strong>更保守</strong>的判据)。
🏭 Production Trade-offs
四个必须注意的坑:① <strong>重尾指标</strong>——点击/消费/延迟类指标重尾,bootstrap 方差估计不稳定,应先做 CUPED 降方差或对指标做截断(winsorize),并增大 B;② <strong>极小样本/稀有事件</strong>——若某组转化数极少(如 <10),bootstrap 分布严重离散,分位数估计粗糙,此时应改用精确检验(Fisher 精确检验)或贝叶斯方法(Beta-Binomial);③ <strong>分层与配对结构</strong>——若实验采用分层随机化或配对设计,bootstrap 必须在层内/对内进行(stratified bootstrap),否则会低估方差;④ <strong>计算成本与可复现性</strong>——B=10000 时对 10⁸ 用户做重采样代价高昂,实践中常用<strong>泊松 bootstrap</strong>(对每个用户的贡献乘独立泊松权重)或对聚合统计量做 bootstrap;同时必须固定随机种子以保证结果可复现,并注意多次实验的随机种子不应重复使用。
⚠️ Common Interview Pitfalls
- ✕分别构造两组 CI 后比较是否重叠
- ✕对稀有事件(转化数极少)直接用 bootstrap
🎯 Interviewer Follow-ups
- ?为什么不能用'两个 CI 重叠与否'判断显著性?
- ?bootstrap 与 delta method 的取舍?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.