M1-043M1: Mathematics & Statistics FundamentalsHypothesis TestingMedium
Mastery:
Hypothesis Testing: 样本量与功效的关系是什么?写出常用的样本量估算思路。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 样本量与效应量平方成反比;功效分析反解所需 n。
📌 Key Takeaways
- •A/B 上线前必做功效分析,避免'欠功效实验'
- •方差可用历史数据或 CUPED 降低
📐 Mathematical Derivations
推导(两样本均值比较):检验统计量 Z=(X̄_A−X̄_B)/√(2σ²/n),在 H₀ 下 ~N(0,1),在 H₁(真实差异 Δ)下 ~N(Δ/√(2σ²/n), 1)。拒绝域为 |Z|>z_{1−α/2},要求 H₁ 下落入拒绝域的概率 ≥ 1−β,即 (Δ/√(2σ²/n)) − z_{1−α/2} ≥ z_{1−β},解出 n ≥ 2σ²(z_{1−α/2}+z_{1−β})²/Δ²。<strong>核心结论</strong>:n 与效应量 Δ 的<strong>平方</strong>成反比——效应减半,样本量需增至 4 倍;n 与方差 σ² 成正比(方差翻倍,样本量翻倍)。这两个关系决定了实验设计的基本约束:小效应实验极其昂贵。
🏭 Production Trade-offs
实践要点:① <strong>MDE 必须先定</strong>——MDE(最小可检测效应)应由业务价值决定(如'至少提升 0.5% 转化率才值得上线'),而非由样本量倒推;反过来做(先定样本量再问能检出什么)会导致'实验能检出什么就上什么'的荒谬决策。② <strong>降方差等于免费加样本</strong>——由 n∝σ²,方差降低 50% 等价于样本量翻倍;CUPED 用实验前协变量常能降低 30–50% 方差,是工业界最高杠杆的优化。③ <strong>分流比例的影响</strong>——若处理组只占 p 比例,有效样本量下降,最优通常是 50/50(方差在等分时最小),但当处理有风险或成本高时可用不均衡分流。④ <strong>指标类型不同公式不同</strong>——比率型指标(CTR)用 p(1−p) 代替 σ²,计数型需考虑过度离散,重尾指标应改用 bootstrap 或稳健估计。
⚠️ Common Interview Pitfalls
- ✕先定样本量再倒推能检出什么(应由业务价值定 MDE)
- ✕忽视方差降低(CUPED)对样本量的等效替代作用
🎯 Interviewer Follow-ups
- ?最小可检测效应(MDE)怎么定?
- ?为什么要先定 MDE 再算样本量?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.