M8-083M8: ML Systems, Engineering & ResearchResearch: Experiment Design & AblationsMedium
Mastery:

Research: Experiment Design & Ablations: 如何做统计功效分析与样本量估计?

📐 Mathematical Definition
n≈2σ2(z1−α/2+z1−β)2δ2n\approx \frac{2\sigma^{2}(z_{1-\alpha/2}+z_{1-\beta})^{2}}{\delta^{2}}
⚡ Executive Summary
Core Concept: 先确定最小可检测效应、显著性水平与目标功效,再反推所需的样本量或随机种子数,避免功效不足导致假阴性或过度实验浪费资源。

📌 Key Takeaways

  • •
    三个输入——最小可检测效应 δ、显著性水平 α、目标功效 1-β
  • •
    功效(power)——真实存在差异时能检测到的概率,常用 0.8
  • •
    样本量——n 随 δ 减小而增大、随 σ 增大而增大
  • •
    在 ML 中——'样本'常为随机种子数/评估样本数/用户数(A/B 实验)
  • •
    预注册——实验前定好协议与假设,避免事后调参

📐 Mathematical Derivations

数学机理:<strong>统计功效分析(power analysis)</strong>——(1) <strong>四个相关量</strong>——(a) <strong>效应量 δ</strong>——希望检测到的最小差异(最小可检测效应 MDE);(b) <strong>显著性水平 α</strong>——假阳性率(通常 0.05);(c) <strong>功效 1-β</strong>——真阳性率(检测到真实差异的概率,常取 0.8);(d) <strong>样本量 n</strong>——四个量中给定三个可求第四个。(2) <strong>样本量公式(两样本均值比较)</strong>——(a) n ≈ 2σ²(z_{1-α/2} + z_{1-β})² / δ²;(b) <strong>含义</strong>——n 与 σ² 成正比(噪声大需更多样本)、与 δ² 成反比(想检测更小的差异需更多样本);(c) z 分位数来自标准正态。(3) <strong>在 ML 实验中的应用</strong>——(a) <strong>'样本'的多种含义</strong>——(i) <strong>随机种子数</strong>——多种子平均降低方差;(ii) <strong>评估集大小</strong>——测试样本越多,指标估计越稳;(iii) <strong>A/B 实验的用户数</strong>——在线实验的样本量;(b) <strong>种子数</strong>——若种子间标准差为 s,想检测差异 δ,则种子数 n ≈ 2s²(z+z)²/δ²。(4) <strong>功效不足的后果</strong>——(a) <strong>假阴性</strong>——真实存在差异却检测不到(结论'无差异'是错的);(b) <strong>浪费</strong>——实验做了但结论不可靠;(c) <strong>对策</strong>——实验前做功效分析,确保 n 足够。(5) <strong>功效过高的代价</strong>——(a) 样本过多 → 检测到<strong>无实际意义</strong>的微小差异(统计显著但效应量小);(b) <strong>故</strong>——同时设定 MDE(最小可检测效应),只关心有实际意义的差异。(6) <strong>A/B 实验的样本量</strong>——(a) <strong>公式扩展</strong>——涉及基线转化率、MDE、α、β、分流比例;(b) <strong>实践</strong>——用在线计算器/工具;(c) <strong>注意</strong>——方差估计、多重比较、新颖效应(novelty effect)会影响实际所需样本。(7) <strong>预注册(pre-registration)</strong>——(a) <strong>做法</strong>——实验前写下假设、指标、样本量、分析计划;(b) <strong>作用</strong>——防止事后挑选有利结果(HARKing)与 p-hacking;(c) <strong>在 ML</strong>——定好协议与种子数。(8) <strong>实践建议</strong>——(a) <strong>先估方差</strong>——用少量种子估计 s;(b) <strong>定 MDE</strong>——基于实际意义(如提升 1% 才值得上线);(c) <strong>算 n</strong>——用公式或工具;(d) <strong>记录</strong>——在论文/报告中说明功效分析。<strong>与其他问题的关系</strong>——(a) 与显著性检验;(b) 与方差处理(σ 的来源);(c) 与在线实验设计(样本量)。<strong>度量</strong>——(a) 功效(1-β);(b) MDE;(c) 实际种子数/样本量 vs 所需。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>功效不足会导致假阴性</strong>——'无差异'的结论可能是样本不够;面试中能指出这点是深度理解的标志。② <strong>n 与 δ² 成反比</strong>——检测更小差异需更多样本(平方关系)。③ <strong>n 与 σ² 成正比</strong>——噪声大需更多样本。④ <strong>同时设 MDE</strong>——避免样本过多检测到无意义的微小差异。⑤ <strong>ML 中'样本'可为种子数或评估样本数</strong>——需明确。⑥ <strong>预注册防 HARKing</strong>——实验前定协议。⑦ <strong>面试要点</strong>——被问怎么定实验规模,应给出'<strong>确定 MDE、α、功效 → 估计方差 σ → 用公式算 n(种子数/评估样本/用户数)→ 预注册协议</strong>';能指出功效不足导致假阴性与 n∝1/δ² 是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    不做功效分析就下'无差异'结论
  • ✕
    只追统计显著而不设 MDE(检测到无意义差异)
🎯 Interviewer Follow-ups
  • ?
    为什么功效不足会导致假阴性?
  • ?
    效应量越小为什么需要越多样本?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM8-082: Research: Experiment Design & Ablations: 如何避免'调参偏向自己方法'的偏差?📋Back to BankNext →M8-084: Research: Experiment Design & Ablations: 如何设计公平的对比协议?