M8-080M8: ML Systems, Engineering & ResearchResearch: Experiment Design & AblationsMedium
Mastery:

Research: Experiment Design & Ablations: 如何做显著性检验与效应量报告?

📐 Mathematical Definition
t=dˉsd/n;effect=dˉs;CI=dˉ±t∗sdnt=\frac{\bar d}{s_d/\sqrt n};\qquad \text{effect}=\frac{\bar d}{s};\qquad \text{CI}=\bar d\pm t^{*}\frac{s_d}{\sqrt n}
⚡ Executive Summary
Core Concept: 用配对检验、置信区间与多次种子报告均值±标准差,同时报告效应量(相对/绝对提升)与 p 值,避免只看 p 值而忽略实际意义。

📌 Key Takeaways

  • •
    配对设计——同一数据/种子下比较两方法(配对检验比独立检验更敏感)
  • •
    检验方法——配对 t 检验(近似正态)、Wilcoxon(非参)、bootstrap 置信区间
  • •
    报告内容——均值±标准差、置信区间、p 值、效应量(Cohen's d)
  • •
    效应量——区分统计显著与实际重要(大 n 下微小差异也可显著)
  • •
    多重比较——多组比较需 Bonferroni/FDR 校正,避免假阳性

📐 Mathematical Derivations

数学机理:<strong>显著性检验与效应量</strong>——(1) <strong>假设检验基础</strong>——(a) <strong>零假设 H0</strong>——两方法无差异;(b) <strong>p 值</strong>——在 H0 下观察到当前或更极端结果的概率;(c) <strong>显著性水平 α</strong>——通常 0.05;(d) <strong>拒绝 H0</strong>——p < α 时认为差异显著。(2) <strong>配对设计</strong>——(a) <strong>原理</strong>——同一数据划分/种子下比较两方法,差异 d_i 配对;(b) <strong>优势</strong>——消除数据/种子带来的共同方差,<strong>更敏感</strong>(统计功效更高);(c) <strong>检验</strong>——配对 t 检验:t = d̄ / (s_d/√n);(d) <strong>注意</strong>——需配对(同种子/同划分)才能用。(3) <strong>非参数方法</strong>——(a) <strong>Wilcoxon 符号秩</strong>——不假设正态;(b) <strong>bootstrap</strong>——重采样估计差异的置信区间(分布无关);(c) <strong>适用</strong>——指标分布偏斜或样本少时。(4) <strong>置信区间</strong>——(a) CI = d̄ ± t*·s_d/√n;(b) <strong>优势</strong>——比 p 值信息更丰富(给出效应范围);(c) <strong>判断</strong>——CI 不包含 0 则显著;CI 宽度反映不确定性。(5) <strong>效应量(effect size)</strong>——(a) <strong>Cohen's d</strong>——d = d̄/s(标准化均值差);(b) <strong>相对提升</strong>——(新-旧)/旧;(c) <strong>绝对提升</strong>——新-旧(百分点);(d) <strong>作用</strong>——衡量<strong>实际重要性</strong>;(e) <strong>判据</strong>——d=0.2 小、0.5 中、0.8 大(经验);(f) <strong>关键</strong>——大样本下微小差异也可显著,故必须看效应量。(6) <strong>统计功效(power)</strong>——(a) 定义——真实存在差异时检测到它的概率(1-β);(b) <strong>影响因素</strong>——效应量、样本量、α、方差;(c) <strong>功效不足</strong>——导致假阴性(真实差异未检出);(d) <strong>对策</strong>——先做功效分析定样本量。(7) <strong>多重比较问题</strong>——(a) 比较 k 组会累积假阳性(k=10 时至少一个假阳性的概率约 40%);(b) <strong>校正</strong>——Bonferroni(α/k)、FDR(Benjamini-Hochberg);(c) <strong>或</strong>——预设少数关键比较。(8) <strong>报告规范</strong>——(a) 均值 ± 标准差(多次运行);(b) 置信区间;(c) p 值与检验方法;(d) 效应量(相对与绝对);(e) 样本量/种子数;(f) <strong>不要</strong>只报 p 值或只报'显著提升'。<strong>与其他问题的关系</strong>——(a) 与实验方差来源;(b) 与消融实验;(c) 与功效分析。<strong>度量</strong>——(a) p 值/置信区间;(b) 效应量(d、相对/绝对提升);(c) 统计功效;(d) 种子数。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>只看 p 值是常见错误</strong>——大样本下微小差异也显著;面试中能指出这点是深度理解的标志。② <strong>配对检验更敏感</strong>——利用同种子/同划分消除共同方差。③ <strong>置信区间比 p 值信息更丰富</strong>——应优先报告。④ <strong>效应量衡量实际重要性</strong>——必须报告相对与绝对提升。⑤ <strong>功效不足导致假阴性</strong>——需先做功效分析。⑥ <strong>多重比较需校正</strong>——否则假阳性累积。⑦ <strong>面试要点</strong>——被问怎么报告实验差异,应给出'<strong>配对检验 + 置信区间 + 均值±标准差 + 效应量(相对/绝对)+ 多重比较校正 + 预先功效分析</strong>';能指出只看 p 值与配对检验的优势是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    只报 p 值不报效应量
  • ✕
    多组比较不做多重比较校正
🎯 Interviewer Follow-ups
  • ?
    为什么配对检验比独立检验更敏感?
  • ?
    统计显著但效应量很小意味着什么?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM8-079: Research: Experiment Design & Ablations: 如何确定实验的 baseline?📋Back to BankNext →M8-081: Research: Experiment Design & Ablations: 如何处理实验中的方差来源?