M1-042M1: Mathematics & Statistics FundamentalsHypothesis TestingEasy
Mastery:

Hypothesis Testing: 定义第一类错误、第二类错误、显著性水平与功效。

📐 Mathematical Definition
α=Pr⁡(reject∣H0),power=1−β=Pr⁡(reject∣H1)\alpha=\Pr(\text{reject}\mid H_0),\quad \text{power}=1-\beta=\Pr(\text{reject}\mid H_1)
⚡ Executive Summary
Core Concept: α = 弃真概率;β = 取伪概率;功效 = 1-β = 正确检出真实效应的概率。

📌 Key Takeaways

  • •
    功效随效应量、样本量、α 上升
  • •
    常规要求 power ≥ 0.8

📐 Mathematical Derivations

两类错误的完整对照:<strong>第一类错误(弃真)</strong>——H₀ 为真却拒绝了它,概率为 α(显著性水平),这是'误报';<strong>第二类错误(取伪)</strong>——H₁ 为真却未拒绝 H₀,概率为 β,这是'漏报'。功效 power=1−β 是正确检出真实效应的概率。四者的关系可写成 2×2 表:判决/真相的组合中,正确拒绝的概率是 power,正确不拒绝的概率是 1−α。关键性质:<strong>固定 n 时 α 与 β 反向变动</strong>(降低 α 会抬高 β);要同时降低两者只能增大样本量或效应量。

🏭 Production Trade-offs

实践要点:① <strong>功效分析的四个输入</strong>——显著性水平 α、期望功效(通常 0.8)、效应量(MDE,最小可检测效应)、方差 σ²;给定其中三个可解出第四个(通常是样本量 n)。A/B 测试上线前必须做功效分析,否则可能跑了一个注定检不出效果的实验。② <strong>功效不足的严重后果</strong>——低功效实验不仅容易漏掉真实效应,还会使<strong>已检出的显著结果被高估</strong>('winner's curse'):在低功效下,只有效应量被随机高估的样本才能越过显著性阈值,故观测到的效应系统性偏大,这解释了为什么很多小样本研究的效应无法被大样本复现。③ <strong>多重比较的放大</strong>——同时检验 m 个假设时,至少一次假阳性的概率为 1−(1−α)^m,m=20 时达 64%,故需 Bonferroni(控制 FWER)或 BH(控制 FDR)校正。
⚠️ Common Interview Pitfalls
  • ✕
    认为 α 与 β 可以同时任意降低(需增大样本量)
  • ✕
    忽略低功效导致的效应量高估(winner's curse)
🎯 Interviewer Follow-ups
  • ?
    功效分析的四个输入是什么?
  • ?
    为什么功效不足会导致'显著的结果不可靠'?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-041: Hypothesis Testing: 解释 p-value 的准确含义,并指出最常见的误解。📋Back to BankNext →M1-043: Hypothesis Testing: 样本量与功效的关系是什么?写出常用的样本量估算思路。