返回 DS 数据科学家 思维导图
中文·English
📈 DS 数据科学家ID: ds-hypothesis-testing-power-analysis

假设检验、两类错误与功效权衡

Hypothesis Testing, Type I/II & Power
🎯核心定义
现代统计推断假设检验体系、两类错误概率与统计功效严格数学权衡 (Statistical Hypothesis Testing, Type I/II Errors & Statistical Power Analysis) 是数据科学家 (DS) 设计任何线上 A/B 实验或业务决策时的核心理论基石;假设设定:原假设 H0H_0(新策略无真实效果,Δ=0\Delta = 0)与备择假设 H1H_1(新策略有显著效果,Δ0\Delta \neq 0);两类决策风险:1) 第一类错误 (Type I Error / α\alpha, 假阳性弃真): 真实无效果却误判为显著,工业界标准设定为 α=0.05\alpha = 0.05;2) 第二类错误 (Type II Error / β\beta, 假阴性存伪): 真实有效果却未能检测出来;3) 统计功效 (Statistical Power =1β= 1 - \beta): 在备择假设成立时成功拒绝原假设的概率,工业界标准设定为 Power0.80\text{Power} \ge 0.80 (或 0.900.90);通过 ZZ 检验或双样本 tt 检验统计量构建对称决策阈值,平衡产品迭代速度与避免错误上线的业务风险。
💡使用场景
工业级 A/B 实验方案设计、DS 经典统计学第一轮技术面试、科学决策风控体系搭建。
解决的核心痛点
业务团队盲目上线无意义功能或由于实验样本量不足错失真正带来数千万增量的好策略;统计功效分析在数学层面保证了实验决策的高信度与高召回。
🎯5 个高频面试考点 (Exam Points)
1
现场画出 H0H_0 零假设分布曲线与 H1H_1 备择假设分布曲线,并用阴影准确标出 α/2\alpha/2β\betaPower=1β\text{Power} = 1 - \beta 的几何区域?
2
单尾检验 (One-Tailed Test) vs 双尾检验 (Two-Tailed Test): 为什么在大多数产品 A/B 测试中即使预期是正向提升也必须坚持使用双尾检验?
3
效应量 (Effect Size / Cohen's d=μTμCσpooledd = \frac{\mu_T - \mu_C}{\sigma_{\text{pooled}}}) 与统计显著性 (p<0.05p < 0.05) 的本质区别:为什么在大样本下极微小的无业务意义波动也会 pp 值显著?
4
独立双样本 tt 检验 (Student's tt) 与 Welch's tt 检验:当实验组与对照组样本量不相等或方差齐性不满足时,为什么应默认选择 Welch's tt 检验?
5
比率类指标 (如点击率 CTR / 转化率 CVR) 的卡方检验 (χ2\chi^2 Test) 与双样本比例 ZZ 检验的渐近等价性证明?
🔗核心前置底层技术卡片 (点击穿透复习)
更新于 2026-08-14
🎯
检验攻克程度:针对「假设检验、两类错误与功效权衡」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
下一个知识点样本量公式严格推导与 MDE 估算

🔗 更多 DS 数据科学家 知识点卡片

P-hacking 偷窥与序贯检验 mSPRT多重比较校正:Bonferroni vs FDRBootstrap 非参数重采样与置信区间CUPED 方差缩减严格数学推导