M1-041M1: Mathematics & Statistics FundamentalsHypothesis TestingEasy
Mastery:
Hypothesis Testing: 解释 p-value 的准确含义,并指出最常见的误解。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: p-value = 在原假设为真时,观测到至少如此极端的统计量的概率。它不是'原假设为真的概率'。
📌 Key Takeaways
- •误解:p 不是 H0 为真的概率,也不是效应大小
- •p 小 ≠ 效应大(大样本下微小效应也显著)
- •需与效应量、置信区间一起报告
📐 Mathematical Derivations
p-value 的严格定义:在<strong>原假设 H₀ 成立</strong>的假设下,观测到检验统计量取值<strong>至少与实测值一样极端</strong>的概率。注意三个限定:① 它以 H₀ 为真为前提(是条件概率 P(data|H₀),不是 P(H₀|data));② '至少一样极端'要求明确定义极端的方向(单侧/双侧);③ 它衡量的是数据的稀有程度,不是假设的可信度。最常见的误解是把它当作 P(H₀|data)——这两者的区别正是贝叶斯与频率派的根本分歧,且由贝叶斯定理,P(H₀|data) 还依赖<strong>先验</strong> P(H₀),两个量可以差别极大(基率谬误)。
🏭 Production Trade-offs
三个实践要点:① <strong>p 小不等于效应大</strong>——p 值同时受效应量与样本量影响,n 极大时即使效应微小(如 CTR 提升 0.01%)也能得到极小的 p 值;因此必须同时报告<strong>效应量与置信区间</strong>,这也是近年'超越 p<0.05'(ASA 声明、Nature 评论)的核心主张。② <strong>不显著 ≠ 无效应</strong>——可能是功效不足(样本太小);正确表述是'没有足够证据拒绝 H₀'而非'证明 H₀ 成立'。③ <strong>p 值的误用</strong>——p-hacking(多重比较后只报显著的)、可选停止(peeking)、HARKing(看到结果再编假设)都会使 p 值失真;缓解是预注册分析计划、多重比较校正、序贯检验方法。在 A/B 测试中,p 值应配合护栏指标与业务显著性(最小可检测效应 MDE)一起解读。
⚠️ Common Interview Pitfalls
- ✕把 p 值解释为'原假设为真的概率'
- ✕用 p 值大小判断效应大小
🎯 Interviewer Follow-ups
- ?p=0.04,α=0.05,你的结论是什么?
- ?为什么'不显著'不等于'无效应'?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.