M1-002M1: Mathematics & Statistics FundamentalsProbability FoundationsEasy
Mastery:
Probability Foundations: 写出贝叶斯定理,并说明先验、似然、后验各自的角色。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 后验 ∝ 似然 × 先验;先验编码已有信念,似然由数据提供,后验是更新后的信念。
📌 Key Takeaways
- •分母 P(D) 是归一化常数(证据)
- •共轭先验使后验与先验同族,可解析更新
- •MAP = 取后验众数;MLE = 取似然众数(等价于均匀先验)
📐 Mathematical Derivations
贝叶斯定理把'学习'形式化为信念更新:posterior ∝ likelihood × prior。三个量的角色清晰可分——<strong>先验 p(θ)</strong> 编码在看到数据前对参数的信念(正则化/领域知识的载体);<strong>似然 p(D|θ)</strong> 由数据与生成模型假设决定,是唯一与数据相关的项;<strong>后验 p(θ|D)</strong> 是二者的乘积再归一化。分母 p(D)=∫p(D|θ)p(θ)dθ 与 θ 无关,因此常被省略为比例式。关键性质:数据量增加时,似然项的对数随 N 线性增长而先验固定,故先验影响被逐渐稀释,后验趋向 MLE——这是'数据够多时正则化不重要'的形式化表述。共轭先验(Beta-Bernoulli、Dirichlet-Multinomial、Normal-Normal)使后验与先验同族,可解析更新,是 A/B 测试中 Thompson Sampling 的基础。
🏭 Production Trade-offs
两个易被追问的区分:① <strong>MAP 不是'贝叶斯最优'</strong>——MAP 只取后验众数一个点,丢弃了后验的不确定性;贝叶斯决策理论要求对后验做积分得到后验预测分布 p(y|x,D)=∫p(y|x,θ)p(θ|D)dθ,这在高维下不可解,故工程上退化为 MAP(等价于加正则的 MLE)。② <strong>先验的选择是主观的但可检验</strong>——弱信息先验(如 Jeffreys 先验)尽量减少主观影响;若后验对先验敏感,说明数据信息不足,应报告先验敏感性分析。
⚠️ Common Interview Pitfalls
- ✕把后验分布与后验预测分布混淆(前者关于参数,后者关于新数据)
- ✕认为 MAP 就是贝叶斯方法——它丢失了不确定性量化
🎯 Interviewer Follow-ups
- ?为什么说 MAP 不是'贝叶斯最优'?
- ?预测分布与后验分布的区别是什么?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.