M1-002M1: Mathematics & Statistics FundamentalsProbability FoundationsEasy
Mastery:

Probability Foundations: 写出贝叶斯定理,并说明先验、似然、后验各自的角色。

📐 Mathematical Definition
P(θ∣D)=P(D∣θ)P(θ)P(D),posterior∝likelihood×priorP(\theta\mid D)=\frac{P(D\mid\theta)P(\theta)}{P(D)},\qquad \text{posterior}\propto\text{likelihood}\times\text{prior}
⚡ Executive Summary
Core Concept: 后验 ∝ 似然 × 先验;先验编码已有信念,似然由数据提供,后验是更新后的信念。

📌 Key Takeaways

  • •
    分母 P(D) 是归一化常数(证据)
  • •
    共轭先验使后验与先验同族,可解析更新
  • •
    MAP = 取后验众数;MLE = 取似然众数(等价于均匀先验)

📐 Mathematical Derivations

贝叶斯定理把'学习'形式化为信念更新:posterior ∝ likelihood × prior。三个量的角色清晰可分——<strong>先验 p(θ)</strong> 编码在看到数据前对参数的信念(正则化/领域知识的载体);<strong>似然 p(D|θ)</strong> 由数据与生成模型假设决定,是唯一与数据相关的项;<strong>后验 p(θ|D)</strong> 是二者的乘积再归一化。分母 p(D)=∫p(D|θ)p(θ)dθ 与 θ 无关,因此常被省略为比例式。关键性质:数据量增加时,似然项的对数随 N 线性增长而先验固定,故先验影响被逐渐稀释,后验趋向 MLE——这是'数据够多时正则化不重要'的形式化表述。共轭先验(Beta-Bernoulli、Dirichlet-Multinomial、Normal-Normal)使后验与先验同族,可解析更新,是 A/B 测试中 Thompson Sampling 的基础。

🏭 Production Trade-offs

两个易被追问的区分:① <strong>MAP 不是'贝叶斯最优'</strong>——MAP 只取后验众数一个点,丢弃了后验的不确定性;贝叶斯决策理论要求对后验做积分得到后验预测分布 p(y|x,D)=∫p(y|x,θ)p(θ|D)dθ,这在高维下不可解,故工程上退化为 MAP(等价于加正则的 MLE)。② <strong>先验的选择是主观的但可检验</strong>——弱信息先验(如 Jeffreys 先验)尽量减少主观影响;若后验对先验敏感,说明数据信息不足,应报告先验敏感性分析。
⚠️ Common Interview Pitfalls
  • ✕
    把后验分布与后验预测分布混淆(前者关于参数,后者关于新数据)
  • ✕
    认为 MAP 就是贝叶斯方法——它丢失了不确定性量化
🎯 Interviewer Follow-ups
  • ?
    为什么说 MAP 不是'贝叶斯最优'?
  • ?
    预测分布与后验分布的区别是什么?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-001: Probability Foundations: 解释条件概率与全概率公式,并说明为什么它是一切贝叶斯方法的基础。📋Back to BankNext →M1-003: Probability Foundations: 什么是独立与条件独立?为什么朴素贝叶斯'错得离谱却常常好用'?