M1-037M1: Mathematics & Statistics Fundamentals估计理论 (MLE/MAP)Easy
Mastery:

估计理论 (MLE/MAP): 定义 MAP 估计,并说明它与 MLE、正则化的关系。

📐 Mathematical Definition
θ^MAP=arg⁡max⁡θ[log⁡p(D∣θ)+log⁡p(θ)]\hat\theta_{MAP}=\arg\max_\theta\big[\log p(D\mid\theta)+\log p(\theta)\big]
⚡ Executive Summary
Core Concept: MAP 最大化后验 = 似然 × 先验;高斯先验的 MAP 等价于 L2 正则,Laplace 先验等价于 L1。

📌 Key Takeaways

  • •
    先验 = 正则项(贝叶斯视角)
  • •
    L2 ← 高斯先验;L1 ← Laplace 先验
  • •
    数据量大时先验影响被稀释,MAP→MLE

📐 Mathematical Derivations

MAP 的推导:θ̂_MAP=argmax p(θ|D)=argmax p(D|θ)p(θ)/p(D)=argmax[log p(D|θ)+log p(θ)](分母与 θ 无关可省)。因此 MAP = MLE + 先验项。<strong>两个经典对应</strong>:① 取高斯先验 p(θ)=N(0, τ²I),则 log p(θ)=−‖θ‖²/(2τ²)+const,MAP 目标变为 log p(D|θ)−λ‖θ‖²,正是 <strong>L2 正则(岭回归/权重衰减)</strong>,λ=1/(2τ²);② 取 Laplace 先验 p(θ)∝exp(−|θ|/b),则 log p(θ)=−‖θ‖₁/b,MAP 目标变为 log p(D|θ)−λ‖θ‖₁,正是 <strong>L1 正则(LASSO)</strong>。这解释了 L1 产生稀疏解与 Laplace 分布在 0 处有尖峰(不可导)的内在联系。

🏭 Production Trade-offs

工程含义与权衡:① <strong>正则化系数 = 先验强度</strong>——λ 大对应先验方差小(强先验/强收缩),λ 小对应弱先验趋近 MLE;这给了调参一个贝叶斯解释,也解释了为什么数据量增加时最优 λ 应减小(先验被数据稀释)。② <strong>MAP vs 贝叶斯最优</strong>——MAP 只取后验的<strong>众数</strong>,丢弃了不确定性;真正的贝叶斯预测需要对后验积分(后验预测分布),在高维下不可解,故工程上退化为 MAP。当后验偏斜或多峰时,众数与均值差异大,MAP 可能给出误导性点估计。③ <strong>MAP 与 MLE 的收敛</strong>——由后验一致性,数据量 N→∞ 时先验项(常数)相对似然项(O(N))可忽略,MAP→MLE,这是'数据够多时正则化不重要'的形式化表述。
⚠️ Common Interview Pitfalls
  • ✕
    把 MAP 当作完整的贝叶斯方法(它丢弃了后验不确定性)
  • ✕
    忽略先验强度与数据量的相对关系
🎯 Interviewer Follow-ups
  • ?
    为什么说'正则化就是加先验'?
  • ?
    MAP 与贝叶斯后验均值的区别?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-036: 估计理论 (MLE/MAP): 定义最大似然估计(MLE),并给出一个完整例子。📋Back to BankNext →M1-038: 估计理论 (MLE/MAP): 解释偏差-方差分解,并写出期望泛化误差的分解式。