M1-037M1: Mathematics & Statistics Fundamentals估计理论 (MLE/MAP)Easy
Mastery:
估计理论 (MLE/MAP): 定义 MAP 估计,并说明它与 MLE、正则化的关系。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: MAP 最大化后验 = 似然 × 先验;高斯先验的 MAP 等价于 L2 正则,Laplace 先验等价于 L1。
📌 Key Takeaways
- •先验 = 正则项(贝叶斯视角)
- •L2 ← 高斯先验;L1 ← Laplace 先验
- •数据量大时先验影响被稀释,MAP→MLE
📐 Mathematical Derivations
MAP 的推导:θ̂_MAP=argmax p(θ|D)=argmax p(D|θ)p(θ)/p(D)=argmax[log p(D|θ)+log p(θ)](分母与 θ 无关可省)。因此 MAP = MLE + 先验项。<strong>两个经典对应</strong>:① 取高斯先验 p(θ)=N(0, τ²I),则 log p(θ)=−‖θ‖²/(2τ²)+const,MAP 目标变为 log p(D|θ)−λ‖θ‖²,正是 <strong>L2 正则(岭回归/权重衰减)</strong>,λ=1/(2τ²);② 取 Laplace 先验 p(θ)∝exp(−|θ|/b),则 log p(θ)=−‖θ‖₁/b,MAP 目标变为 log p(D|θ)−λ‖θ‖₁,正是 <strong>L1 正则(LASSO)</strong>。这解释了 L1 产生稀疏解与 Laplace 分布在 0 处有尖峰(不可导)的内在联系。
🏭 Production Trade-offs
工程含义与权衡:① <strong>正则化系数 = 先验强度</strong>——λ 大对应先验方差小(强先验/强收缩),λ 小对应弱先验趋近 MLE;这给了调参一个贝叶斯解释,也解释了为什么数据量增加时最优 λ 应减小(先验被数据稀释)。② <strong>MAP vs 贝叶斯最优</strong>——MAP 只取后验的<strong>众数</strong>,丢弃了不确定性;真正的贝叶斯预测需要对后验积分(后验预测分布),在高维下不可解,故工程上退化为 MAP。当后验偏斜或多峰时,众数与均值差异大,MAP 可能给出误导性点估计。③ <strong>MAP 与 MLE 的收敛</strong>——由后验一致性,数据量 N→∞ 时先验项(常数)相对似然项(O(N))可忽略,MAP→MLE,这是'数据够多时正则化不重要'的形式化表述。
⚠️ Common Interview Pitfalls
- ✕把 MAP 当作完整的贝叶斯方法(它丢弃了后验不确定性)
- ✕忽略先验强度与数据量的相对关系
🎯 Interviewer Follow-ups
- ?为什么说'正则化就是加先验'?
- ?MAP 与贝叶斯后验均值的区别?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.