M1-038M1: Mathematics & Statistics Fundamentals估计理论 (MLE/MAP)Medium
Mastery:
估计理论 (MLE/MAP): 解释偏差-方差分解,并写出期望泛化误差的分解式。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 期望误差 = 偏差² + 方差 + 不可约噪声;模型复杂度上升降低偏差但抬高方差。
📌 Key Takeaways
- •诊断:训练误差高→高偏差;验证误差远高于训练→高方差
- •缓解:正则/更多数据/降复杂度(方差);更复杂模型/更多特征(偏差)
📐 Mathematical Derivations
推导:设 y=f(x)+ε,E[ε]=0、Var[ε]=σ²,则 E[(y−f̂)²]=E[(f−f̂)²]+σ²。再把 E[(f−f̂)²] 展开为 E[(f̂−E[f̂])²]+(E[f̂]−f)²——前项是<strong>方差</strong>(估计随训练集变化的波动),后项是<strong>偏差²</strong>(平均预测与真实函数的系统性偏离)。因此期望泛化误差 = 偏差² + 方差 + 不可约噪声 σ²。第三项 σ² 与模型无关,是问题的下界。<strong>核心权衡</strong>:模型复杂度上升时,拟合能力增强使偏差下降,但对训练数据更敏感使方差上升——两者相加形成 U 型曲线,最优复杂度在 U 的谷底。
🏭 Production Trade-offs
诊断与对策的对应关系:① <strong>高偏差</strong>(训练与验证误差都高且接近)——增加模型容量、增加有用特征、减少正则、训练更久;② <strong>高方差</strong>(训练低、验证高,差距大)——增加数据、加强正则、降低复杂度、集成(Bagging)、早停。<strong>Bagging 降方差、Boosting 降偏差</strong>正是这一分解的直接应用:Bagging 对高方差低偏差模型(深树)做平均,把方差降为 ρσ²+(1−ρ)σ²/B;Boosting 串行拟合残差,逐步降低偏差。<strong>为什么更多数据主要降方差</strong>:偏差由模型族决定(数据量不影响其系统性偏离),而方差 ∝ 1/n,故增加数据直接降低方差项;若模型族本身无法表达真函数(高偏差),加数据无济于事——这是'数据不能解决一切'的理论依据。
⚠️ Common Interview Pitfalls
- ✕认为增加数据能解决高偏差问题
- ✕忽略不可约噪声(σ²)作为性能下界
🎯 Interviewer Follow-ups
- ?Bagging 与 Boosting 分别作用于哪一项?
- ?为什么'更多数据'主要降方差?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.