M1-038M1: Mathematics & Statistics Fundamentals估计理论 (MLE/MAP)Medium
Mastery:

估计理论 (MLE/MAP): 解释偏差-方差分解,并写出期望泛化误差的分解式。

📐 Mathematical Definition
E[(y−f^)2]=Bias2[f^]+Var[f^]+σ2\mathbb E[(y-\hat f)^2]=\mathrm{Bias}^2[\hat f]+\mathrm{Var}[\hat f]+\sigma^2
⚡ Executive Summary
Core Concept: 期望误差 = 偏差² + 方差 + 不可约噪声;模型复杂度上升降低偏差但抬高方差。

📌 Key Takeaways

  • •
    诊断:训练误差高→高偏差;验证误差远高于训练→高方差
  • •
    缓解:正则/更多数据/降复杂度(方差);更复杂模型/更多特征(偏差)

📐 Mathematical Derivations

推导:设 y=f(x)+ε,E[ε]=0、Var[ε]=σ²,则 E[(y−f̂)²]=E[(f−f̂)²]+σ²。再把 E[(f−f̂)²] 展开为 E[(f̂−E[f̂])²]+(E[f̂]−f)²——前项是<strong>方差</strong>(估计随训练集变化的波动),后项是<strong>偏差²</strong>(平均预测与真实函数的系统性偏离)。因此期望泛化误差 = 偏差² + 方差 + 不可约噪声 σ²。第三项 σ² 与模型无关,是问题的下界。<strong>核心权衡</strong>:模型复杂度上升时,拟合能力增强使偏差下降,但对训练数据更敏感使方差上升——两者相加形成 U 型曲线,最优复杂度在 U 的谷底。

🏭 Production Trade-offs

诊断与对策的对应关系:① <strong>高偏差</strong>(训练与验证误差都高且接近)——增加模型容量、增加有用特征、减少正则、训练更久;② <strong>高方差</strong>(训练低、验证高,差距大)——增加数据、加强正则、降低复杂度、集成(Bagging)、早停。<strong>Bagging 降方差、Boosting 降偏差</strong>正是这一分解的直接应用:Bagging 对高方差低偏差模型(深树)做平均,把方差降为 ρσ²+(1−ρ)σ²/B;Boosting 串行拟合残差,逐步降低偏差。<strong>为什么更多数据主要降方差</strong>:偏差由模型族决定(数据量不影响其系统性偏离),而方差 ∝ 1/n,故增加数据直接降低方差项;若模型族本身无法表达真函数(高偏差),加数据无济于事——这是'数据不能解决一切'的理论依据。
⚠️ Common Interview Pitfalls
  • ✕
    认为增加数据能解决高偏差问题
  • ✕
    忽略不可约噪声(σ²)作为性能下界
🎯 Interviewer Follow-ups
  • ?
    Bagging 与 Boosting 分别作用于哪一项?
  • ?
    为什么'更多数据'主要降方差?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-037: 估计理论 (MLE/MAP): 定义 MAP 估计,并说明它与 MLE、正则化的关系。📋Back to BankNext →M1-039: 估计理论 (MLE/MAP): 什么是一致性与有效性?MLE 具备这两个性质吗。