M2-102M2: Classical Machine LearningBias-Variance Tradeoff & Model SelectionMedium
Mastery:
Bias-Variance Tradeoff & Model Selection: 解释模型集成如何影响偏差与方差。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 平均降方差(Bagging);串行纠错降偏差(Boosting);Stacking 可同时降两者但需防泄漏。
📌 Key Takeaways
- •Bagging 不改变偏差(近似),只降方差
- •Boosting 主要降偏差,可能升方差
📐 Mathematical Derivations
三种集成的偏差-方差效果:① <strong>Bagging(并行平均)</strong>——平均 B 个近似独立的模型,方差降为 ρσ²+(1−ρ)σ²/B(ρ 为模型间相关系数),但<strong>偏差近似不变</strong>(因为各模型同偏,平均不能消除系统性偏差)。故 Bagging 适合<strong>高方差低偏差</strong>的基学习器(深树)。② <strong>Boosting(串行纠错)</strong>——每轮拟合前一轮的残差/负梯度,逐步<strong>降低偏差</strong>;但由于模型变得复杂且依赖训练数据,<strong>方差可能上升</strong>(这也是 Boosting 需早停/正则的原因)。适合<strong>低方差高偏差</strong>的基学习器(浅树/决策桩)。③ <strong>Stacking(元学习器组合)</strong>——理论上可同时利用不同模型的偏差与方差特性(元学习器学习'何时信任谁'),故可能同时降两者;但需用 CV 生成元特征防泄漏,且元学习器本身可能过拟合。<strong>集成何时可能变差</strong>:若基学习器<strong>性能差异极大</strong>(如包含一个很差的模型),简单平均会被拖累;若基学习器<strong>高度相关</strong>(ρ→1),Bagging 的降方差收益消失(方差下界 ρσ²);若基学习器<strong>都是高偏差</strong>(如全是线性模型),平均不能降偏差。
🏭 Production Trade-offs
实践要点:① <strong>基学习器的选择原则</strong>——Bagging/RF 用<strong>高方差</strong>模型(深树、未剪枝);Boosting 用<strong>低方差</strong>模型(浅树、决策桩);Stacking 追求<strong>多样性</strong>(不同归纳偏置:树 + 线性 + KNN + 神经网络)。② <strong>相关性的核心作用</strong>——Bagging 的效果由 ρ 决定:特征子采样(RF)、不同初始化、不同数据子集都能降低 ρ;若基学习器相关性高,应主动引入随机性。③ <strong>B 的收益递减</strong>——由于 ρσ² 项不随 B 消失,B 增大收益递减;实践中 B=100–500 通常足够。④ <strong>集成与正则化的关系</strong>——集成是一种'结构性正则',与 L1/L2/dropout 可叠加;但过度集成会欠拟合(尤其 Boosting 轮数过多)。⑤ <strong>Stacking 的泄漏风险</strong>——必须用 K 折 CV 生成元特征(详见 Stacking 题);且元学习器应简单(线性/浅树)。⑥ <strong>实践建议</strong>——先用单一强模型建立基线,再试简单平均(若基模型性能相近常与 Stacking 相当且更简单),最后考虑 Stacking;同时报告<strong>集成的方差</strong>(多种子)以确认提升不是噪声。
⚠️ Common Interview Pitfalls
- ✕用 Bagging 处理高偏差问题(应用 Boosting)
- ✕基学习器高度相关时期待 Bagging 大幅降方差
🎯 Interviewer Follow-ups
- ?为什么 Bagging 不降偏差?
- ?集成何时可能变差?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.