M2-025M2: Classical Machine LearningDecision TreesMedium
Mastery:
Decision Trees: 解释树的偏差-方差特性,以及为什么单棵树容易过拟合。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 深树低偏差高方差(对训练数据扰动敏感);浅树高偏差低方差。
📌 Key Takeaways
- •这是 Bagging 降方差的动机
- •剪枝 = 在偏差与方差间折中
📐 Mathematical Derivations
树的偏差-方差随深度的变化:<strong>浅树</strong>(如深度 1 的决策桩)只能表达极简单的规则,偏差高、方差低——无论数据怎么扰动,结构都差不多。<strong>深树</strong>能完美拟合训练数据(偏差→0),但结构对数据极度敏感:若训练集中某个样本不同,可能改变早期分裂从而改变整棵树的下游结构——这是<strong>高方差</strong>的根源。极端情形是完全生长的树(每个叶一个样本),训练误差为 0 但泛化极差。<strong>为什么对扰动敏感</strong>:分裂是<strong>贪心且离散</strong>的选择——阈值附近的样本微小变动可能翻转分裂方向,而该分裂决定了后续所有子树,误差被放大。这与线性模型(参数连续变化)形成对比。
🏭 Production Trade-offs
实践启示:① <strong>随机森林用深树</strong>——因为 Bagging 通过平均多个不相关的深树来<strong>降方差</strong>(方差降为 ρσ²+(1−ρ)σ²/B),故保留深树的低偏差同时降低方差;② <strong>GBDT 用浅树</strong>(深度 3–6)——因为 Boosting 是串行降偏差,浅树提供弱学习器,若用深树则每棵都过拟合、且串行放大误差;③ <strong>剪枝的本质</strong>——在偏差与方差间选折中点,代价复杂度参数 α 控制该折中;④ <strong>与集成的关系</strong>——树的'高方差'不是缺点而是被利用的特性:Bagging 需要基学习器高方差(才有降方差空间),Boosting 需要基学习器低方差高偏差(才能稳定地逐步改进)。这也解释了为什么树是两类集成方法的首选基学习器。
⚠️ Common Interview Pitfalls
- ✕认为深树总是更好(忽略方差爆炸)
- ✕在 Boosting 中使用完全生长的深树
🎯 Interviewer Follow-ups
- ?为什么随机森林用深树?
- ?为什么 GBDT 用浅树?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.