M2-024M2: Classical Machine LearningDecision TreesMedium
Mastery:
Decision Trees: 决策树为什么不需要特征缩放?它的归纳偏置是什么。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 分裂基于阈值比较,对单调变换不敏感;归纳偏置是轴平行分割,难以建模线性/旋转关系。
📌 Key Takeaways
- •对异常值较鲁棒
- •轴平行边界 → 线性关系需很多阶梯近似
📐 Mathematical Derivations
不需要缩放的原因:分裂条件形如 xⱼ≤t,是<strong>单调变换不变</strong>的——若把特征做单调变换(如对数、标准化),最优阈值 t 会相应变换但分裂的<strong>样本划分完全相同</strong>,树结构不变。这与线性模型(系数大小依赖尺度)、KNN(距离依赖尺度)、SVM(间隔依赖尺度)形成鲜明对比。对异常值也较鲁棒:因为分裂只看<strong>排序</strong>(阈值比较),单个极端值不会像在线性回归中那样大幅拉动拟合(虽然会影响阈值的具体位置)。<strong>归纳偏置</strong>:树的假设空间是<strong>轴平行(axis-parallel)的矩形划分</strong>——决策边界由垂直于坐标轴的超平面组成。这带来两个后果:① 对<strong>轴对齐的规则</strong>(如'年龄<30 且收入<5万')非常高效;② 对<strong>线性或旋转关系</strong>(如 x+y>1 或斜向边界)效率极低,需大量阶梯近似(深度随维度指数增长)。
🏭 Production Trade-offs
实践含义:① <strong>特征工程仍重要</strong>——虽然树不需要缩放,但<strong>旋转/线性组合特征</strong>能显著提升树的效果(如给树加上 PCA 分量、或手工构造差值/比值特征),因为这把'斜向边界'转为'轴对齐边界';② <strong>与线性模型的互补</strong>——线性模型擅长线性关系但需交互项,树擅长交互与非线性但弱于线性;实践常把两者结合(GBDT + 线性模型 stacking、或线性叶子节点的树);③ <strong>对噪声与冗余特征</strong>——树能自动忽略无关特征(不选它分裂),但对<strong>相关特征</strong>会在它们之间随机选择(导致重要度分散);④ <strong>外推能力差</strong>——树在训练数据范围外的预测是常数(叶节点值),无法外推趋势,这是树模型在时间序列/趋势预测上的根本限制。
⚠️ Common Interview Pitfalls
- ✕对树做特征标准化以求提升(无效果)
- ✕期望树模型能外推训练范围之外的趋势
🎯 Interviewer Follow-ups
- ?为什么树对线性关系效率低?
- ?如何用树建模线性关系?(加线性叶子)
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.