返回 经典机器学习 思维导图
中文·English
📊 经典机器学习ID: boosting-gbdt

GBDT 负梯度拟合

GBDT Negative Gradient
🎯核心定义
GBDT (Gradient Boosting Decision Tree) 把 Boosting 看作函数空间上的梯度下降: 加法模型 FM(x)=m=1Mρmhm(x)F_M(x) = \sum_{m=1}^{M} \rho_m h_m(x), 每轮沿损失对函数值 FF 的负梯度方向更新 Fm=Fm1ρmFLF=Fm1F_m = F_{m-1} - \rho_m \nabla_F L\big|_{F = F_{m-1}}。第 mm 轮三步: (1) 对每个样本计算负梯度伪残差 y~i=[L(yi,F(xi))F(xi)]F=Fm1\tilde{y}_i = -\left[ \frac{\partial L\left(y_i, F(x_i)\right)}{\partial F(x_i)} \right]_{F = F_{m-1}}; (2) 用回归树拟合 (xi,y~i)(x_i, \tilde{y}_i), 得到叶子区域划分 RjmR_{jm} (j=1,,Jmj = 1, \dots, J_m); (3) 对每个叶子做线搜索定输出 ρjm=argminρxiRjmL(yi,Fm1(xi)+ρ)\rho_{jm} = \arg\min_{\rho} \sum_{x_i \in R_{jm}} L\left(y_i, F_{m-1}(x_i) + \rho\right)。平方损失 L=12(yF)2L = \frac{1}{2}(y - F)^2 时伪残差恰为普通残差 y~i=yiFm1(xi)\tilde{y}_i = y_i - F_{m-1}(x_i), 叶子输出为叶内伪残差均值; 绝对值损失时 y~i=sign(yiFm1(xi))\tilde{y}_i = \text{sign}\left(y_i - F_{m-1}(x_i)\right), 叶子输出为中位数 (L2 均值 / L1 中位数对应); 二分类 (log-loss) 以对数几率 FF 建模: p^i=σ(Fm1(xi))\hat{p}_i = \sigma\left(F_{m-1}(x_i)\right), 伪残差 y~i=yip^i\tilde{y}_i = y_i - \hat{p}_i, 叶子值再做一个牛顿步修正。训练加收缩 (学习率) ν(0.01,0.1)\nu \in (0.01, 0.1): Fm=Fm1+νtreemF_m = F_{m-1} + \nu \cdot \text{tree}_m — 每棵树贡献打折, 需要更多棵树, 但泛化显著更好; 随机梯度提升 (subsampling) 进一步降方差。Friedman (2001) 证明 AdaBoost 是指数损失下梯度提升的特例。
💡使用场景
“GBDT 伪残差怎么来”“叶子输出怎么定”“与 AdaBoost 区别”“学习率的作用”是高频白板追问; 工程上是回归/分类/排序 (LambdaMART) 的经典强基线。
解决的核心痛点
AdaBoost 的指数损失只适合二分类且对噪声敏感 — 负梯度框架把 Boosting 推广到任意可微损失: 每轮拟合的是 LF\frac{\partial L}{\partial F} 而非标签本身, 换损失只需换一阶导 (Huber/分位数损失做鲁棒回归、log-loss 做概率分类、NDCG 近似做排序), 且逐轮拟合残差直接降偏差, 是“高偏差低方差弱模型”场景 (浅树) 的标准解法; 相比随机森林的降方差, GBDT 更擅长偏差主导的场景。
🎯5 个高频面试考点 (Exam Points)
1
白板推导负梯度伪残差 y~i=[LF]F=Fm1\tilde{y}_i = -\left[\frac{\partial L}{\partial F}\right]_{F = F_{m-1}}: 平方损失下为什么就是 yFm1y - F_{m-1}?
2
叶子输出推导: 平方损失叶子输出为均值、绝对值损失为中位数; 二分类 log-loss 下叶子值为什么是牛顿步?
3
GBDT 与 AdaBoost 的关系: 为什么指数损失下 AdaBoost 是梯度提升的特例? 两者的基学习器/加权方式有何不同?
4
收缩 ν\nu (学习率) 的作用: 为什么小学习率 + 多棵树通常更好? 对偏差-方差权衡的影响?
5
GBDT 能适配哪些损失函数? 与随机森林的适用场景对比 (降偏差 vs 降方差)?
📖 关联深度指南:📄 decision-trees-and-ensemble
更新于 2026-08-12
🎯
检验攻克程度:针对「GBDT 负梯度拟合」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点AdaBoost 算法手推下一个知识点XGBoost 二阶手推

🔗 更多 经典机器学习 知识点卡片

Bagging 与随机森林HMM 参数学习 Baum-Welch混淆矩阵线性链条件随机场