集成学习三大流派。Bagging (随机森林): 基学习器并行独立训练, 每器一个 Bootstrap 自助采样集, 预测投票/平均 — 基学习器要强 (深树不剪枝), 主要降方差。Boosting (AdaBoost / GBDT / XGBoost / LightGBM): 基学习器串行依赖, 每轮聚焦上一轮残差 (负梯度伪残差) 或错分样本 (权重放大), 加权/加性组合 — 基学习器要弱 (浅树), 主要降偏差。Stacking: 异质基学习器 + 元学习器 (meta-learner), 基学习器的输出 (概率或类别) 作为元特征喂给第二层模型 (常用逻辑回归/线性模型) 学最优组合 — 不要求基学习器同质, 靠模型多样性同时压低偏差与方差; 元特征必须用交叉验证/OOF 折叠生成, 否则基学习器“见过”样本导致元特征泄漏、元模型过拟合。理论依据: 偏差-方差分解
Err=bias2+variance+σϵ2; 对
k 个方差
σ2、两两相关
ρ 的学习器取平均,
Var(fˉ)=ρσ2+k1−ρσ2 — Bagging 通过样本/特征随机化压低
ρ 并增大
k 压方差, 偏差不变; Boosting 逐轮拟合负梯度残差直接压偏差 (每轮都是弱模型, 偏差主导); Stacking 用异质性打破误差相关性, 再由元学习器学组合权重。选型口诀: 高方差场景 (数据少、模型强) 用 Bagging, 高偏差场景 (模型弱、欠拟合) 用 Boosting, 已有多个互补的强模型时用 Stacking。