M2-029M2: Classical Machine Learning集成方法 (Bagging/RF)Medium
Mastery:

集成方法 (Bagging/RF): 如何得到随机森林的特征重要度?它有什么缺陷。

📐 Mathematical Definition
MDIj=∑node split on jΔimpurity\text{MDI}_j=\sum_{\text{node split on }j}\Delta\text{impurity}
⚡ Executive Summary
Core Concept: 基于不纯度下降(MDI)或置换重要度(permutation);MDI 偏向高基数特征且受相关特征稀释。

📌 Key Takeaways

  • •
    相关特征会互相分走重要度
  • •
    置换重要度更可靠但计算贵
  • •
    更严谨可用 SHAP

📐 Mathematical Derivations

三种重要度:① <strong>MDI(Mean Decrease in Impurity)</strong>——累加该特征在所有树中作为分裂特征带来的不纯度下降(按样本数加权)。优点是免费(训练时顺便算);缺点是:(a) <strong>偏向高基数/多取值特征</strong>(更多候选阈值 → 更可能被选中且增益看似更大);(b) <strong>在训练集上计算</strong>故对过拟合特征给高分;(c) <strong>相关特征互相稀释</strong>——若两个特征强相关,树会在它们之间随机选,导致两者重要度都被低估。② <strong>置换重要度(Permutation Importance)</strong>——在<strong>验证集</strong>上随机打乱某特征的值,看性能下降多少;优点是不偏向高基数、反映真实预测贡献;缺点是 (a) 计算需 O(p) 次预测;(b) <strong>相关特征仍被稀释</strong>(打乱一个,另一个仍提供信息故性能不降);(c) 若特征分布与真实推理分布不同会失真。③ <strong>SHAP</strong>——基于博弈论的 Shapley 值,理论上满足一致性、局部准确性等公理,能给出<strong>逐样本</strong>的贡献分解,且能处理相关特征(需指定特征依赖);代价是计算成本高(TreeSHAP 对树模型有高效精确算法)。

🏭 Production Trade-offs

实践建议:① <strong>优先用置换重要度 + SHAP</strong>——MDI 只适合快速粗筛;报告重要度时应在<strong>测试集</strong>上算置换重要度并多次重复取平均(减少随机性)。② <strong>处理相关特征</strong>——用<strong>分组置换</strong>(把相关特征组一起打乱)、或先做聚类再把同组特征合并为一个特征;SHAP 的 <code>feature_perturbation</code> 参数取 interventional 与 tree_path_dependent 时,在相关特征下给出不同答案,需明确选择。③ <strong>重要度 ≠ 因果</strong>——重要度只反映模型内的预测贡献,不能解释为因果效应;若需因果推断应用专门的因果方法(如 DML、因果森林)。④ <strong>重要度稳定性</strong>——用多个随机种子重复训练并比较重要度排序,若不稳定说明特征间存在强相关或数据不足。
⚠️ Common Interview Pitfalls
  • ✕
    用 MDI 的重要度做特征选择(偏向高基数 + 训练集上算)
  • ✕
    把重要度当作因果效应解读
🎯 Interviewer Follow-ups
  • ?
    如何正确评估相关特征的重要度?(分组置换/SHAP)
  • ?
    为什么 MDI 偏向高基数特征?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-028: 集成方法 (Bagging/RF): 随机森林的两个随机性来源是什么?各自作用。📋Back to BankNext →M2-030: 集成方法 (Bagging/RF): 解释 out-of-bag(OOB)估计,它有什么用。