返回 MLE 工程师 思维导图
中文·English
💻 MLE 工程师ID: mle-feature-selection-shap

特征选择与置换重要性 / SHAP

Feature Selection, Permutation & SHAP
🎯核心定义
特征选择体系与博弈论 SHAP 可解释性分析 (Feature Selection Taxonomy, Permutation Importance & SHAP Values) 是机器学习工程师从海量候选特征池(数百上千个特征)中提炼高价值子集、剔除噪声共线性特征并进行全局与局部归因分析的方法论;特征选择三大范式:1) 过滤法 (Filter: 方差阈值、皮尔逊相关系数、互信息 Mutual Information、卡方检验);2) 包裹法 (Wrapper: 递归特征消除 RFE、前向/后向贪心选择);3) 嵌入法 (Embedded: Lasso L1 稀疏惩罚、GBDT 树分裂增益);更进一步,置换特征重要性 (Permutation Feature Importance) 通过随机打乱单列特征评估验证集指标下降幅度消除基数偏置;SHAP (SHapley Additive exPlanations) 基于合作博弈论 Shapley 值公式 ϕi=SF{i}S!(FS1)!F![f(S{i})f(S)]\phi_i = \sum_{S \subseteq F \setminus \{i\}} \frac{|S|!(|F|-|S|-1)!}{|F|!} [f(S \cup \{i\}) - f(S)],提供严格满足加性、效率性与对称性的黄金归因解释。
💡使用场景
工业模型降维精简、模型可解释性业务汇报、消除多重共线性特征与敏感偏见审计。
解决的核心痛点
传统树模型自带的“基于分裂次数 (Split Count)”或“增益 (Gain)”的重要度极度偏向高基数连续数值特征导致严重误判;Permutation 与 TreeSHAP 提供了客观、无偏且具有博弈论数学保证的特征重要性排序。
🎯5 个高频面试考点 (Exam Points)
1
推导合作博弈论 Shapley 值的经典公式 ϕi=SF{i}S!(FS1)!F![f(S{i})f(S)]\phi_i = \sum_{S \subseteq F \setminus \{i\}} \frac{|S|!(|F|-|S|-1)!}{|F|!} [f(S \cup \{i\}) - f(S)] 的公理化性质(效率性、对称性、虚拟性、加性)?
2
为什么在 GBDT 树模型中,直接使用默认的 `feature_importances_` (Split Count) 会对高基数浮点数产生严重的虚假偏好?
3
置换特征重要性 (Permutation Importance) 在遇到高度共线性特征(Collinear Features: 如两列特征相关度达 0.99)时的失真陷阱与聚类排查?
4
TreeSHAP 算法如何利用决策树的局部路由结构将 Shapley 值的指数级时间复杂度 O(2F)O(2^{|F|}) 压缩至多项式时间 O(TLD2)O(T L D^2)
5
递归特征消除 (RFE: Recursive Feature Elimination) 配合交叉验证 (RFECV) 在寻找全局最优特征数量 KK^* 时的算法流转?
🔗核心前置底层技术卡片 (点击穿透复习)
更新于 2026-08-14
🎯
检验攻克程度:针对「特征选择与置换重要性 / SHAP」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点OOF 目标编码与防目标穿越机制下一个知识点生产环境 PSI 特征漂移监控

🔗 更多 MLE 工程师 知识点卡片

偏差-方差权衡与过拟合诊断常见损失函数选型与梯度特性优化器收敛性与动量选型准则模型集成 Stacking 与 Blending