M2-091M2: Classical Machine LearningFeature SelectionHard
Mastery:

Feature Selection: 在神经网络中如何评估特征重要性?与树模型的方法有何不同?

📐 Mathematical Definition
IG: (x−x′)⋅∫01∇xf(x′+α(x−x′)) dα\text{IG}:\ (x-x')\cdot\int_0^1\nabla_x f(x'+\alpha(x-x'))\,d\alpha
⚡ Executive Summary
Core Concept: 用梯度/输入×梯度、置换、消融、或注意力/门控;比树模型更贵且更不稳定,需多种子重复。

📌 Key Takeaways

  • •
    梯度类方法局部、易受饱和影响
  • •
    置换与消融是模型无关的通用方法

📐 Mathematical Derivations

神经网络的特征重要度有四类方法:① <strong>梯度类</strong>——计算 ∂f/∂xᵢ(显著性图 / Saliency),或 <strong>Integrated Gradients(IG)</strong>(沿从基线到输入的路径积分梯度,满足完备性公理:各特征归因之和 = f(x)−f(baseline));优点是快(一次反向);缺点是<strong>局部</strong>(只在当前点有效)、在<strong>饱和区梯度为 0</strong>(ReLU/sigmoid 饱和时误判为不重要)、且对噪声敏感。② <strong>输入×梯度(Gradient×Input)</strong>——缓解纯梯度的尺度问题(考虑特征值大小),是 DeepLIFT/IG 的简化版。③ <strong>置换重要度</strong>——在验证集上打乱某特征,看性能下降(模型无关、通用,但需 O(p) 次前向,且相关特征下被稀释)。④ <strong>消融(Ablation)</strong>——把特征置零/置均值后重测,最严谨但最贵。⑤ <strong>结构类方法</strong>——<strong>注意力权重</strong>(Transformer 中常用,但研究表明注意力权重与重要度<strong>相关性弱</strong>,不能直接当解释)、<strong>门控机制</strong>(软特征选择层)、<strong>输入层 L1 正则</strong>(促使权重稀疏)。

🏭 Production Trade-offs

与树模型的差异与实践要点:① <strong>稳定性</strong>——树模型的重要度是确定性的(给定训练数据);神经网络的重要度依赖初始化、训练随机性与解释方法的超参,<strong>必须多种子重复并报告方差</strong>,单次结果不可信。② <strong>局部 vs 全局</strong>——梯度类方法是<strong>局部</strong>解释(针对单个样本),需聚合多个样本才能得到全局重要度;树模型的重要度天然是全局的。③ <strong>相关特征的稀释</strong>——与树模型一样,神经网络的重要度也受相关特征稀释影响;应配合分组置换或 SHAP(DeepSHAP/GradientSHAP 是神经网络版的 SHAP)。④ <strong>注意力权重的陷阱</strong>——Jain & Wallace (2019) 等研究表明注意力权重与特征重要度的相关性可能很弱,不能直接作为解释;若要用注意力做解释需专门验证(如与消融结果对比)。⑤ <strong>实践建议</strong>——需要可靠解释时优先<strong>置换重要度 + 消融</strong>(模型无关、易理解),再配合 SHAP 做逐样本分析;梯度类方法适合快速探索与调试。⑥ <strong>深度学习中的特征选择</strong>——常用输入层 L1/组 Lasso 或门控网络实现软选择;也可先训练大模型用置换重要度筛选,再用筛后特征训小模型。
⚠️ Common Interview Pitfalls
  • ✕
    把注意力权重直接当作特征重要度
  • ✕
    单次运行就下结论(神经网络重要度方差大)
🎯 Interviewer Follow-ups
  • ?
    为什么梯度类方法在饱和区失效?
  • ?
    注意力权重能当作重要度吗?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-090: Evaluation Metrics & Hyperparameter Tuning: 线上评估与离线评估为什么会不一致?如何缩小差距。📋Back to BankNext →M2-092: Linear Regression: 解释加权最小二乘(WLS)与它处理异方差的方式。