M2-067M2: Classical Machine LearningFeature SelectionEasy
Mastery:

Feature Selection: 比较过滤式、包裹式与嵌入式特征选择。

📐 Mathematical Definition
filter: χ2/MI;wrapper: RFE;embedded: LASSO\text{filter}:\ \chi^2/\text{MI};\quad \text{wrapper}:\ \text{RFE};\quad \text{embedded}:\ \text{LASSO}
⚡ Executive Summary
Core Concept: 过滤式按统计量排序(快但忽略模型);包裹式按模型性能搜索(准但贵);嵌入式在训练中选(如 L1/树重要度)。

📌 Key Takeaways

  • •
    RFE 贪心删除最差特征
  • •
    嵌入式性价比最高

📐 Mathematical Derivations

三类方法的核心差异在于'是否使用模型性能作为准则':① <strong>过滤式(Filter)</strong>——用统计量独立评估每个特征与目标的关系(卡方、互信息、相关系数、方差阈值),排序后取 top-k。优点:极快(O(np))、与模型无关、可并行;缺点:<strong>忽略特征间交互与冗余</strong>(一个单独看很弱的特征可能与另一特征组合后很强;两个高度冗余的特征会被同时保留)。② <strong>包裹式(Wrapper)</strong>——用模型的性能作为评价准则,搜索特征子集。<strong>RFE(递归特征消除)</strong>:训练模型 → 删除最不重要的特征 → 重复;<strong>前向/后向选择</strong>:逐个添加/删除。优点:直接优化目标、考虑交互;缺点:<strong>计算极贵</strong>(需训练 O(p) 到 O(2^p) 次模型)、易过拟合(在同一数据上反复评估)。③ <strong>嵌入式(Embedded)</strong>——在模型训练过程中完成选择:L1 正则(LASSO 的稀疏解)、树模型的特征重要度、ElasticNet。优点:计算成本与训练相当、考虑特征交互;缺点:依赖特定模型、选择结果的稳定性有限(如 LASSO 在相关特征上不稳定)。

🏭 Production Trade-offs

实践选择与要点:① <strong>优先嵌入式</strong>——性价比最高(一次训练即得),是实践首选;树模型的重要度 + 阈值、或 LASSO/ElasticNet 最常用。② <strong>过滤式用于粗筛</strong>——当 p 极大(如文本 p=10⁵)时,先用过滤式降到 p'=10³–10⁴,再用嵌入式或包裹式精筛,这是大规模场景的标准流程。③ <strong>包裹式的适用</strong>——仅当 p 较小(<50)且计算预算充足时;RFE 配合交叉验证可减少过拟合。④ <strong>必须放进 CV</strong>——任何特征选择步骤都必须在 CV 的<strong>训练折内</strong>做,否则会因'用全量数据选特征'而泄漏(选择的特征已经看过验证集的标签),导致性能高估。⑤ <strong>稳定性问题</strong>——用不同随机种子/子采样重复选择,检查所选特征的稳定性(如用 Jaccard 相似度);不稳定的选择不可靠(常见于强相关特征组)。⑥ <strong>与降维的区别</strong>——特征选择保留原始特征(可解释),降维生成新特征(PCA 的主成分不可解释);若需可解释性选前者。
⚠️ Common Interview Pitfalls
  • ✕
    把特征选择放在 CV 之外(数据泄漏)
  • ✕
    对大规模 p 直接做包裹式搜索
🎯 Interviewer Follow-ups
  • ?
    为什么过滤式可能选错特征?
  • ?
    RFE 的复杂度?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-066: Feature Engineering: 什么是特征哈希(hashing trick)?它的优缺点。📋Back to BankNext →M2-068: Feature Selection: 为什么'去掉无用特征'有时反而降低性能?