M2-067M2: Classical Machine LearningFeature SelectionEasy
Mastery:
Feature Selection: 比较过滤式、包裹式与嵌入式特征选择。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 过滤式按统计量排序(快但忽略模型);包裹式按模型性能搜索(准但贵);嵌入式在训练中选(如 L1/树重要度)。
📌 Key Takeaways
- •RFE 贪心删除最差特征
- •嵌入式性价比最高
📐 Mathematical Derivations
三类方法的核心差异在于'是否使用模型性能作为准则':① <strong>过滤式(Filter)</strong>——用统计量独立评估每个特征与目标的关系(卡方、互信息、相关系数、方差阈值),排序后取 top-k。优点:极快(O(np))、与模型无关、可并行;缺点:<strong>忽略特征间交互与冗余</strong>(一个单独看很弱的特征可能与另一特征组合后很强;两个高度冗余的特征会被同时保留)。② <strong>包裹式(Wrapper)</strong>——用模型的性能作为评价准则,搜索特征子集。<strong>RFE(递归特征消除)</strong>:训练模型 → 删除最不重要的特征 → 重复;<strong>前向/后向选择</strong>:逐个添加/删除。优点:直接优化目标、考虑交互;缺点:<strong>计算极贵</strong>(需训练 O(p) 到 O(2^p) 次模型)、易过拟合(在同一数据上反复评估)。③ <strong>嵌入式(Embedded)</strong>——在模型训练过程中完成选择:L1 正则(LASSO 的稀疏解)、树模型的特征重要度、ElasticNet。优点:计算成本与训练相当、考虑特征交互;缺点:依赖特定模型、选择结果的稳定性有限(如 LASSO 在相关特征上不稳定)。
🏭 Production Trade-offs
实践选择与要点:① <strong>优先嵌入式</strong>——性价比最高(一次训练即得),是实践首选;树模型的重要度 + 阈值、或 LASSO/ElasticNet 最常用。② <strong>过滤式用于粗筛</strong>——当 p 极大(如文本 p=10⁵)时,先用过滤式降到 p'=10³–10⁴,再用嵌入式或包裹式精筛,这是大规模场景的标准流程。③ <strong>包裹式的适用</strong>——仅当 p 较小(<50)且计算预算充足时;RFE 配合交叉验证可减少过拟合。④ <strong>必须放进 CV</strong>——任何特征选择步骤都必须在 CV 的<strong>训练折内</strong>做,否则会因'用全量数据选特征'而泄漏(选择的特征已经看过验证集的标签),导致性能高估。⑤ <strong>稳定性问题</strong>——用不同随机种子/子采样重复选择,检查所选特征的稳定性(如用 Jaccard 相似度);不稳定的选择不可靠(常见于强相关特征组)。⑥ <strong>与降维的区别</strong>——特征选择保留原始特征(可解释),降维生成新特征(PCA 的主成分不可解释);若需可解释性选前者。
⚠️ Common Interview Pitfalls
- ✕把特征选择放在 CV 之外(数据泄漏)
- ✕对大规模 p 直接做包裹式搜索
🎯 Interviewer Follow-ups
- ?为什么过滤式可能选错特征?
- ?RFE 的复杂度?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.