M2-063M2: Classical Machine LearningFeature EngineeringEasy
Mastery:
Feature Engineering: 为什么要对数值特征分箱?分箱方式有哪些。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 捕捉非线性、抗异常值、便于业务解释;等宽、等频、有监督(决策树/卡方)。
📌 Key Takeaways
- •等频分箱比等宽更稳健
- •WOE 常用于风控评分卡
📐 Mathematical Derivations
分箱的四个动机:① <strong>捕捉非线性</strong>——线性模型无法表达'收入在 5–10 万时违约率最低'这类非单调关系,分箱后用 one-hot/WOE 编码可表达任意形状;② <strong>抗异常值</strong>——把极端值归入边界箱,避免单个异常值主导拟合(比截断更平滑);③ <strong>业务可解释</strong>——'年龄 18–25'比'年龄的系数 0.03'更易沟通,且便于做规则化决策(如风控阈值);④ <strong>处理缺失与噪声</strong>——缺失值可单独成箱。<strong>四种分箱方式</strong>:① <strong>等宽</strong>——按值域均分(如每 10 岁一箱);简单但对偏态分布不均(某些箱样本极少);② <strong>等频(分位数)</strong>——每箱样本数相同;对偏态更稳健,是常用默认;③ <strong>有监督(决策树/卡方/IV)</strong>——用目标变量指导切分点(如决策树分箱、卡方分箱、基于 IV 值);能最大化与目标的关联,但<strong>有过拟合/泄漏风险</strong>(须在 CV 折内做);④ <strong>自定义</strong>——按业务阈值(如信用分档)。
🏭 Production Trade-offs
实践要点:① <strong>WOE 编码与 IV</strong>——风控评分卡的标准做法:对每箱计算 WOE=log[(好样本占比)/(坏样本占比)],用 WOE 替代原始值(使与 log-odds 线性);用 <strong>IV(信息值)=Σ(好占比−坏占比)×WOE</strong> 衡量特征的预测力(IV<0.02 无用、0.1–0.3 中等、>0.5 可能过拟合)。② <strong>分箱会损失信息</strong>——若真实关系是平滑线性的,分箱会损失精度;故对线性关系强的特征不必分箱。③ <strong>泄漏防范</strong>——有监督分箱的切分点必须只在训练折上确定,再应用到验证折;否则会因使用全量标签而泄漏。④ <strong>箱数选择</strong>——通常 5–20 箱;过多箱会过拟合(尤其小样本),过少则损失信息;可用单调性约束(要求 WOE 随箱单调)提升稳定性。⑤ <strong>与树模型的关系</strong>——树模型自动做分箱(找最优切分点),故无需手动分箱;分箱主要用于线性模型、评分卡与需要可解释规则的场景。
⚠️ Common Interview Pitfalls
- ✕在有监督分箱时用全量数据确定切分点(泄漏)
- ✕对平滑线性关系的特征强行分箱(损失信息)
🎯 Interviewer Follow-ups
- ?有监督分箱为什么可能泄漏?
- ?分箱会损失信息吗?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.