M2-063M2: Classical Machine LearningFeature EngineeringEasy
Mastery:

Feature Engineering: 为什么要对数值特征分箱?分箱方式有哪些。

📐 Mathematical Definition
WOE=log⁡P(x∈B∣y=1)P(x∈B∣y=0)\text{WOE}=\log\frac{P(x\in B\mid y=1)}{P(x\in B\mid y=0)}
⚡ Executive Summary
Core Concept: 捕捉非线性、抗异常值、便于业务解释;等宽、等频、有监督(决策树/卡方)。

📌 Key Takeaways

  • •
    等频分箱比等宽更稳健
  • •
    WOE 常用于风控评分卡

📐 Mathematical Derivations

分箱的四个动机:① <strong>捕捉非线性</strong>——线性模型无法表达'收入在 5–10 万时违约率最低'这类非单调关系,分箱后用 one-hot/WOE 编码可表达任意形状;② <strong>抗异常值</strong>——把极端值归入边界箱,避免单个异常值主导拟合(比截断更平滑);③ <strong>业务可解释</strong>——'年龄 18–25'比'年龄的系数 0.03'更易沟通,且便于做规则化决策(如风控阈值);④ <strong>处理缺失与噪声</strong>——缺失值可单独成箱。<strong>四种分箱方式</strong>:① <strong>等宽</strong>——按值域均分(如每 10 岁一箱);简单但对偏态分布不均(某些箱样本极少);② <strong>等频(分位数)</strong>——每箱样本数相同;对偏态更稳健,是常用默认;③ <strong>有监督(决策树/卡方/IV)</strong>——用目标变量指导切分点(如决策树分箱、卡方分箱、基于 IV 值);能最大化与目标的关联,但<strong>有过拟合/泄漏风险</strong>(须在 CV 折内做);④ <strong>自定义</strong>——按业务阈值(如信用分档)。

🏭 Production Trade-offs

实践要点:① <strong>WOE 编码与 IV</strong>——风控评分卡的标准做法:对每箱计算 WOE=log[(好样本占比)/(坏样本占比)],用 WOE 替代原始值(使与 log-odds 线性);用 <strong>IV(信息值)=Σ(好占比−坏占比)×WOE</strong> 衡量特征的预测力(IV<0.02 无用、0.1–0.3 中等、>0.5 可能过拟合)。② <strong>分箱会损失信息</strong>——若真实关系是平滑线性的,分箱会损失精度;故对线性关系强的特征不必分箱。③ <strong>泄漏防范</strong>——有监督分箱的切分点必须只在训练折上确定,再应用到验证折;否则会因使用全量标签而泄漏。④ <strong>箱数选择</strong>——通常 5–20 箱;过多箱会过拟合(尤其小样本),过少则损失信息;可用单调性约束(要求 WOE 随箱单调)提升稳定性。⑤ <strong>与树模型的关系</strong>——树模型自动做分箱(找最优切分点),故无需手动分箱;分箱主要用于线性模型、评分卡与需要可解释规则的场景。
⚠️ Common Interview Pitfalls
  • ✕
    在有监督分箱时用全量数据确定切分点(泄漏)
  • ✕
    对平滑线性关系的特征强行分箱(损失信息)
🎯 Interviewer Follow-ups
  • ?
    有监督分箱为什么可能泄漏?
  • ?
    分箱会损失信息吗?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-062: Feature Engineering: 列举类别特征的常见编码方式及适用场景。📋Back to BankNext →M2-064: Feature Engineering: 解释特征交互与多项式特征,什么时候需要。