🎯核心定义
类别不平衡指正负样本比例悬殊(如 1:1000)。问题与影响: 模型偏向多数类,决策边界被整体拉向少数类;准确率严重失真——全预测多数类也能拿到 99.9% 准确率,而少数类召回率趋近 0;业务价值恰恰在少数类(欺诈、患病)上。指标选择: 关注少数类时 PR 曲线/PR-AUC 优于 ROC——ROC 的 FPR 分母含海量真负样本,曲线被稀释得过于乐观,而 PR 曲线直接刻画 Precision 与 Recall(少数类)的权衡; 同时用 F1、F-beta、PR-AUC 做评估。方案全景分四层: 数据层(过采样 SMOTE、欠采样、合成数据)、算法层(class weight 代价敏感、Focal Loss)、指标层(PR/F1/PR-AUC)、决策层(阈值移动 threshold moving)。
⚡解决的核心痛点
直接训练让模型“懒惰”地全预测多数类、CV 分数(准确率)看似很高实则无用; 正确姿势是先选对指标(PR 而非 ROC),再按数据→算法→决策三层组合干预(重采样 + 加权损失 + 阈值移动),把少数类的召回率拉回到业务可用水平。