返回 经典机器学习 思维导图
中文·English
📊 经典机器学习ID: data-imbalance

类别不平衡

Class Imbalance
🎯核心定义
类别不平衡指正负样本比例悬殊(如 1:1000)。问题与影响: 模型偏向多数类,决策边界被整体拉向少数类;准确率严重失真——全预测多数类也能拿到 99.9% 准确率,而少数类召回率趋近 0;业务价值恰恰在少数类(欺诈、患病)上。指标选择: 关注少数类时 PR 曲线/PR-AUC 优于 ROC——ROC 的 FPR 分母含海量真负样本,曲线被稀释得过于乐观,而 PR 曲线直接刻画 Precision 与 Recall(少数类)的权衡; 同时用 F1、F-beta、PR-AUC 做评估。方案全景分四层: 数据层(过采样 SMOTE、欠采样、合成数据)、算法层(class weight 代价敏感、Focal Loss)、指标层(PR/F1/PR-AUC)、决策层(阈值移动 threshold moving)。
💡使用场景
欺诈检测、异常检测、罕见病诊断、广告低转化率预测——正负比 1:100 甚至 1:10000 的任务; 面试必问“正负比 1:100 怎么处理”“为什么不看准确率”。
解决的核心痛点
直接训练让模型“懒惰”地全预测多数类、CV 分数(准确率)看似很高实则无用; 正确姿势是先选对指标(PR 而非 ROC),再按数据→算法→决策三层组合干预(重采样 + 加权损失 + 阈值移动),把少数类的召回率拉回到业务可用水平。
🎯5 个高频面试考点 (Exam Points)
1
为什么类别不平衡时 PR 曲线优于 ROC 曲线? FPR 分母中的海量真负样本如何稀释 ROC?
2
正负比 1:1000、准确率 99.9% 但业务要求高召回: 你的处理步骤(指标→方法→验证)是什么?
3
class weight(代价敏感学习)的原理? 它与过采样在数学上等价吗?
4
阈值移动(threshold moving)怎么操作? 它与重采样、加权损失是什么关系?
5
不平衡下 F1 与 AUC 哪个更能反映业务? 什么场景下用 AUC 依然合适?
📖 关联深度指南:📄 ml-math-and-eval-metrics
更新于 2026-08-12
🎯
检验攻克程度:针对「类别不平衡」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点时序交叉验证下一个知识点重采样方法 SMOTE/ADASYN/Tomek

🔗 更多 经典机器学习 知识点卡片

AdaBoost 算法手推Bagging 与随机森林HMM 参数学习 Baum-WelchGBDT 负梯度拟合