M2-074M2: Classical Machine LearningClass Imbalance LearningMedium
Mastery:
Class Imbalance Learning: 如何选择分类阈值?不同业务目标下的策略。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 按代价矩阵最小化期望损失,或按业务约束(召回下限)定阈值;用验证集选并考虑校准。
📌 Key Takeaways
- •召回优先:欺诈/疾病筛查
- •精确优先:推荐/打扰型通知
📐 Mathematical Derivations
阈值选择的四种准则:① <strong>代价最小化</strong>——若已知误判代价 c_FP 与漏判代价 c_FN,则选使期望代价 c_FP·FP(τ)+c_FN·FN(τ) 最小的阈值;这是最严谨的做法(需要业务提供代价)。② <strong>约束优化</strong>——固定一个指标的下限,最大化另一个(如'在 Precision ≥ 90% 的前提下最大化 Recall');这对应'业务门槛'场景(如风控要求误杀率低于某值)。③ <strong>指标最优化</strong>——直接最大化 F1、F_β(β 控制精确/召回的相对权重)或平衡准确率。④ <strong>分位数阈值</strong>——按预测分数的分位数定阈值(如只取 top 1% 作为正类),适合'名额固定'的场景(如每天只处理 N 个案件)。<strong>关键前提</strong>:阈值必须在<strong>验证集</strong>上选(不能看测试集),且模型需输出<strong>校准良好</strong>的概率(否则阈值与业务含义脱节)。
🏭 Production Trade-offs
业务场景的典型策略:① <strong>召回优先(低阈值)</strong>——欺诈检测、疾病筛查、安全告警:漏判代价极高,宁可多误报(后续人工复核);② <strong>精确优先(高阈值)</strong>——推荐系统、打扰型通知、自动执行的操作:误报损害用户体验,宁可少做;③ <strong>平衡(F1/代价最优)</strong>——多数业务场景。<strong>实践要点</strong>:① <strong>校准的必要性</strong>——若模型过自信(深度网络常见),其'0.9 概率'可能实际只有 0.7 的准确率,故阈值失去业务含义;应先做温度缩放/Platt/isotonic 校准再定阈值。② <strong>阈值与分布漂移</strong>——线上分布变化会使固定阈值失效(如正类比例变化),需定期重估或用<strong>自适应阈值</strong>(按预测分数的分位数动态调整)。③ <strong>分层阈值</strong>——不同用户群/场景可用不同阈值(如新用户更保守、高价值用户更激进);这需要分群验证集。④ <strong>成本的不对称性量化</strong>——与业务方一起量化 c_FP/c_FN(如'一次误判的客服成本 vs 一次漏判的损失'),把技术阈值转化为业务语言。⑤ <strong>监控</strong>——上线后监控实际精确率/召回率,若偏离预期则说明分布漂移或校准失效。
⚠️ Common Interview Pitfalls
- ✕在测试集上选阈值(信息泄漏)
- ✕在未校准的模型上直接用概率阈值做业务决策
🎯 Interviewer Follow-ups
- ?为什么阈值要在验证集选?
- ?阈值与模型校准的关系?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.