返回 工业系统设计 思维导图
中文·English
🏗️ 工业系统设计ID: imbalanced-cost-sensitive-learning

极端不平衡样本与代价敏感学习

Imbalanced & Cost-Sensitive Learning
🎯核心定义
极端不平衡样本与代价敏感学习 (Imbalanced Classification & Cost-Sensitive Machine Learning) 是解决金融风控中正负样本比例极度悬殊(欺诈正样本通常低于 0.01%0.1%0.01\% \sim 0.1\%,比例达 1:100001:10000)且误分类代价极不对称的核心算法体系;架构从三个层面协同攻关:1) 数据层重采样:自适应合成少数类样本 (SMOTE / Borderline-SMOTE) 与 EasyEnsemble / BalanceCascade 分级负采样;2) 算法层损失重构:Focal Loss FL(pt)=αt(1pt)γln(pt)\text{FL}(p_t) = -\alpha_t (1 - p_t)^\gamma \ln(p_t)(动态抑制海量易分负样本的梯度贡献,迫使模型聚焦于难分欺诈样本)与类别加权损失;3) 决策层代价敏感矩阵 (Cost-Sensitive Matrix):显式定义误杀正常用户 (False Positive: 损失单笔交易手续费与用户信任) 与漏放欺诈盗刷 (False Negative: 承担全额坏账本金损失) 的不对称惩罚代价,动态求解最优决策阈值。
💡使用场景
信用卡盗刷检测、反洗钱大额异常监控、信贷违约坏账预警、恶意黑产撞库拦截。
解决的核心痛点
标准交叉熵损失在 1:100001:10000 样本下会退化为“全猜正常样本即可取得 99.99% 虚假准确率”的灾难性局部最优,且无法体现漏检与误杀在真实资金层面的不对称损失;代价敏感体系确保了极低误杀率下的高欺诈召回率。
🎯5 个高频面试考点 (Exam Points)
1
推导 Focal Loss 的数学形式 FL(pt)=αt(1pt)γln(pt)\text{FL}(p_t) = -\alpha_t (1 - p_t)^\gamma \ln(p_t),并解释调节参数 γ\gamma 如何动态降低易分样本权重?
2
详细对比 EasyEnsemble 与 BalanceCascade 在利用海量负样本构建 Bagging 子模型中的负样本抽样策略?
3
风控模型评估中为什么严禁使用 Accuracy?如何使用 KS 值 (Kolmogorov-Smirnov)、PR-AUC 与 Top-1% 捕获率作为核心验收标准?
4
构建风控代价敏感决策矩阵:根据预期坏账损失 CFNC_{\text{FN}} 与误杀用户投诉成本 CFPC_{\text{FP}} 推导最优二分类决策阈值 p=CFPCFP+CFNp^* = \frac{C_{\text{FP}}}{C_{\text{FP}} + C_{\text{FN}}}
5
无监督与半监督异常检测模型(如 Isolation Forest 孤立森林、One-Class SVM、AutoEncoder 重构误差)在应对全新零日欺诈模式中的应用?
更新于 2026-08-14
🎯
检验攻克程度:针对「极端不平衡样本与代价敏感学习」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Flink 实时特征计算与滑动窗口下一个知识点图风控与黑灰产团伙识别

🔗 更多 工业系统设计 知识点卡片

推荐多阶段漏斗与 50ms SLADSSM 双塔向量化召回YouTube DNN 召回架构粗排轻量模型与向量相似度剪枝