返回 经典机器学习 思维导图
中文·English
📊 经典机器学习ID: psi-data-drift

数据漂移与 PSI

Data Drift & PSI
🎯核心定义
PSI(Population Stability Index,群体稳定性指标)是监控模型输入分布漂移最常用的指标,量化基准分布与当前分布的分箱差异: PSI=i(AiBi)lnAiBiPSI = \sum_i (A_i - B_i)\ln\frac{A_i}{B_i},其中 AiA_i 是当前(actual)样本落入第 ii 个分箱的比例,BiB_i 是基准(expected,如训练集)比例;分箱通常按基准分布十等分,当前分箱为空时与相邻箱合并避免除零,PSI 本质上是 KL 散度的对称化近似。经验阈值: PSI<0.1PSI < 0.1 分布稳定;0.1PSI<0.250.1 \le PSI < 0.25 需关注并排查;PSI0.25PSI \ge 0.25 发生显著漂移,需触发重训。漂移分两类: Covariate Drift(输入 P(X)P(X) 变了,如新客群结构变化)与 Concept Drift(输入不变但 P(YX)P(Y|X) 变了,如疫情期间坏账率上升)。
💡使用场景
风控/反欺诈模型上线后的周度/月度监控看板必配 PSI;面试常问“模型上线后如何监测退化”“PSI 超阈值怎么办”;做法是逐特征算单变量 PSI,也可对模型打分/预测概率整体算 PSI,再按特征 PSI 排名定位根因。
解决的核心痛点
相比只盯线上 AUC 等效果指标(真实标签有延迟,且无法定位是哪个特征出问题),PSI 无需真实标签、可逐特征提前发现输入分布漂移;配合阈值分级(<0.1<0.1 稳定 / 0.1-0.250.1\text{-}0.25 关注 / >0.25>0.25 漂移)与重训触发,形成“监控—归因—重训”闭环。
🎯5 个高频面试考点 (Exam Points)
1
写出 PSI 公式 PSI=i(AiBi)lnAiBiPSI = \sum_i (A_i - B_i)\ln\frac{A_i}{B_i} 并解释 AiA_i/BiB_i 的含义;为什么 Ai=BiA_i = B_i 时 PSI = 0?它与 KL 散度是什么关系?
2
PSI 经验阈值: <0.1 / 0.1–0.25 / >0.25 各代表什么处置动作?分箱时遇到 Bi=0B_i = 0Ai=0A_i = 0 怎么处理?
3
Covariate Drift 与 Concept Drift 的区别?各举一个实际例子,两者对模型的影响有何不同?
4
为什么监控模型退化要用 PSI 而不是只看线上 AUC?PSI 的局限性有哪些(如对分箱数敏感)?
5
检测到 PSI ≥ 0.25 后的处置流程(归因→重训→回滚);如何区分真实漂移与数据泄漏/口径变化?
📖 关联深度指南:📄 ml-math-and-eval-metrics
更新于 2026-08-12
🎯
检验攻克程度:针对「数据漂移与 PSI」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点可解释性 SHAP 与 LIME下一个知识点排序学习 LTR

🔗 更多 经典机器学习 知识点卡片

AdaBoost 算法手推Bagging 与随机森林HMM 参数学习 Baum-WelchGBDT 负梯度拟合