M2-081M2: Classical Machine LearningModel CalibrationEasy
Mastery:
Model Calibration: 定义模型校准,并解释为什么高准确率不等于好校准。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 校准指预测概率与真实频率一致;准确率高但概率系统性偏大/偏小仍是不校准。
📌 Key Takeaways
- •可靠性图(reliability diagram)用于诊断
- •ECE 是常用汇总指标
📐 Mathematical Derivations
校准的定义:若模型预测概率为 p 的样本中,真实正类比例为 p,则模型在该点校准(E[Y|p̂=p]=p)。<strong>诊断工具</strong>是<strong>可靠性图(reliability diagram)</strong>:把预测概率分箱(如 10 个等宽箱),每箱画'平均预测概率'(横轴)vs'实际正类比例'(纵轴);理想情况是对角线。若曲线在对角线<strong>下方</strong>,说明模型<strong>过度自信</strong>(预测 0.9 但实际只有 0.7);在<strong>上方</strong>则<strong>信心不足</strong>。<strong>为什么准确率高 ≠ 校准好</strong>:准确率只关心 argmax 是否正确(排序的极端部分),而校准关心<strong>所有概率值</strong>与真实频率的一致性。例如一个模型可能把所有样本都预测为 0.99 或 0.01(准确率极高),但当它说 0.99 时实际只有 0.8 的准确率——这就是不校准。<strong>典型不校准的模型</strong>:① <strong>深度网络</strong>——普遍过度自信(尤其大模型、少样本);② <strong>SVM</strong>——不输出概率,Platt scaling 后的概率也常有偏;③ <strong>朴素贝叶斯</strong>——严重过度自信(条件独立假设违背导致概率被推向 0/1);④ <strong>AdaBoost</strong>——可能信心不足。
🏭 Production Trade-offs
实践要点:① <strong>为什么校准重要</strong>——当概率被<strong>下游使用</strong>时(医疗风险评分、金融定价、广告出价、级联系统的阈值决策、预算分配),需要真实概率才能正确计算期望代价;若只用于<strong>排序</strong>(推荐、搜索),校准非必需(单调性足够)。② <strong>校准方法</strong>——<strong>Platt scaling</strong>(拟合 sigmoid,参数少、需较少数据)、<strong>Isotonic regression</strong>(拟合单调阶梯,更灵活但易过拟合、需更多数据)、<strong>温度缩放</strong>(深度网络,单参数、在 logits 上除以 T);三者都需在<strong>独立验证集</strong>上拟合(不能与训练集重叠)。③ <strong>ECE 的局限</strong>——期望校准误差 ECE=Σ(|B_b|/n)|acc(B_b)−conf(B_b)| 依赖分箱数与样本量,小样本下不可靠;替代指标有 MCE(最大校准误差)、Brier score(同时衡量校准与锐度)、calibration slope/intercept。④ <strong>锐度与校准的权衡</strong>——一个把所有样本预测为 0.5 的模型完全校准但无信息(低锐度);好的模型应<strong>既校准又锐利</strong>(概率集中在正确的值附近)。⑤ <strong>校准会随分布漂移失效</strong>——线上分布变化后需重新校准。
⚠️ Common Interview Pitfalls
- ✕把准确率高当作校准好的证据
- ✕在校准器拟合时使用训练集(过拟合)
🎯 Interviewer Follow-ups
- ?哪些模型天生校准差?(SVM、朴素贝叶斯、深网)
- ?如何画可靠性图?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.