M2-083M2: Classical Machine LearningModel CalibrationMedium
Mastery:
Model Calibration: 解释 ECE(期望校准误差)的计算与局限。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 按置信度分箱,计算 |平均置信度 − 平均准确率| 的加权和;局限是依赖分箱且对样本量敏感。
📌 Key Takeaways
- •分箱数影响结果
- •替代:MCE、Brier score、calibration slope
📐 Mathematical Derivations
ECE 的计算步骤:① 把预测概率分为 M 个等宽箱(如 [0,0.1), [0.1,0.2), …, [0.9,1.0]);② 对每箱 b 计算平均置信度 conf(B_b)=该箱内预测概率的均值,与平均准确率 acc(B_b)=该箱内真实正类比例;③ 取 |acc−conf| 的加权和(权重为该箱样本占比)。<strong>直观含义</strong>:ECE 是所有分箱上'置信度与准确率的差距'的加权平均,ECE=0 表示完美校准。<strong>三个主要局限</strong>:① <strong>依赖分箱数与分箱方式</strong>——等宽分箱在数据集中区域(如概率集中在 0.9–1.0)会把大量样本挤在少数箱里,导致估计不稳;分箱数 M 越大 ECE 越容易被'摊薄'(每个箱样本少 → |acc−conf| 的方差大但权重小);不同 M 给出不同的 ECE,难以跨研究比较。② <strong>对样本量敏感</strong>——每个箱的 acc 是二项比例的估计,标准误 ∝1/√|B_b|;小样本下 acc 的噪声大,ECE 可能被随机波动主导。③ <strong>不区分过度自信与信心不足</strong>——ECE 用绝对值,故'系统性过度自信'与'系统性信心不足'给出相同的 ECE(虽然它们的危害不同)。
🏭 Production Trade-offs
替代与改进:① <strong>MCE(Maximum Calibration Error)</strong>——取 max|acc−conf| 而非加权平均,关注最差的分箱(对安全关键应用更相关)。② <strong>Brier score</strong>——均方误差 E[(p̂−y)²],同时衡量<strong>校准与锐度</strong>(分解为 reliability − resolution + uncertainty);它是<strong>proper scoring rule</strong>(最优策略是报真实概率),比 ECE 更适合作为优化目标。③ <strong>NLL(负对数似然)</strong>——同样是 proper scoring rule,对过度自信的惩罚更强(log 在 p̂→0 时爆炸)。④ <strong>Calibration slope/intercept</strong>——拟合 y~σ(a·logit(p̂)+b),理想情况 a=1、b=0;a>1 表示信心不足、a<1 表示过度自信,能区分方向。⑤ <strong>Adaptive/equal-mass binning</strong>——用等频分箱(每箱样本数相同)替代等宽,缓解数据集中区域的问题;或用核平滑估计(KDE-based calibration error)避免分箱。⑥ <strong>报告规范</strong>——应报告分箱数、样本量,并配合可靠性图(可视化)而非只报单个 ECE 数值。
⚠️ Common Interview Pitfalls
- ✕只报 ECE 数值而不报分箱数与可靠性图
- ✕在小样本上用 ECE 做模型比较
🎯 Interviewer Follow-ups
- ?Brier score 与 ECE 的区别?
- ?为什么 ECE 对小样本不可靠?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.