M2-085M2: Classical Machine LearningModel CalibrationHard
Mastery:
Model Calibration: 校准在哪些场景至关重要?举两个例子。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 概率被下游使用时:医疗风险、金融定价、广告出价、级联系统的阈值决策。
📌 Key Takeaways
- •排序只需单调性,校准非必需
- •级联/预算分配需要真实概率
📐 Mathematical Derivations
校准关键的判据是<strong>概率是否被用于计算期望值或做阈值决策</strong>:① <strong>医疗风险预测</strong>——若模型说'该患者 10% 概率患病',医生据此决定是否做侵入性检查,则必须校准:过度自信会导致过度检查(资源浪费与风险),信心不足会导致漏诊。② <strong>金融/保险定价</strong>——保费应等于'预期赔付 × 风险系数',若违约概率高估则定价过高(失去客户)、低估则亏损;概率的绝对数值直接决定盈亏。③ <strong>广告出价(bid)</strong>——出价 = 预期价值 = pCTR × pCVR × 客单价,若 pCTR 高估则出价过高导致亏损,低估则拿不到流量。④ <strong>级联系统</strong>——若第一级用阈值筛掉一部分样本,需要知道'被筛掉样本的正类概率'才能评估整体损失;未校准的分数无法做此计算。⑤ <strong>预算分配/资源调度</strong>——按预期收益分配资源需要概率的绝对值。<strong>反例(不需校准)</strong>:纯<strong>排序</strong>任务(搜索结果、推荐列表)只需单调性——只要高分样本真的比低分更相关,排序就正确;校准与否不影响排序指标(NDCG、Recall@K)。
🏭 Production Trade-offs
实践要点:① <strong>校准是单调变换</strong>——理论上校准不改变排序(故排序指标不变),但<strong>有限数据下拟合会引入噪声</strong>,可能略微改变排序;故对纯排序任务不必校准(还可能有害)。② <strong>校准与排序的联合需求</strong>——若系统既要排序又要用概率做决策(如'按预期价值排序并出价'),则必须校准。③ <strong>校准的评估</strong>——用可靠性图、ECE、Brier score;且需在<strong>独立数据</strong>上评估(校准器拟合数据上评估会乐观)。④ <strong>校准的稳定性</strong>——分布漂移会使校准失效,需定期重估;尤其在季节性/趋势明显的数据上,校准器可能需频繁更新。⑤ <strong>业务沟通</strong>——校准后的概率更容易被业务方理解与使用('这个客户有 30% 的概率会流失'),而未校准的分数只能说'比那个客户更可能流失';这是校准在实践中的额外价值。⑥ <strong>与决策阈值的关系</strong>——校准后阈值才有明确的业务含义(如'阈值 0.5 意味着预测概率 >50% 就采取行动');未校准时阈值只能靠试。
⚠️ Common Interview Pitfalls
- ✕在纯排序任务上强行校准(可能损害排序)
- ✕用校准后的概率而不在独立数据上验证校准质量
🎯 Interviewer Follow-ups
- ?排序任务为什么不需要校准?
- ?校准与排序的关系?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.