M2-090M2: Classical Machine LearningEvaluation Metrics & Hyperparameter TuningHard
Mastery:
Evaluation Metrics & Hyperparameter Tuning: 线上评估与离线评估为什么会不一致?如何缩小差距。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 离线数据分布、指标代理、反馈回路、延迟效应都与线上不同;需回放评估、反事实评估与在线小流量验证。
📌 Key Takeaways
- •用 OPE(IPS/DR)做离线策略评估
- •离线上线做相关性分析,校准代理指标
- •用小流量 A/B 验证离线结论
📐 Mathematical Derivations
不一致的五个来源:① <strong>数据分布差异</strong>——离线数据由旧策略产生(行为策略),新策略偏好的样本可能缺乏覆盖;且线上分布随时间漂移(季节、竞品、用户群变化)。② <strong>指标代理差异</strong>——离线用 Recall@K/NDCG/AUC,线上用 CTR/CVR/留存/GMV;两者可能不单调对应(如离线 NDCG 提升但线上点击下降,因为排序变化影响了多样性)。③ <strong>反馈回路</strong>——线上系统的输出会改变用户行为与后续数据(用户点击后系统更倾向推荐同类,形成自我强化),离线数据不含这种动态。④ <strong>延迟与长周期效应</strong>——转化、留存、退货等指标有延迟,短期离线评估无法捕捉;且短期提升可能损害长期(如激进的推荐提高短期点击但损害留存)。⑤ <strong>系统与实现差异</strong>——训练-服务偏移(特征计算不一致)、延迟约束(离线可用大模型,线上受限)、缓存与降级策略。
🏭 Production Trade-offs
缩小差距的方法:① <strong>反事实评估(OPE)</strong>——用 IPS/Doubly Robust 等方法从历史日志估计新策略的效果,关键是记录<strong>倾向性(propensity)</strong>(每次曝光的概率);优点是无需上线;局限是需要覆盖假设、方差大、对新策略的分布外动作不可靠。② <strong>回放评估(Replay)</strong>——用历史日志模拟新策略(只保留新策略会选择的动作),估计无偏但<strong>有效样本量随策略差异增大而骤降</strong>(新策略选的动作在日志中罕见)。③ <strong>离线上线相关性分析</strong>——用历史 A/B 结果验证离线指标的代理质量(画散点图看相关性/排序一致性);若相关性弱,说明离线指标不是好代理,需换指标。④ <strong>小流量在线验证</strong>——用小流量 A/B 或影子流量验证离线结论(影子流量只观测不返回,无用户风险);这是最终的判据。⑤ <strong>短期指标 + 长期护栏</strong>——同时监控短期(CTR)与长期(留存、退货、满意度)指标,防短期优化损害长期。⑥ <strong>训练-服务一致性</strong>——用同一套特征计算逻辑、定期做离线回放对比线上日志,检测 skew。⑦ <strong>因果推断方法</strong>——对无法做 A/B 的场景(如全量改版),用 DID/合成控制/断点回归估计效应。
⚠️ Common Interview Pitfalls
- ✕认为离线指标提升线上必然提升
- ✕不做离线上线相关性分析就直接上线
🎯 Interviewer Follow-ups
- ?为什么离线指标提升线上可能下降?
- ?如何验证离线指标是好的代理?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.