返回 MLE 工程师 思维导图
中文·English
💻 MLE 工程师ID: mle-offline-online-eval-gap

离线线上指标鸿沟与 A/B 验证

Offline-Online Eval Gap & A/B Testing
🎯核心定义
离线与线上指标鸿沟排查与 A/B 实验验证体系 (Offline-Online Metric Gap Root-Cause & A/B Validation Architecture) 是解决工业级机器学习模型“离线 AUC 显著提升但线上真实商业 KPI(转化率、GMV、留存率)不升反降”这一最令人头疼的核心工程难题的方法论;离线线上鸿沟的核心根因:1) 离在线特征不一致 (Train-Serving Skew / 特征穿越);2) 离线指标与商业目标不一致(如 AUC 只关心相对序,但广告计费需要精准的绝对值,推荐更依赖多目标与多样性);3) 位置偏置与曝光未点击偏差 (Position Bias);4) 数据反馈循环与幸存者偏差 (Feedback Loop);解决体系:严格实施双盲 A/B 测试、交替实验 (Interleaving 灵敏度提升 100 倍)、GAUC 分组评估、保序回归概率校准与因果推断反事实评估 (Counterfactual Offline Evaluation)。
💡使用场景
推荐与搜索模型上线前的准入评审、A/B 实验效果不符合离线预期的排障分析、模型商业化决策。
解决的核心痛点
算法团队花费数月优化离线指标却无法转化为线上真金白银的商业增长;本体系提供了系统化的鸿沟排查清单与严密的在线因果验证标准。
🎯5 个高频面试考点 (Exam Points)
1
系统化列出导致“离线 AUC 涨但线上业务指标跌”的五大根因排查清单与针对性解决方案?
2
为什么在推荐系统中必须使用 GAUC (Group AUC: 按用户分组加权 AUC) 替代全局 AUC 以消除跨用户活跃度偏置?
3
反事实离线评估 (Counterfactual Offline Evaluation) 中的逆倾向得分加权 (Inverse Propensity Scoring, IPS: R^IPS=1NYiPnew(AiXi)Pold(AiXi)\hat{R}_{\text{IPS}} = \frac{1}{N} \sum \frac{Y_i P_{\text{new}}(A_i|X_i)}{P_{\text{old}}(A_i|X_i)}) 原理?
4
Interleaving (交替实验) 相比标准 A/B 测试在快速筛选淘汰弱模型中的样本量与时间效率优势?
5
新颖性效应 (Novelty Effect) 与慢炖效应 (Slow Cooker Effect) 在长期 A/B 实验中的观测周期设定与指标平稳性判断?
📖 关联深度指南:📄 mle-system-design-guide
更新于 2026-08-14
🎯
检验攻克程度:针对「离线线上指标鸿沟与 A/B 验证」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点实时风控反欺诈与延迟反馈修正

🔗 更多 MLE 工程师 知识点卡片

偏差-方差权衡与过拟合诊断常见损失函数选型与梯度特性优化器收敛性与动量选型准则模型集成 Stacking 与 Blending