M7-092M7: Retrieval, Ranking & RecSysOffline Evaluation & OPEHard
Mastery:
Offline Evaluation & OPE: 解释 OPE 在推荐/广告中的实践流程。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 标准流程:明确目标与假设 → 收集数据(含随机化)→ 训练倾向/模型 → 估计 + CI → 与历史 A/B 验证 → 离线粗筛 → A/B 定胜负。
📌 Key Takeaways
- •明确目标(策略、指标、假设)
- •数据:历史日志(含倾向)+ 小流量随机化数据
- •训练倾向模型与奖励模型;估计 + CI + ESS
- •与历史 A/B 验证相关性;离线只做粗筛
📐 Mathematical Derivations
数学机理:<strong>OPE 的实践流程(七步)</strong>——(1) <strong>明确目标与假设</strong>——(a) <strong>评估什么策略</strong>(π_new 的定义);(b) <strong>什么指标</strong>(奖励的定义——点击/转化/时长);(c) <strong>什么假设</strong>(无混淆/正性/SUTVA);(d) <strong>决策用途</strong>('选 A 还是 B');<strong>关键</strong>——假设必须明确(否则结论不可靠)。(2) <strong>收集数据</strong>——(a) <strong>历史日志</strong>——记录(上下文 x、动作 a、奖励 r、<strong>倾向 π_old</strong>);<strong>注意</strong>——(i) 若历史日志<strong>未记录倾向</strong>,需用模型估计(引入误差);(ii) 记录'位置'等混淆变量;(b) <strong>小流量随机化数据</strong>——用<strong>随机策略</strong>收集一部分数据(<strong>金标准</strong>);(c) <strong>作用</strong>——随机化数据同时解决'混淆'与'正性'问题。(3) <strong>训练倾向模型</strong>——(a) 用历史数据训练 π̂_old(a|x)(预测'旧策略展示各动作的概率');(b) <strong>诊断</strong>——AUC/校准/ESS;(c) <strong>注意</strong>——倾向模型不准则 IPS 有偏。(4) <strong>训练奖励模型(DR 需要)</strong>——(a) 用历史数据训练 r̂(x,a);(b) <strong>诊断</strong>——预测误差。(5) <strong>估计 + 不确定性</strong>——(a) 计算 OPE 估计(IPS/SNIPS/DR);(b) <strong>CI</strong>(bootstrap/解析);(c) <strong>ESS</strong>(诊断可靠性);(d) <strong>敏感性分析</strong>(未观测混淆的影响)。(6) <strong>与历史 A/B 验证</strong>——(a) 用历史 A/B 实验的'离线估计 vs 在线结果'验证相关性;(b) <strong>重点看排序一致性</strong>;(c) <strong>若相关性低 → 修正</strong>(换指标/改假设/加数据)。(7) <strong>离线粗筛 + A/B 定胜负</strong>——(a) <strong>离线</strong>——从大量候选策略中<strong>快速筛出少数</strong>(排除明显差的);(b) <strong>A/B</strong>——对少数候选做<strong>在线实验</strong>(最终验证);(c) <strong>原因</strong>——OPE 有偏(即使验证过),A/B 是唯一可靠的方法。<strong>最大的风险点</strong>——(a) <strong>正性违反</strong>(新策略选新物品);(b) <strong>倾向未记录</strong>(估计误差);(c) <strong>混淆未观测</strong>(无法验证);(d) <strong>非平稳</strong>(历史不代表现在);(e) <strong>过度信任离线</strong>(跳过 A/B)。<strong>与其他问题的关系</strong>——(a) 与'IPS/DR'(估计方法);(b) 与'离线-在线相关性验证';(c) 与'A/B 实验'(在线指标题)。<strong>实践建议</strong>——(a) <strong>记录倾向</strong>(历史日志中);(b) <strong>保留小流量随机化</strong>(金标准);(c) <strong>诊断倾向与奖励模型</strong>;(d) <strong>报告 CI 与 ESS</strong>;(e) <strong>敏感性分析</strong>(未观测混淆);(f) <strong>与历史 A/B 验证</strong>;(g) <strong>离线只做粗筛、A/B 定胜负</strong>。<strong>度量</strong>——(a) OPE vs A/B 的偏差与排序一致性;(b) ESS/n;(c) CI 宽度;(d) 正性违反率。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'记录倾向'是关键工程要求</strong>——若历史日志未记录 π_old,需估计(引入误差);面试中能指出这一点是深度理解的标志。② <strong>'小流量随机化数据是金标准'</strong>——它同时解决混淆与正性;值得付出体验代价。③ <strong>'离线只做粗筛'是纪律</strong>——OPE 有偏(即使验证过);A/B 是唯一可靠的。④ <strong>'敏感性分析'评估未观测混淆</strong>——实用且必需(因为'无混淆'无法验证)。⑤ <strong>'整个流程最大风险是正性违反'</strong>——新策略选新物品时无法估计。⑥ <strong>面试要点</strong>——被问'OPE 怎么落地',应给出'<strong>七步流程(目标/数据/倾向/估计/验证/粗筛/A-B)+ 记录倾向 + 小流量随机化 + 报告 CI 与 ESS + 敏感性分析</strong>';能指出'离线只做粗筛'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕历史日志不记录倾向(需估计,引入误差)
- ✕过度信任离线结果(跳过 A/B)
🎯 Interviewer Follow-ups
- ?为什么需要'小流量随机化数据'?
- ?整个流程最大的风险点?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.