M7-083M7: Retrieval, Ranking & RecSysOffline Evaluation & OPEEasy
Mastery:
Offline Evaluation & OPE: 解释离线评估为何不能直接用历史数据评估新策略。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 历史数据由'旧策略'产生(有偏),故'新策略在历史数据上的表现'不等于'新策略上线后的表现'。
📌 Key Takeaways
- •历史数据是'旧策略'选择的(有偏采样)
- •直接平均历史数据 = 评估旧策略(而非新策略)
- •新策略可能'推荐历史上没出现过的物品'(无数据)
📐 Mathematical Derivations
数学机理:<strong>为什么不能直接用历史数据</strong>——(1) <strong>历史数据是'旧策略'产生的</strong>——历史日志记录了'旧策略 π_old 推荐了什么、用户如何反应';<strong>关键</strong>——<strong>用户只对'被展示的'物品有反馈</strong>;未展示的物品<strong>没有数据</strong>('反事实'未知)。(2) <strong>直接平均的偏置</strong>——若用'历史数据的平均奖励'评估新策略 π_new:(a) 这实际上是'评估 π_old 的表现'(因为数据由 π_old 产生);(b) 新策略若'推荐了历史上没被展示的物品' → 那些物品没有数据 → 无法评估;(c) <strong>偏差来源</strong>——'选择偏差'(旧策略的选择)+ '展示偏差'(只有被展示的有反馈)。(3) <strong>支持集不匹配(support mismatch)</strong>——(a) 新策略 π_new 可能给'π_old 从未展示的物品'很高概率 → 但这些物品<strong>在历史数据中不存在</strong>;(b) 故'无法从历史数据估计新策略的表现'(无数据);(c) 这是 OPE 的<strong>根本困难</strong>。(4) <strong>'离线 NDCG'也有偏</strong>——(a) 用'历史点击'作为'相关性标签'评估新策略的排序;但<strong>点击受位置影响</strong>(位置偏置)→ '离线 NDCG'衡量的是'新策略与旧策略的一致性'(而非'真实相关性');(b) 故'离线 NDCG 高'可能只是'新策略像旧策略'。<strong>正确的做法(OPE)</strong>——(1) <strong>逆倾向加权(IPS)</strong>——用'1/倾向'加权历史数据,使其'模拟'随机策略的数据(见 IPS 题);(2) <strong>直接方法(DM)</strong>——用模型预测'新策略下的奖励'(依赖模型准确性);(3) <strong>双稳健(DR)</strong>——结合 DM 与 IPS(见 DR 题);(4) <strong>随机化数据</strong>——用'随机策略'收集数据(无偏,但损害体验);(5) <strong>在线 A/B</strong>——最终验证。<strong>前提假设(OPE 的三大假设)</strong>——(a) <strong>无混淆(unconfoundedness)</strong>——'展示'只依赖'可观测的特征'(无隐藏混淆);(b) <strong>正性/重叠(positivity/overlap)</strong>——新策略会选的物品在历史中'有非零的展示概率'(否则无法估计);(c) <strong>SUTVA(稳定单位处理值假设)</strong>——一个物品的反馈不受其他物品影响(无干扰);<strong>注意</strong>——(b) 是最易违反的(新策略选的新物品从未展示)。<strong>与其他问题的关系</strong>——(a) 与'位置偏置'(同一问题);(b) 与'离线-在线不一致'(LTR 题);(c) 与'因果推断'(OPE 是因果推断的应用)。<strong>实践建议</strong>——(a) <strong>不要直接用历史数据平均评估新策略</strong>;(b) <strong>用 IPS/DR</strong>(配权重截断);(c) <strong>保留随机化数据</strong>(金标准);(d) <strong>检查'支持集重叠'</strong>(新策略选的物品在历史中有多少概率被展示);(e) <strong>离线只做粗筛、A/B 定胜负</strong>。<strong>度量</strong>——(a) OPE 估计的偏差(vs 在线 A/B);(b) 支持集重叠度;(c) 估计的方差。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'历史数据由旧策略产生'是根本问题</strong>——故'直接平均 = 评估旧策略';面试中能指出这一点是深度理解的标志。② <strong>'支持集不匹配'是 OPE 的根本困难</strong>——新策略选的新物品无数据;故'正性假设'最易违反。③ <strong>'离线 NDCG 也有偏'</strong>——它衡量'与旧策略的一致性';这是易被忽视的陷阱。④ <strong>'随机化数据是金标准'</strong>——小流量随机可提供无偏数据;代价是体验损失。⑤ <strong>'三大假设'需明确</strong>——无混淆/正性/SUTVA;违反则 OPE 失效。⑥ <strong>面试要点</strong>——被问'为什么不能用历史数据评估新策略',应给出'<strong>历史数据由旧策略产生(选择偏差)+ 支持集不匹配 + 离线 NDCG 也有偏 + 正确做法(IPS/DR/随机化/A-B)+ 三大假设</strong>';能指出'离线 NDCG 衡量的是与旧策略的一致性'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕直接用历史数据的平均奖励评估新策略
- ✕忽略'正性假设'(新策略选的物品无历史数据)
🎯 Interviewer Follow-ups
- ?什么是'支持集不匹配'?
- ?为什么'离线 NDCG'也有偏?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.