M7-090M7: Retrieval, Ranking & RecSysOffline Evaluation & OPEHard
Mastery:
Offline Evaluation & OPE: 解释序列决策的 OPE(多步 IPS / DR)。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 序列决策中动作影响后续状态(长期效应);多步 IPS 用'轨迹级'权重,方差随长度指数增长。
📌 Key Takeaways
- •序列决策:动作影响后续状态(不能逐时刻独立评估)
- •多步 IPS:用'轨迹级'权重(各时刻权重的乘积)
- •方差随轨迹长度指数增长(乘积效应)
📐 Mathematical Derivations
数学机理:<strong>序列决策 OPE 的困难</strong>——(1) <strong>与单步的区别</strong>——(a) <strong>单步</strong>——动作只影响'当次奖励'(如'推荐一个物品 → 是否点击');(b) <strong>序列</strong>——动作<strong>影响后续状态</strong>(如'推荐了 A → 用户看了 A → 后续推荐 B 的效果变化');(c) <strong>后果</strong>——'长期效应'(一个动作的收益跨越多个时刻);故<strong>不能逐时刻独立评估</strong>。(2) <strong>多步 IPS(trajectory-level IPS)</strong>——用'<strong>轨迹级</strong>权重':w_traj=∏_{t=1}^T [π_new(a_t|x_t)/π_old(a_t|x_t)];估计式:V̂=(1/n)Σ_i w_traj,i·(Σ_t γ^{t-1}r_{i,t)(各时刻奖励的折扣和)。(3) <strong>方差问题(严重)</strong>——(a) <strong>乘积效应</strong>——w_traj 是 T 个权重的乘积;若每个权重的期望≈1 但方差>0,则<strong>乘积的方差随 T 指数增长</strong>;(b) <strong>量化</strong>——若每个时刻的权重在 [0.5, 2] 波动,则 T=100 时乘积的范围是 [2⁻¹⁰⁰, 2¹⁰⁰](完全不可用);(c) <strong>后果</strong>——多步 IPS 在实践中<strong>几乎不可用</strong>(除非轨迹很短或策略很接近)。(4) <strong>缓解手段</strong>——(a) <strong>权重截断</strong>(每步或轨迹级);(b) <strong>自归一化</strong>(SNIPS 的序列版);(c) <strong>'每步独立'的近似</strong>(假设动作不影响后续状态——<strong>强假设</strong>);(d) <strong>DR 的序列版</strong>(用模型作基线,只处理残差);(e) <strong>'折扣因子'</strong>(γ<1 降低远期权重,使有效长度变短);(f) <strong>降低评估范围</strong>(只评估短片段);(g) <strong>模型基方法(MB)</strong>——学一个'环境模型'(状态转移 + 奖励),用它模拟新策略(<strong>优点</strong>——方差低;<strong>缺点</strong>——模型误差累积);(h) <strong>混合(MB + IS)</strong>。<strong>其他序列 OPE 方法</strong>——(a) <strong>MAGIC</strong>(模型基与 IS 的组合);(b) <strong>Doubly Robust 的序列版</strong>(DR 用于序列);(c) <strong>'伪逆/双重稳健'的变体</strong>;(d) <strong>'离线强化学习'</strong>(不只评估、还要优化)。<strong>与其他问题的关系</strong>——(a) 与'离线强化学习'(OPE 是 RL 的一部分);(b) 与'长期效应评估'(同一问题);(c) 与'延迟反馈'(序列中的延迟奖励)。<strong>实践建议</strong>——(a) <strong>短轨迹</strong> → 多步 IPS 可行(配截断);(b) <strong>长轨迹</strong> → 用 DR/模型基方法(方差更低);(c) <strong>'每步独立'的近似</strong>(若合理);(d) <strong>折扣因子</strong>(缩短有效长度);(e) <strong>模型基方法</strong>(注意误差累积);(f) <strong>与 A/B 对比验证</strong>;(g) <strong>离线只做粗筛</strong>。<strong>度量</strong>——(a) OPE 估计 vs A/B;(b) 方差(重复估计的波动);(c) 有效轨迹长度;(d) 权重的分布。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'方差随轨迹长度指数增长'是关键</strong>——乘积效应使多步 IPS 几乎不可用;面试中能指出这一点是深度理解的标志。② <strong>'DR 的序列版方差更低'</strong>——用模型作基线;是长轨迹的实用选择。③ <strong>'模型基方法的误差累积'</strong>——模型误差在长轨迹上累积;故需与 IS 混合。④ <strong>'折扣因子缩短有效长度'</strong>——γ<1 使远期权重小(降方差);这是实用技巧。⑤ <strong>'离线强化学习'是更一般的问题</strong>——OPE 是其中的评估部分。⑥ <strong>面试要点</strong>——被问'序列决策怎么评估',应给出'<strong>多步 IPS(轨迹级权重)+ 方差指数增长 + 缓解(截断/DR/折扣/模型基/混合)</strong>';能指出'乘积效应'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕用多步 IPS 评估长轨迹(方差爆炸)
- ✕忽略'动作影响后续状态'(逐时刻独立评估)
🎯 Interviewer Follow-ups
- ?为什么不能逐时刻用 IPS?
- ?如何降低多步 IPS 的方差?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.