M7-088M7: Retrieval, Ranking & RecSysOffline Evaluation & OPEHard
Mastery:

Offline Evaluation & OPE: 解释 OPE 的适用条件与失败模式。

📐 Mathematical Definition
assumptions: unconfoundedness, positivity, SUTVA;violation⇒fail\text{assumptions}:\ \text{unconfoundedness},\ \text{positivity},\ \text{SUTVA};\qquad \text{violation}\Rightarrow\text{fail}
⚡ Executive Summary
Core Concept: OPE 需三大假设(无混淆/正性/SUTVA);常见失败:正性违反(新策略选新物品)、混淆、干扰、非平稳。

📌 Key Takeaways

  • •
    无混淆:展示只依赖可观测特征
  • •
    正性/重叠:新策略的动作在历史中有非零展示概率
  • •
    SUTVA:无干扰;另有'非平稳'(分布随时间变化)

📐 Mathematical Derivations

数学机理:<strong>OPE 的三大假设</strong>——(1) <strong>无混淆(unconfoundedness / ignorability)</strong>——'展示'(动作)只依赖<strong>可观测的特征</strong>(无隐藏的混淆变量);<strong>违反的后果</strong>——估计有偏(因为'隐藏因素'同时影响展示与奖励);<strong>例子</strong>——'高价值用户更可能被展示广告'(若'用户价值'未观测,则估计有偏)。(2) <strong>正性/重叠(positivity / overlap)</strong>——新策略会选的<strong>每个动作</strong>在历史数据中都有<strong>非零</strong>的展示概率(π_old(a|x)>0);<strong>违反的后果</strong>——(a) <strong>无法估计</strong>(该动作无数据 → 外推);(b) 权重爆炸(π_old→0);<strong>这是最易违反的假设</strong>——新策略常'推荐历史上没出现过的物品'(如新物品、长尾);<strong>检测</strong>——检查'新策略的动作在历史中的展示率'(若有动作的展示率为 0 → 违反)。(3) <strong>SUTVA(Stable Unit Treatment Value Assumption)</strong>——(a) <strong>无干扰(no interference)</strong>——一个物品的反馈不受'其他被展示物品'影响;(b) <strong>无隐藏变体</strong>——同一动作只有一个版本;<strong>违反的后果</strong>——估计有偏;<strong>例子</strong>——推荐列表的'位置'影响点击(同一物品在不同位置点击率不同 → '动作'不只是'展示哪个物品',还包括'位置')。(4) <strong>非平稳(non-stationarity)</strong>——(a) 用户兴趣/物品质量/市场随时间变化;(b) 历史数据的分布与当前不同;(c) <strong>违反的后果</strong>——估计不适用(历史不代表现在);(d) <strong>对策</strong>——(i) 用'近期数据';(ii) 加'时间特征';(iii) 监控漂移。<strong>其他失败模式</strong>——(a) <strong>倾向模型错误</strong>(π_old 估计不准 → IPS 有偏);(b) <strong>模型错误</strong>(DR 的模型不准 → 修正项方差大);(c) <strong>奖励的定义问题</strong>(奖励延迟、稀疏);(d) <strong>特征缺失</strong>(历史日志未记录某些特征 → 无法建模);(e) <strong>'动作空间大'</strong>(推荐的动作空间百万级 → 倾向极难估计)。<strong>检测与缓解</strong>——(a) <strong>正性检查</strong>——统计'新策略动作的历史展示率';(b) <strong>重叠度</strong>——计算'有效样本量(ESS)';(c) <strong>倾向模型诊断</strong>(AUC/校准);(d) <strong>模拟实验</strong>(用合成数据验证 OPE 的准确性);(e) <strong>与 A/B 对比</strong>(最终验证);(f) <strong>限制动作空间</strong>(只在'重叠区'评估);(g) <strong>用'随机化数据'补充</strong>(打破混淆与正性问题)。<strong>实践建议</strong>——(a) <strong>先检查假设</strong>(尤其正性);(b) <strong>保留随机化数据</strong>(小流量随机是'金标准');(c) <strong>限制评估范围</strong>(只在重叠区);(d) <strong>倾向模型要诊断</strong>;(e) <strong>与 A/B 对比</strong>(最终验证);(f) <strong>注意非平稳</strong>(用近期数据);(g) <strong>离线只做粗筛</strong>。<strong>度量</strong>——(a) 正性违反率;(b) ESS;(c) 倾向模型的 AUC/校准;(d) OPE vs A/B 的偏差。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'正性最易违反'是关键</strong>——新策略常推荐历史未展示的物品;面试中能指出这一点是深度理解的标志。② <strong>'位置是动作的一部分'</strong>——若'动作'只定义为'展示哪个物品'而忽略位置,则 SUTVA 违反(位置影响点击)。③ <strong>'随机化数据是金标准'</strong>——它能同时解决'混淆'与'正性'问题(因为随机策略对所有动作有正概率)。④ <strong>'非平稳'常被忽视</strong>——历史数据不代表现在;故需用近期数据。⑤ <strong>'倾向模型诊断'必需</strong>——π_old 估计不准则 IPS 有偏。⑥ <strong>面试要点</strong>——被问'OPE 什么时候失效',应给出'<strong>三大假设(无混淆/正性/SUTVA)+ 非平稳 + 其他失败(倾向错/模型错/奖励定义/特征缺失)+ 检测与缓解</strong>';能指出'正性最易违反'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    不检查正性(新策略动作无历史数据)
  • ✕
    忽略'位置是动作的一部分'(SUTVA 违反)
🎯 Interviewer Follow-ups
  • ?
    哪个假设最易违反?
  • ?
    违反假设时如何检测?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM7-087: Offline Evaluation & OPE: 解释离线评估与在线 A/B 的相关性验证。📋Back to BankNext →M7-089: Offline Evaluation & OPE: 解释反事实评估的因果图与假设。