M7-089M7: Retrieval, Ranking & RecSysOffline Evaluation & OPEHard
Mastery:
Offline Evaluation & OPE: 解释反事实评估的因果图与假设。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 用因果图(DAG)表达'混淆、动作、奖励'的关系;OPE 的目标是估计'干预(do)'的效果,需切断混淆路径。
📌 Key Takeaways
- •因果图(DAG):特征 X、动作 A、奖励 R
- •混淆:X 同时影响 A 与 R(后门路径)
- •OPE 目标:估计 P(R|do(A))(干预分布)而非 P(R|A)(观测分布)
📐 Mathematical Derivations
数学机理:<strong>因果图与反事实</strong>——(1) <strong>因果图(DAG)</strong>——用有向图表示变量间的因果关系:(a) <strong>X</strong>(上下文特征:用户/场景);(b) <strong>A</strong>(动作:展示哪个物品);(c) <strong>R</strong>(奖励:点击/转化);(d) <strong>边</strong>——X→A(特征影响策略的选择)、X→R(特征影响奖励)、A→R(动作影响奖励)。(2) <strong>混淆(confounding)</strong>——X 同时影响 A 与 R → 形成'后门路径' X→A 与 X→R;(a) <strong>后果</strong>——观测到的 P(R|A) <strong>不等于</strong>因果的 P(R|do(A))(因为 X 的分布在不同 A 下不同);(b) <strong>例子</strong>——'高价值用户更常被展示某广告' → 该广告的观测点击率高(但可能是用户本身爱点,而非广告效果好)。(3) <strong>OPE 的目标</strong>——估计<strong>干预分布(interventional distribution)</strong> P(R|do(A))('如果强制对所有用户展示动作 A,奖励的分布'),而非<strong>观测分布</strong> P(R|A)('历史中 A 被展示时的奖励')。(4) <strong>'do(A)'与'条件 A'的差异(核心)</strong>——(a) <strong>P(R|A=a)</strong>——'在历史中 A=a 的样本里,R 的分布'(受混淆影响);(b) <strong>P(R|do(A=a))</strong>——'<strong>干预</strong>设置 A=a(切断 X→A 的边)后,R 的分布'(因果效果);(c) <strong>两者相等当且仅当'无混淆'</strong>(X 不影响 A,或所有混淆都被观测并调整)。(5) <strong>后门准则(backdoor criterion)</strong>——若一组变量 Z 满足'阻断所有从 A 到 R 的后门路径'且'不含 A 的后代',则 P(R|do(A))=Σ_z P(R|A,Z=z)P(Z=z)(<strong>调整 Z 后可识别</strong>);<strong>意义</strong>——它给出'需要调整哪些变量'的判据。<strong>与 OPE 方法的对应</strong>——(a) <strong>IPS</strong>——本质是'用倾向 1/P(A|X) 加权'来'切断 X→A 的边'(重新加权使 A 与 X 独立);(b) <strong>DM</strong>——用模型预测'给定 X 与 A 的 R'(隐含'无混淆'假设);(c) <strong>DR</strong>——两者结合;(d) <strong>随机化</strong>——<strong>物理上</strong>切断 X→A 的边(最可靠)。<strong>其他因果概念</strong>——(a) <strong>反事实(counterfactual)</strong>——'如果当时选另一个动作会怎样'(不可观测);(b) <strong>中介(mediation)</strong>——A→M→R 的间接路径;(c) <strong>工具变量(IV)</strong>——有隐藏混淆时的识别策略;(d) <strong>敏感性分析</strong>——'若混淆强度为 X,估计偏差多大'。<strong>与其他问题的关系</strong>——(a) 与'为什么不能用历史数据'(混淆);(b) 与'位置偏置'(位置是混淆);(c) 与'样本选择偏差(SSB)'(同一类问题)。<strong>实践建议</strong>——(a) <strong>画因果图</strong>(明确混淆与路径);(b) <strong>明确目标是 P(R|do(A))</strong>(而非 P(R|A));(c) <strong>用后门准则</strong>判断'需要调整哪些变量';(d) <strong>倾向模型要包含所有混淆</strong>(否则 IPS 有偏);(e) <strong>敏感性分析</strong>(评估'未观测混淆'的影响);(f) <strong>随机化</strong>(最可靠)。<strong>度量</strong>——(a) OPE 估计 vs A/B(偏差);(b) 敏感性分析(未观测混淆的影响);(c) 后门调整的完备性。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'do(A) ≠ 条件 A'是因果推断的核心区分</strong>——面试中能准确解释这一点是深度理解的标志。② <strong>'后门准则给出需要调整的变量'</strong>——这是实践中的判据。③ <strong>'IPS 本质是切断 X→A 的边'</strong>——用重加权实现'干预';这是 IPS 的因果解释。④ <strong>'随机化是物理上切断边'</strong>——最可靠(不需假设)。⑤ <strong>'敏感性分析'评估未观测混淆</strong>——实用且重要(因为'无混淆'无法验证)。⑥ <strong>面试要点</strong>——被问'反事实评估的假设',应给出'<strong>因果图 + 混淆 + do(A) vs 条件 A + 后门准则 + IPS/随机化的因果解释 + 敏感性分析</strong>';能准确区分'do'与'条件'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕把 P(R|A) 当作 P(R|do(A))(混淆未调整)
- ✕不做敏感性分析(无法评估未观测混淆)
🎯 Interviewer Follow-ups
- ?'do(A)'与'条件 A'的差异?
- ?后门准则是什么?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.