M7-084M7: Retrieval, Ranking & RecSysOffline Evaluation & OPEEasy
Mastery:
Offline Evaluation & OPE: 写出 IPS 估计式并解释其方差问题。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: IPS 用'1/倾向'加权历史奖励,得到无偏估计;但倾向很小时权重爆炸 → 方差极大(需截断/自归一化)。
📌 Key Takeaways
- •用 π_new/π_old 的比值加权历史奖励
- •无偏(若 π_old 有正性)
- •方差大:π_old 小时权重爆炸
📐 Mathematical Derivations
数学机理:<strong>IPS(Inverse Propensity Scoring)</strong> 的推导——(1) <strong>目标</strong>——估计新策略 π_new 的期望奖励 V(π_new)=E_{x∼p(x), a∼π_new}[r(x,a)]。(2) <strong>关键恒等式</strong>——利用'重要性采样':E_{a∼π_new}[r] = E_{a∼π_old}[(π_new(a|x)/π_old(a|x))·r];<strong>为什么</strong>——因为 E_{a∼π_old}[w(a)·r] = Σ_a π_old(a|x)·(π_new(a|x)/π_old(a|x))·r(a) = Σ_a π_new(a|x)·r(a) = E_{a∼π_new}[r]。(3) <strong>估计式</strong>——V̂_IPS=(1/n)Σ_i [π_new(a_i|x_i)/π_old(a_i|x_i)]·r_i,其中 (x_i, a_i, r_i) 是历史数据(a_i 由 π_old 选择)。(4) <strong>性质</strong>——(a) <strong>无偏</strong>(若 π_old(a|x)>0 对所有 π_new 可能选的 a);(b) <strong>只需 π_old 已知</strong>(不需模型)。(5) <strong>方差问题(核心缺陷)</strong>——(a) 权重 w=π_new/π_old;若 π_old(a|x) <strong>很小</strong>(该物品很少被旧策略展示),则 w <strong>很大</strong>;(b) <strong>后果</strong>——(i) 单个样本可能主导估计(方差极大);(ii) 极端情况(π_old→0)权重爆炸(估计不可用);(c) <strong>量化</strong>——IPS 的方差 ∝ E[w²],而 w² 在 π_old 小时极大;故'倾向小的样本'是方差的主要来源;(d) <strong>有效样本量</strong>——ESS=(Σw)²/Σw²;若 ESS ≪ n,说明'少数样本主导'(估计不可靠)。<strong>缓解手段</strong>——(1) <strong>权重截断(clipping)</strong>——把 w 截断到 [0, M](如 M=10);<strong>代价</strong>——引入偏差(但方差降低);<strong>权衡</strong>——M 小则偏差大、M 大则方差大(经典的偏差-方差权衡)。(2) <strong>自归一化(self-normalized IPS,SNIPS)</strong>——V̂_SNIPS=Σ(w_i·r_i)/Σw_i;<strong>优点</strong>——(a) 有界(在 [min r, max r] 内);(b) 对'权重整体缩放'不敏感;(c) 实践中方差更小;<strong>缺点</strong>——轻微有偏(但'一致性'仍成立)。(3) <strong>混合(shrinkage)</strong>——把 w 向 1 收缩(w'=α·w+(1−α)·1);<strong>权衡</strong>——降低方差但引入偏差。(4) <strong>更好的倾向估计</strong>——若 π_old 未知,用模型估计('倾向模型');<strong>注意</strong>——倾向估计的误差会传播。(5) <strong>DR(Doubly Robust)</strong>——用模型作为基线(见下一题);<strong>优点</strong>——(a) 方差更低(因为模型解释了大部分变异);(b) <strong>双重稳健</strong>(模型或倾向之一正确即可无偏)。(6) <strong>限制支持集</strong>——只在'π_new 与 π_old 都有正概率'的动作集上评估(避免'外推')。<strong>与其他问题的关系</strong>——(a) 与'IPS 在 LTR 中的去偏'(位置偏置);(b) 与'DR'(下一题);(c) 与'权重截断'(下一题)。<strong>实践建议</strong>——(a) <strong>用 SNIPS</strong>(比原始 IPS 更稳);(b) <strong>权重截断</strong>(M=5~20);(c) <strong>监控 ESS</strong>(有效样本量);(d) <strong>检查正性</strong>(π_old 是否有 0);(e) <strong>优先用 DR</strong>(方差更低);(f) <strong>离线只做粗筛</strong>。<strong>度量</strong>——(a) OPE 估计 vs 在线 A/B(偏差);(b) ESS;(c) 权重的分布(最大权重);(d) 截断阈值的影响。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'IPS 无偏但方差大'是核心权衡</strong>——故需截断/自归一化;面试中能写出 IPS 公式并解释方差来源是深度理解的标志。② <strong>'ESS 是实用诊断</strong>——ESS ≪ n 说明估计不可靠。③ <strong>'SNIPS 有界且更稳'</strong>——实践中常用;虽有轻微偏差但方差优势明显。④ <strong>'权重截断是偏差-方差权衡'</strong>——M 小则偏差大、M 大则方差大。⑤ <strong>'正性假设'是 IPS 的前提</strong>——π_old 为 0 的动作无法估计(外推失败)。⑥ <strong>面试要点</strong>——被问'IPS 是什么',应写出<strong>估计式 + 无偏性推导(重要性采样)+ 方差问题(权重爆炸)+ 缓解(截断/SNIPS/DR)</strong>;能指出'ESS 诊断'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕用原始 IPS 不截断(方差爆炸)
- ✕不检查正性(π_old 为 0 时外推失败)
🎯 Interviewer Follow-ups
- ?为什么 IPS 是无偏的?
- ?权重截断的偏差-方差权衡?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.