M7-047M7: Retrieval, Ranking & RecSys学习排序 (LTR)Medium
Mastery:
学习排序 (LTR): 解释排序中的位置偏置与去偏方法。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 用户倾向点击靠前结果(与相关性无关);需用'逆倾向加权(IPS)'或'点击模型'去偏,否则学到的模型会'放大已有排序'。
📌 Key Takeaways
- •位置偏置:排在前面的更易被点击(与相关性无关)
- •后果:直接训练点击数据会'放大已有排序'(自证预言)
- •去偏:IPS(逆倾向加权)、点击模型、随机化探索
📐 Mathematical Derivations
数学机理:<strong>位置偏置(position bias)</strong> 的来源——用户在结果列表中<strong>倾向点击靠前的项</strong>(即使相关性相同);这是<strong>注意力/信任</strong>导致的,而非相关性。<strong>后果(反馈循环)</strong>——(a) 模型学到的'高点击 = 高相关'其实是'高位置 = 高点击';(b) 训练出的新模型会<strong>继续把已排前的项排前</strong>(<strong>自证预言/反馈循环</strong>);(c) 好的新内容无法'冒头'(因为从未被展示在靠前位置);(d) 系统的'探索能力'下降。<strong>去偏方法</strong>——(1) <strong>IPS(Inverse Propensity Scoring)</strong>——用'逆倾向'加权:w_i=1/P(被观察到|位置);<strong>原理</strong>——把'被观察概率低'的样本(如排在第 10 位的)<strong>放大权重</strong>,使训练数据'模拟'成'随机展示'的数据;<strong>优点</strong>——理论上有无偏性;<strong>缺点</strong>——(a) <strong>方差大</strong>(倾向很小时权重爆炸);(b) 需<strong>已知倾向</strong>(或估计它)。(2) <strong>点击模型(click model)</strong>——(a) <strong>PBM(Position-Based Model)</strong>——P(click)=P(examine|pos)·P(rel);把'点击'分解为'被查看'与'相关';(b) <strong>级联模型(cascade model)</strong>——用户从上往下看,点击后可能停止;(c) <strong>用模型估计'相关性'</strong>(而非直接用点击);<strong>优点</strong>——更精细(考虑浏览行为);<strong>缺点</strong>——需假设与拟合。(3) <strong>随机化探索</strong>——(a) <strong>随机打乱部分结果</strong>(用随机排序收集无偏数据);(b) <strong>小流量随机实验</strong>;(c) <strong>bandit 探索</strong>(见冷启动的 EE 题);<strong>优点</strong>——从源头获得无偏数据;<strong>缺点</strong>——损害部分用户体验。(4) <strong>无偏 LTR(unbiased LTR)</strong>——把 IPS 权重嵌入 LTR 损失:L=Σ w_i·ℓ(s_i, y_i)(或对'对'加权);<strong>优点</strong>——理论上无偏;(5) <strong>特征层面</strong>——把'位置'作为特征(让模型学'位置的影响',从而分离'位置效应'与'相关性');<strong>注意</strong>——推理时不能用位置特征(否则又引入偏置)。<strong>评估</strong>——(a) <strong>离线评估也受偏置影响</strong>(历史数据是'有偏策略'产生的);故需 IPS/DR 估计(见离线评估与 OPE 题);(b) <strong>在线 A/B</strong> 是最终验证。<strong>与其他问题的关系</strong>——(a) 与'离线评估与 OPE'(同一套去偏工具);(b) 与'冷启动的 EE'(探索的必要性);(c) 与'反馈循环'(推荐系统的长期健康)。<strong>实践建议</strong>——(a) <strong>收集'随机化数据'</strong>(小流量随机排序)作为'金标准';(b) <strong>用 IPS 加权</strong>(配权重截断降方差);(c) <strong>点击模型</strong>(更精细);(d) <strong>位置作为特征但推理时不用</strong>(或用'位置无关'的模型);(e) <strong>监控反馈循环</strong>(新内容的曝光机会、结果的多样性);(f) <strong>在线 A/B 验证</strong>。<strong>度量</strong>——(a) 离线评估的偏置(与随机化数据的对比);(b) 在线指标(点击率、长期满意度);(c) 新内容/长尾的曝光率;(d) 结果的多样性。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'位置偏置导致反馈循环'是关键危害</strong>——它使系统'越来越窄';面试中能指出这一点是深度理解的标志。② <strong>'IPS 无偏但方差大'</strong>——故需权重截断或自归一化(见 OPE 题)。③ <strong>'随机化数据是金标准'</strong>——小流量随机排序可提供无偏训练数据;是'从源头解决'的方案。④ <strong>'位置作为特征但推理时不用'</strong>——这是个实用技巧(训练时让模型学位置效应,推理时置零/不用)。⑤ <strong>'离线评估也受偏置'</strong>——历史数据是'有偏策略'产生的;故离线评估需去偏(与 OPE 同源)。⑥ <strong>面试要点</strong>——被问'位置偏置怎么处理',应给出'<strong>IPS(逆倾向加权)+ 点击模型(PBM/级联)+ 随机化探索 + 无偏 LTR + 位置作特征</strong>'与'<strong>反馈循环是核心危害</strong>';能指出'离线评估也受偏置'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕直接用点击数据训练(放大已有排序)
- ✕用位置特征且推理时也用(引入偏置)
🎯 Interviewer Follow-ups
- ?为什么位置偏置会导致'反馈循环'?
- ?IPS 的方差问题?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.