M7-063M7: Retrieval, Ranking & RecSysDeep Recommendation ModelsHard
Mastery:
Deep Recommendation Models: 解释 ESMM 解决样本选择偏差(SSB)的思路。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: CTR 与 CVR 的样本空间不同(CVR 只在点击样本上训练);ESMM 在全样本空间建模 'pCTCVR = pCTR × pCVR',用 CTCVR 的标签训练。
📌 Key Takeaways
- •问题:CVR 只在'点击'样本上训练(样本空间有偏)
- •SSB:训练分布(点击样本)≠ 推理分布(全样本)
- •ESMM:建模 pCTCVR = pCTR × pCVR,在全样本上训练,共享嵌入
📐 Mathematical Derivations
数学机理:<strong>两个问题</strong>——(1) <strong>样本选择偏差(Sample Selection Bias,SSB)</strong>——(a) <strong>CVR(转化率)</strong> 的定义是'<strong>在点击的条件下</strong>转化的概率':p(conversion | click);(b) 故 CVR 模型<strong>只能用'点击'样本训练</strong>(因为'未点击'的样本不知道'是否会转化');(c) <strong>问题</strong>——训练分布(<strong>点击样本</strong>)与推理分布(<strong>全样本</strong>)<strong>不一致</strong>;(d) <strong>后果</strong>——(i) 模型学到的是'点击样本上的规律'(而这些样本是'有偏'的——被点击的物品与未被点击的物品不同);(ii) 推理时(对全样本预估)表现下降;(e) <strong>本质</strong>——这是'分布偏移'问题(训练分布 ≠ 推理分布)。(2) <strong>数据稀疏(DS)</strong>——点击样本远少于曝光样本(CTR 常 1%~10%)→ CVR 的训练数据更少 → 更易过拟合。<strong>ESMM(Entire Space Multi-task Model,Ma 等 2018,阿里)</strong> 的解法——(1) <strong>核心恒等式</strong>——利用概率的乘法关系:<strong>p(CTCVR) = p(CTR) × p(CVR)</strong>,其中 CTCVR = '点击且转化'(即'曝光后的转化');(2) <strong>在全样本空间建模</strong>——(a) <strong>CTR 塔</strong>——预测 p(CTR)(用<strong>全样本</strong>训练,因为'是否点击'对全样本已知);(b) <strong>CVR 塔</strong>——预测 p(CVR)(<strong>但不用 CVR 的标签训练!</strong>);(c) <strong>CTCVR 塔</strong>——把两个塔的输出<strong>相乘</strong>:p(CTCVR) = p(CTR) × p(CVR),用 <strong>CTCVR 的标签(全样本已知)</strong> 训练;(d) <strong>关键</strong>——<strong>CVR 塔虽然只在'点击样本'上有意义,但它的参数通过'CTCVR 塔的损失'在'全样本'上被训练</strong>(因为 CTCVR 的标签对全样本已知);(e) 这<strong>绕过了'CVR 只能点击样本训练'的限制</strong>——CVR 塔在全样本空间上被间接训练。(3) <strong>共享嵌入</strong>——两个塔<strong>共享特征嵌入</strong>(CTR 塔有大量数据,可帮助 CVR 塔学习更好的嵌入);<strong>效果</strong>——缓解 CVR 的数据稀疏。(4) <strong>推理</strong>——预估 CVR 时,直接用 CVR 塔的输出(或 CTR×CVR 得到 CTCVR)。<strong>优势</strong>——(a) <strong>消除 SSB</strong>(CVR 塔在全样本空间训练);(b) <strong>缓解数据稀疏</strong>(共享嵌入 + 全样本训练);(c) <strong>端到端</strong>(一个模型);(d) <strong>简单有效</strong>。<strong>实证</strong>——ESMM 在阿里的场景显著提升 CVR 预估(AUC 提升数点);成为'CVR 预估'的标准方法。<strong>后续发展</strong>——(a) <strong>ESM2</strong>(多任务版本,加入'是否购买'等多个目标);(b) <strong>HM3(Hierarchical Multi-task)</strong>(建模'点击→加购→购买'的层级);(c) <strong>MMoE + ESMM 组合</strong>(多任务 + 全样本空间)。<strong>与其他问题的关系</strong>——(a) 与'样本选择偏差'(推荐/广告的普遍问题);(b) 与'多任务学习'(共享嵌入);(c) 与'因果推断'(SSB 是因果问题——'点击'是一个'后处理变量')。<strong>实践建议</strong>——(a) <strong>CVR 预估用 ESMM</strong>(消除 SSB);(b) <strong>共享嵌入</strong>(缓解稀疏);(c) <strong>多级转化(点击→加购→购买)</strong> 用 HM3;(d) <strong>监控'训练分布 vs 推理分布'的差异</strong>;(e) <strong>与多任务模型组合</strong>。<strong>度量</strong>——(a) CVR 的 AUC;(b) 校准(预估 CVR vs 实际);(c) 在线 GMV/转化率。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'SSB 的本质是分布偏移'</strong>——训练分布(点击样本)≠ 推理分布(全样本);面试中能指出这一点是深度理解的标志。② <strong>'用 pCTCVR = pCTR × pCVR 绕过限制'是 ESMM 的核心洞察</strong>——它让 CVR 塔在全样本空间被间接训练。③ <strong>'共享嵌入缓解稀疏'</strong>——CTR 塔的大数据帮助 CVR 塔;这是多任务的经典价值。④ <strong>'SSB 是因果问题'</strong>——'点击'是'后处理变量'(post-treatment);这与因果推断的'选择偏差'同源。⑤ <strong>'HM3 建模多级转化'</strong>——点击→加购→购买 的层级关系;比单一 CVR 更细。⑥ <strong>面试要点</strong>——被问'ESMM 解决什么',应给出'<strong>SSB(CVR 只在点击样本训练 → 分布偏移)+ pCTCVR = pCTR × pCVR(在全样本上训练)+ 共享嵌入</strong>';能指出'SSB 本质是分布偏移'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕CVR 只在点击样本上训练(分布偏移)
- ✕不用共享嵌入(CVR 数据稀疏)
🎯 Interviewer Follow-ups
- ?什么是'样本选择偏差(SSB)'?
- ?ESMM 如何'在全样本上训练 CVR'?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.