M5-046M5: NLP & Large Language ModelsDPO Family (DPO / KTO / ORPO)Hard
Mastery:
DPO Family (DPO / KTO / ORPO): 解释 DPO 的失败模式与局限。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 数据分布外无效(假设数据来自参考策略)、易过拟合(似然下降)、长度偏置、对噪声敏感、无法在线探索。
📌 Key Takeaways
- •假设偏好数据来自参考策略;数据分布外效果差
- •似然位移(likelihood displacement):好回答的绝对概率反而下降
- •长度偏置、对噪声标签敏感、无在线探索
📐 Mathematical Derivations
数学机理:<strong>DPO 的五类失败模式</strong>。<strong>(1) 数据分布外(OOD)</strong>——DPO 的推导假设偏好数据来自<strong>参考策略 π_ref</strong>;若数据来自其他模型(人类写的、更强模型的输出),则假设被违反,DPO 会 (a) 过度提高'数据中的好回答'的概率、(b) 对分布外输入的泛化差。<strong>缓解</strong>:用 on-policy 数据(online DPO)。<strong>(2) 似然位移(likelihood displacement)</strong>——一个反直觉现象:DPO 训练后,<strong>被选中的好回答的绝对概率可能反而下降</strong>(虽然相对于坏回答上升了)。原因:DPO 只约束'log-ratio'(相对关系),故可通过<strong>同时降低</strong>好与坏回答的概率来增大比值;若坏回答降得更多,则比值为正但好回答的绝对概率下降。这导致 (a) 生成质量下降(因为绝对概率低)、(b) 模型'遗忘'好回答的生成方式。<strong>缓解</strong>:加 SFT 正则项(混合 SFT 损失)、或用带'绝对概率'约束的变体(如 IPO)。<strong>(3) 长度偏置</strong>——log π(y) 是逐 token 求和,长回答的 log-prob 天然更小;这使 DPO 倾向更长的回答。<strong>缓解</strong>:长度归一化(SimPO)、长度控制的数据、长度惩罚。<strong>(4) 对噪声标签敏感</strong>——偏好数据中的错误标签(标注者失误、AI 标注偏见)会被 DPO 直接学去(因为它是监督式的,无'验证'环节)。<strong>缓解</strong>:数据清洗、标签平滑、鲁棒变体(cDPO 等)。<strong>(5) 无在线探索</strong>——DPO 用固定数据,无法探索数据外的回答空间,故<strong>上限受数据质量限制</strong>(难以超越最好的数据)。<strong>缓解</strong>:online/iterative DPO。<strong>其他局限</strong>——(a) <strong>超参 β 敏感</strong>;(b) <strong>对 prompt 分布敏感</strong>;(c) <strong>不支持'部分正确'的奖励</strong>(只支持二值偏好)。<strong>对比</strong>——这些问题大多源于'DPO 是离线、监督式的方法';在线方法(PPO/GRPO)在探索与迭代上更强,但工程更复杂。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'似然位移'是最反直觉也最重要的失败模式</strong>——它说明'相对偏好提升'与'绝对生成质量'可以脱钩;这解释了为什么纯 DPO 有时生成质量下降(尽管偏好指标提升)。理解这一点是 DPO 实践的关键。② <strong>'加 SFT 正则'是常用的缓解</strong>——在 DPO 损失中混入一定比例的 SFT 损失(对好回答的 NLL),可 (a) 防止绝对概率下降、(b) 保持生成质量;这是许多实现的默认做法(如 TRL 的 DPO 支持 <code>sft_loss</code> 混合)。③ <strong>'数据质量决定上限'</strong>——因为 DPO 无探索,其效果上限是'数据中最好的回答';故'用强模型生成的好回答做数据'比'用弱模型'更有效(这也是 DPO 数据常由强模型蒸馏的原因)。④ <strong>与'online DPO'的关系</strong>——online DPO 用当前策略生成回答 + 标注偏好,从而 (a) 满足'数据来自当前策略'的假设、(b) 获得在线探索能力;代价是需采样与标注(成本上升)。⑤ <strong>β 的敏感性</strong>——β 太小则过度优化偏好(似然位移严重);太大则学不动。故需调参(常用 0.1~0.5)。⑥ <strong>面试要点</strong>——被问'DPO 有什么问题',应给出'<strong>OOD 数据无效 + 似然位移(绝对概率下降)+ 长度偏置 + 噪声敏感 + 无探索</strong>'五类,并给出'<strong>online DPO / SFT 正则 / 长度归一化 / 数据清洗</strong>'等缓解;能解释'似然位移'的机制是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为 DPO 训练后好回答的概率必然上升(可能下降)
- ✕用来自其他模型的偏好数据做 DPO 而不做 online 化
🎯 Interviewer Follow-ups
- ?什么是'似然位移'?
- ?如何缓解 DPO 的长度偏置?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.