M5-053M5: NLP & Large Language ModelsDPO Family (DPO / KTO / ORPO)Medium
Mastery:
DPO Family (DPO / KTO / ORPO): 解释 DPO 与 SFT 的混合训练策略。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 在 DPO 损失中混入一定比例的 SFT 损失(对好回答的 NLL),可防止似然位移、保持生成质量与语言能力。
📌 Key Takeaways
- •纯 DPO 会导致似然位移(好回答绝对概率下降)
- •混入 SFT 损失(对 y_w 的 NLL)可锚定绝对概率
- •α 常取 0.01~0.1;也可用'先 SFT 再 DPO'的两阶段
📐 Mathematical Derivations
数学机理:<strong>动机</strong>——纯 DPO 只约束'好回答相对坏回答的 log-ratio',故可通过'同时降低两者的绝对概率'来增大比值(<strong>似然位移</strong>),导致 (a) 生成质量下降(绝对概率低)、(b) 语言能力退化(输出不自然)、(c) 灾难性遗忘。<strong>混合策略</strong>——在 DPO 损失中加入 <strong>SFT 损失</strong>(对<strong>好回答 y_w</strong> 的负对数似然):L=L_DPO + α·L_SFT(y_w),其中 L_SFT(y_w)=−log π_θ(y_w|x)。<strong>作用机制</strong>——SFT 项<strong>直接提高好回答的绝对概率</strong>(而非仅相对),从而 (a) 锚定绝对概率(防似然位移)、(b) 保持生成质量与流畅性、(c) 缓解遗忘。<strong>α 的选择</strong>——(a) <strong>α 太小</strong>(如 0.001)无效果(DPO 主导);(b) <strong>α 太大</strong>(如 1)则退化为 SFT(失去偏好优化效果);(c) 常用 <strong>0.01~0.1</strong>(TRL 的 DPO 支持 <code>sft_loss</code> 混合)。<strong>其他等价/相关做法</strong>:(a) <strong>两阶段</strong>——先 SFT、再纯 DPO(简单但可能在 DPO 阶段仍出现似然位移);(b) <strong>参考模型的锚定</strong>——DPO 的 log-ratio 已含 π_ref(提供一定锚定),但不够(因为 π_ref 固定,不能阻止 π_θ 绝对概率下降);(c) <strong>RPO/IPO 等变体</strong>——用有界目标从结构上防止过度优化。<strong>实证</strong>——多个工作显示'DPO + SFT 混合'在生成质量与流畅性上优于纯 DPO,且对'语言退化'有显著缓解。<strong>注意</strong>——混合 SFT 也会 (a) 稍微削弱偏好优化的强度、(b) 增加一个超参 α;但收益通常大于成本。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'似然位移'是混合 SFT 的直接动机</strong>——理解这一点是掌握该技巧的关键;它说明'相对偏好'与'绝对质量'是两个维度,需分别优化。② <strong>α 的调参经验</strong>——实践中常从 0.01~0.05 起步,观察'输出长度/流畅性/偏好准确率'三个指标;若流畅性下降则增大 α。③ <strong>与'两阶段训练'的对比</strong>——两阶段(SFT → DPO)更简单,但 DPO 阶段仍可能破坏 SFT 学到的流畅性;混合(同时优化)能在训练过程中持续锚定。故混合更稳健。④ <strong>与'online DPO'的关系</strong>——online DPO 用当前策略的数据,似然位移的风险相对小(因为数据与策略分布一致);但混合 SFT 仍是有益的补充。⑤ <strong>'遗忘'的检测</strong>——混合 SFT 能缓解遗忘,但仍需在<strong>通用基准</strong>上验证(如 MMLU、常识推理);若遗忘明显,可增大 α 或混入通用数据。⑥ <strong>面试要点</strong>——被问'DPO 训练要注意什么',应给出'<strong>似然位移 → 混合 SFT 损失(对 y_w 的 NLL,α≈0.01~0.1)→ 锚定绝对概率、保持流畅性</strong>',并说明'α 太小无效、太大退化为 SFT';能解释'似然位移的机制(同时降低两者以增大比值)'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕纯 DPO 训练导致输出不自然(似然位移)
- ✕α 设得过大使 DPO 退化为 SFT
🎯 Interviewer Follow-ups
- ?为什么混合 SFT 能缓解似然位移?
- ?α 太大有什么问题?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.