M5-043M5: NLP & Large Language ModelsDPO Family (DPO / KTO / ORPO)Easy
Mastery:
DPO Family (DPO / KTO / ORPO): 比较 PPO、DPO 与 GRPO 的依赖与适用场景。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: PPO 需 RM+Critic+在线采样;DPO 只需偏好对与参考模型;GRPO 去 Critic、用组内基线、需可验证奖励。
📌 Key Takeaways
- •PPO:最强但最复杂(4 模型、在线采样)
- •DPO:最简单(无需 RM/RL),但无在线探索
- •GRPO:介于两者(无 Critic,但需采样与奖励)
📐 Mathematical Derivations
数学机理:<strong>三者的依赖与机制</strong>。<strong>PPO(RLHF 标准)</strong>——依赖:(a) <strong>奖励模型</strong>(RM,需偏好数据训练);(b) <strong>Critic</strong>(价值网络,需训练);(c) <strong>Reference</strong>(参考模型,算 KL);(d) <strong>在线采样</strong>(每轮用当前策略生成)。<strong>优点</strong>——最强的能力(在线探索、可迭代改进、可处理任意奖励)。<strong>缺点</strong>——工程复杂(4 模型、显存大)、训练不稳、采样慢、超参多。<strong>DPO</strong>——依赖:(a) <strong>偏好对数据</strong>;(b) <strong>参考模型</strong>(通常是 SFT 模型)。<strong>机制</strong>——直接把偏好对做对比损失(见推导),无需 RM、无需 RL 循环、无需采样。<strong>优点</strong>——简单稳定(像 SFT)、成本低、易复现。<strong>缺点</strong>——(a) <strong>无在线探索</strong>(用固定数据,无法探索数据外的区域);(b) <strong>假设数据来自参考策略</strong>(否则效果下降);(c) 无法利用'未通过验证'的样本(不像 RL 可用部分奖励)。<strong>GRPO(Group Relative Policy Optimization)</strong>——依赖:(a) <strong>奖励函数</strong>(可为 RM 或<strong>可验证奖励</strong>如答案对错);(b) <strong>在线采样</strong>(每个 prompt 采样一组回答);<strong>去掉 Critic</strong>(用<strong>组内平均奖励作为基线</strong>)。<strong>机制</strong>——对每个 prompt 采样 G 个回答,计算各自奖励,用 (r_i − mean)/std 作为优势(组内归一化),再用 PPO 式损失优化(但无 Critic)。<strong>优点</strong>——比 PPO 省一个模型、比 DPO 有在线探索能力;特别适合<strong>可验证奖励</strong>(数学/代码:奖励是'答案是否正确')。<strong>缺点</strong>——需采样(慢)、奖励需可靠、仍有 RL 的不稳定性。<strong>选择逻辑</strong>——(a) <strong>有偏好数据、求简单稳定</strong> → DPO;(b) <strong>有可验证奖励(数学/代码)、求推理能力</strong> → GRPO/RLVR;(c) <strong>需最强对齐、有充足资源</strong> → PPO(+ 迭代 RM);(d) <strong>实践路径</strong>:DPO 起步 → 不足再上 GRPO/PPO。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'在线探索'是 PPO/GRPO 相对 DPO 的核心优势</strong>——在线采样使策略能探索'偏好数据之外'的回答空间,从而发现更好的回答;DPO 只能在固定数据的'支撑集'内优化(这也是'DPO 难以超越数据质量'的原因)。② <strong>'奖励的来源'决定方法选择</strong>——(a) 有<strong>人类偏好</strong> → DPO/PPO;(b) 有<strong>可验证奖励</strong>(答案对错、测试通过) → GRPO/RLVR(最可靠);(c) 有<strong>AI 反馈</strong> → RLAIF 系列。故'先问奖励从哪来'是选择方法的第一步。③ <strong>GRPO 的'组内基线'为何有效</strong>——同一 prompt 的多个回答共享相同的'难度',故组内比较能消去'题目难度'这一混淆因素;这使基线估计更准(比 Critic 更简单且往往更好)。④ <strong>与'推理模型'的关系</strong>——推理任务(数学/代码)天然有可验证奖励,故 GRPO/RLVR 成为推理模型训练的主流(DeepSeek-R1 等)。⑤ <strong>成本对比</strong>——DPO(无采样、无 RM、无 Critic)<< GRPO(需采样,无 Critic)< PPO(需采样 + RM + Critic)。故'先用 DPO,不够再升级'是经济的选择。⑥ <strong>面试要点</strong>——被问'PPO/DPO/GRPO 怎么选',应给出'<strong>依赖(RM/Critic/采样)+ 在线探索能力 + 奖励类型 + 成本</strong>'的四维对比与选择逻辑;能指出'奖励来源决定方法选择'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕认为 DPO 全面优于 PPO(DPO 无在线探索)
- ✕在可验证任务上用 DPO 而非 GRPO/RLVR
🎯 Interviewer Follow-ups
- ?什么场景该用 PPO 而非 DPO?
- ?GRPO 为什么适合推理任务?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.