M5-051M5: NLP & Large Language ModelsDPO Family (DPO / KTO / ORPO)Hard
Mastery:
DPO Family (DPO / KTO / ORPO): 解释 online / iterative DPO 的做法与收益。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 用当前策略生成回答、标注偏好、再做 DPO;满足'数据来自当前策略'的假设并恢复在线探索能力。
📌 Key Takeaways
- •做法:当前策略采样 → 标注偏好 → DPO → 迭代
- •收益:满足 DPO 的数据假设 + 恢复在线探索
- •与 SPIN/self-rewarding 同属'自提升'范式
📐 Mathematical Derivations
数学机理:<strong>动机</strong>——DPO 的两个局限都源于'离线固定数据':(a) 推导假设偏好数据来自<strong>参考策略 π_ref</strong>,但实际数据常来自其他模型(假设被违反);(b) 无法<strong>探索</strong>数据之外的回答空间(上限受数据质量限制)。<strong>online / iterative DPO</strong> 的解法——迭代执行:(1) 用<strong>当前策略 π_k</strong> 生成多个回答;(2) 收集<strong>偏好标注</strong>(人工或 AI);(3) 用这些<strong>on-policy 数据</strong>做 DPO(参考模型可设为 π_k 或最初的 SFT 模型);(4) 得到 π_{k+1},重复。<strong>收益</strong>:(a) <strong>满足数据假设</strong>——数据来自当前策略,符合 DPO 推导的前提(故理论更可靠);(b) <strong>恢复在线探索</strong>——策略能在自己的输出空间上被优化(能发现'数据之外'的更好回答);(c) <strong>难度递进</strong>——随策略变强,偏好数据自然变难(提供更精细的信号);(d) <strong>可持续改进</strong>——每轮都提升。<strong>与相关方法的关系</strong>:(a) <strong>SPIN(Self-Play Fine-Tuning)</strong>——用'当前策略 vs 人类数据'构造偏好对(把人类数据当作 y_w、模型输出当作 y_l),迭代自提升;(b) <strong>self-rewarding</strong>——模型自己生成偏好标注(自我评估),减少人工;(c) <strong>iterative RLHF</strong>——同样的迭代思想但用 PPO/GRPO。<strong>成本</strong>——主要成本是 (a) <strong>反复采样</strong>(自回归生成慢)、(b) <strong>反复标注</strong>(人工贵,故常用 RLAIF);故 online DPO 常配'AI 标注 + 人工抽检'。<strong>实证</strong>——多个工作显示 iterative/online DPO 优于单轮 DPO(在同等标注预算下),且接近甚至超过 PPO 的效果(但工程更简单)。<strong>迭代次数</strong>——通常 2~5 轮(收益递减)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'online DPO 是 DPO 与 PPO 的折中'</strong>——它保留了 DPO 的'无 RL 循环、无 Critic、训练稳定'的优点,同时获得 PPO 的'在线探索'能力;代价是需采样与标注(但比 PPO 简单)。这是当前'性价比'很高的方案。② <strong>参考模型的选择</strong>——迭代时 π_ref 可固定为最初的 SFT 模型(保持'不偏离原始能力')或更新为上一轮策略(允许逐步偏离);前者更保守、后者更激进。③ <strong>'AI 标注'的必要性</strong>——人工无法支撑高频迭代;故 online DPO 几乎必然依赖 RLAIF(AI 标注);这引入 AI 偏见(需抽检与去偏)。④ <strong>与'拒绝采样微调(RFT)'的区别</strong>——RFT 用<strong>二值筛选</strong>(只保留正确/高分的)做 SFT;online DPO 用<strong>偏好对</strong>做对比损失(利用了'哪个更好'的相对信息)。故 DPO 的信息利用率更高(连'都不好但有一个更好'的样本也能用)。⑤ <strong>'自提升'的边界</strong>——若模型自己标注偏好(self-rewarding),则受限于模型自身的判断力(可能强化自身偏见);故常需'外部信号'(更强模型、程序验证、人类抽检)锚定。⑥ <strong>面试要点</strong>——被问'online DPO 解决什么',应给出'<strong>满足 DPO 的数据假设 + 恢复在线探索 + 难度递进</strong>',并说明'它是 DPO 与 PPO 的折中(简单 + 探索)'与'依赖 AI 标注';能区分'RFT(二值筛选)vs online DPO(偏好对)'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕认为 online DPO 不需要额外采样成本
- ✕用模型自标注而不做外部锚定(强化自身偏见)
🎯 Interviewer Follow-ups
- ?online DPO 与 iterative RLHF 的关系?
- ?标注成本如何控制?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.