M5-042M5: NLP & Large Language ModelsDPO Family (DPO / KTO / ORPO)Easy
Mastery:
DPO Family (DPO / KTO / ORPO): 完整推导 DPO 损失。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 从'带 KL 约束的奖励最大化'的闭式最优策略出发,反解出奖励的表达式,代入偏好似然,消去奖励得 DPO 损失。
📌 Key Takeaways
- •① RLHF 目标:max E[r] − β·KL(π‖π_ref)
- •② 该问题的闭式最优解:π* ∝ π_ref·e^{r/β}
- •③ 反解 r = β log(π*/π_ref) + β log Z
- •④ 代入 BT 偏好似然,Z 相消 → DPO 损失
📐 Mathematical Derivations
数学机理:<strong>四步推导</strong>。<strong>第①步:RLHF 的目标</strong>——max_{π} E_{x∼D, y∼π}[r(x,y)] − β·KL(π(·|x)‖π_ref(·|x))。<strong>第②步:闭式最优解</strong>——这是一个'带 KL 正则的期望奖励最大化'问题;用变分法可解出最优策略的<strong>闭式形式</strong>:π*(y|x) = (1/Z(x))·π_ref(y|x)·exp(r(x,y)/β),其中 Z(x)=Σ_y π_ref(y|x)exp(r(x,y)/β) 是归一化常数(配分函数)。<strong>直觉</strong>——最优策略是在参考策略的基础上,按'奖励的指数'重新加权(奖励高的回答概率被放大)。<strong>第③步:反解奖励</strong>——把上式取对数并整理:r(x,y) = β·log(π*(y|x)/π_ref(y|x)) + β·log Z(x)。<strong>关键</strong>——奖励可表示为'策略与参考策略的 log-ratio'加上一个只依赖 x 的常数项。<strong>第④步:代入偏好似然</strong>——用 BT 模型,偏好概率为 σ(r(x,y_w)−r(x,y_l));把第③步的表达式代入:r(y_w)−r(y_l) = β log(π*(y_w)/π_ref(y_w)) − β log(π*(y_l)/π_ref(y_l)),<strong>注意 β log Z(x) 两项相消</strong>(因为 Z 只依赖 x,在 y_w 与 y_l 中相同)。于是得到 DPO 损失:L_DPO = −E[log σ(β log(π_θ(y_w)/π_ref(y_w)) − β log(π_θ(y_l)/π_ref(y_l)))]。<strong>核心洞察</strong>——<strong>奖励被'隐式地'表示为策略与参考策略的 log-ratio</strong>,故无需显式的奖励模型、也无需 RL 采样;直接用偏好对做'类监督'的优化即可。<strong>隐含的奖励</strong>——r̂(x,y)=β log(π_θ(y|·)/π_ref(y|·)) 被称为 <strong>DPO 的隐式奖励</strong>,可用于推理时重排(见后续题)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'Z 相消'是推导的关键</strong>——配分函数 Z(x) 通常不可计算(需对所有可能回答求和),但它在偏好对中<strong>恰好相消</strong>(因为只依赖 x);这是 DPO 能实用的数学前提。② <strong>β 的作用</strong>——β 控制'对偏好信号的信任程度':β 大则更'信任'偏好(允许更大偏离参考模型)、β 小则更保守(贴近参考模型);与 RLHF 中 KL 系数作用一致。实践中 β 常取 0.1~0.5。③ <strong>DPO 的'类监督'性质</strong>——DPO 损失形式上是'对偏好对的二分类'(哪个更好),故训练像 SFT 一样稳定(无需 RL 循环、无需 Critic、无需在线采样);这使 DPO 的工程成本远低于 PPO。④ <strong>DPO 的隐含假设</strong>——推导假设'偏好数据来自参考策略 π_ref 的分布'(即数据是用 π_ref 采样得到的);若数据来自其他模型(人类写的、其他模型的输出),则假设被违反、效果下降(这是 DPO 的局限,催生 online DPO)。⑤ <strong>与'奖励模型'的等价性</strong>——DPO 的隐式奖励可用于 (a) 评估、(b) 推理时重排(best-of-N 用隐式奖励打分)、(c) 分析策略与参考的差异。⑥ <strong>面试要点</strong>——被问'推导 DPO',应能写出<strong>四步</strong>并强调'<strong>Z 相消</strong>'这一关键;能指出'DPO 隐式奖励 = β·log-ratio'与'数据需来自参考策略'这两个要点是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕推导时忘记 Z 相消(以为需要计算配分函数)
- ✕忽略 DPO 假设偏好数据来自参考策略
🎯 Interviewer Follow-ups
- ?DPO 损失中 β 的作用?
- ?DPO 为什么不需要奖励模型与采样?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.