返回 强化学习 思维导图
中文·English
🎮 强化学习ID: dpo

DPO 直接偏好优化

Direct Preference Optimization
🎯核心定义
DPO (Direct Preference Optimization, 直接偏好优化) 把带 KL 正则的 RLHF 目标重新参数化,导出只依赖策略概率比的闭式损失,省掉奖励模型与在线 RL 循环。配分函数 Z(x)Z(x) 消掉的推导链 (3 步): ① 带 KL 约束的 RLHF 目标 maxπEx,yπ[r(x,y)]βDKL(ππref)\max_\pi \mathbb{E}_{x, y \sim \pi}[r(x,y)] - \beta\, D_{KL}(\pi \| \pi_{ref}) 有闭式最优解 π(yx)=1Z(x)πref(yx)er(x,y)/β\pi^*(y|x) = \frac{1}{Z(x)}\, \pi_{ref}(y|x)\, e^{r(x,y)/\beta},其中配分函数 Z(x)=yπref(yx)er(x,y)/βZ(x) = \sum_y \pi_{ref}(y|x)\, e^{r(x,y)/\beta} 只与输入 xx 有关、与输出 yy 无关; ② 重排得到隐式奖励 r(x,y)=βlogπ(yx)πref(yx)+βlogZ(x)r(x,y) = \beta \log \frac{\pi^*(y|x)}{\pi_{ref}(y|x)} + \beta \log Z(x); ③ 代入 Bradley-Terry 偏好模型 P(ywyl)=σ(r(x,yw)r(x,yl))P(y_w \succ y_l) = \sigma\left(r(x, y_w) - r(x, y_l)\right):两项相减时 βlogZ(x)\beta \log Z(x) 完全抵消 (因 ZZ 不依赖 yy),偏好概率仅由概率比决定—— P(ywyl)=σ(βlogπ(ywx)πref(ywx)βlogπ(ylx)πref(ylx))P(y_w \succ y_l) = \sigma\left( \beta \log \frac{\pi^*(y_w|x)}{\pi_{ref}(y_w|x)} - \beta \log \frac{\pi^*(y_l|x)}{\pi_{ref}(y_l|x)} \right) 训练时用 πθ\pi_\theta 替换 π\pi^* 并最大化偏好数据似然,取负对数得 DPO 损失: LDPO(θ)=E(x,yw,yl)D[logσ(βlogπθ(ywx)πref(ywx)βlogπθ(ylx)πref(ylx))]\mathcal{L}_{DPO}(\theta) = -\mathbb{E}_{(x, y_w, y_l) \sim \mathcal{D}}\left[ \log \sigma\left( \beta \log \frac{\pi_\theta(y_w|x)}{\pi_{ref}(y_w|x)} - \beta \log \frac{\pi_\theta(y_l|x)}{\pi_{ref}(y_l|x)} \right) \right] ywy_w/yly_l 为偏好对的 chosen/rejected;πref\pi_{ref} 为参考策略 (通常取 SFT 后的模型);β\beta 为温度/正则强度:β\beta 越大策略越保守贴近 πref\pi_{ref}、KL 越小但偏好利用弱;β\beta 越小策略越激进贴合偏好数据、收益更高但易过拟合/风格漂移/退化 (如长度偏置与奖励模仿)。
💡使用场景
离线偏好对齐 (安全性、有用性、风格),只要存在对比偏好对即可使用;开源社区 "SFT → DPO" 是低成本对齐标配;也可与 GRPO 混合使用 (在线 RLVR + 离线偏好正则)。
解决的核心痛点
RLHF 四阶段流水线 (奖励模型训练 → 在线采样 → PPO → KL 调参) 工程复杂、训练不稳定、显存开销大;DPO 一步监督训练完成对齐,去掉奖励模型与 RL 循环、无需在线采样,显存与算力需求大幅下降;代价是偏好数据质量直接决定效果——数据噪声、长度偏置、参考模型偏差都会被直接放大。
🎯5 个高频面试考点 (Exam Points)
1
写出 DPO 损失函数,解释各符号 (y_w/y_l/π_ref/β) 的含义?
2
推导:配分函数 Z(x) 是如何消掉的?列出闭式解与 3 步推导链?
3
β 的含义?β 大与小分别有什么影响?
4
DPO 为什么不需要奖励模型和强化学习?它与 RLHF 目标的关系?
5
DPO vs GRPO 的选择标准?DPO 的主要局限 (数据质量、长度偏置、参考模型作用)?
📖 关联深度指南:📄 alignment-and-rlhf-dpo
更新于 2026-08-12
🎯
检验攻克程度:针对「DPO 直接偏好优化」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点GRPO 组相对策略优化下一个知识点思维链与推理强化

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机CQL 保守 Q 学习