返回 大语言模型 思维导图
中文·English
大语言模型ID: dpo

DPO 直接偏好优化

Direct Preference Optimization
🎯核心定义
DPO (Direct Preference Optimization, 直接偏好优化) 是一种无需奖励模型和强化学习的对齐方法。核心洞察:RLHF 的奖励模型隐式定义了一个最优策略,DPO 把这个闭式解代回目标函数,配分函数 Z(x)Z(x) 被消掉,训练退化为对偏好对 (chosen/rejected) 的监督学习,损失只依赖策略与参考策略的概率比。
💡使用场景
将 LLM 对齐到人类偏好(安全性、风格、有用性);只要偏好数据以对比对形式存在即可使用,是 RLHF 的轻量替代,也是开源社区微调的首选(如对齐到 helpful/harmless 数据)。
解决的核心痛点
RLHF 需要训练奖励模型 + 在线采样 + PPO 四步流水线,工程复杂且训练不稳定;DPO 一步监督训练完成对齐,省掉奖励模型和 RL 循环,显存与算力需求大幅下降。
🎯5 个高频面试考点 (Exam Points)
1
DPO 和 RLHF 的核心区别是什么?DPO 为什么不需要奖励模型和强化学习?
2
DPO 的损失函数推导:配分函数 Z(x) 是如何被消掉的?
3
DPO 的 β 超参数是什么含义?β 大和小分别有什么影响?
4
DPO 和 GRPO 的区别是什么?分别适用什么场景?
5
DPO 的局限:为什么有人说 DPO 对偏好数据质量敏感?参考模型在其中起什么作用?
📖 关联深度指南:📄 alignment-and-rlhf-dpo
更新于 2026-08-11
🎯
检验攻克程度:针对「DPO 直接偏好优化」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点PPO 截断损失下一个知识点无参考对齐 SimPO/ORPO/KTO

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA