返回 AIE 系统工程师 思维导图
中文·English
🚀 AIE 系统工程师ID: aie-dpo-grpo-preference-alignment

DPO vs GRPO 偏好对齐算法

DPO vs GRPO Preference Alignment
🎯核心定义
大模型人类偏好对齐前沿算法:直接偏好优化 (DPO) vs 群组相对策略优化 (GRPO) 体系 (DPO vs GRPO Preference Alignment & Reasoning RL) 是让大模型输出符合人类安全价值观、提升推理能力 (Reasoning / Math) 的核心对齐工程技术;1) DPO (直接偏好优化): 摒弃了传统 PPO 复杂的奖励模型 (Reward Model) 与强化学习训练回路,直接通过解析推导将隐式奖励函数代入 Bradley-Terry 偏好模型,构建基于成对偏好数据 (x,yw,yl)(x, y_w, y_l) 的优雅封闭式二分类交叉熵损失函数:LDPO(θ)=E[lnσ(βlnπθ(ywx)πref(ywx)βlnπθ(ylx)πref(ylx))]\mathcal{L}_{\text{DPO}}(\theta) = -\mathbb{E}\left[\ln \sigma\left(\beta \ln \frac{\pi_\theta(y_w|x)}{\pi_{\text{ref}}(y_w|x)} - \beta \ln \frac{\pi_\theta(y_l|x)}{\pi_{\text{ref}}(y_l|x)}\right)\right],训练极度稳定;2) GRPO (DeepSeekMath / DeepSeek-R1 核心采用的群组相对策略优化): 彻底淘汰传统 PPO 的 Critic 价值评估网络,对每个 Query 采样 GG 个候选回答组成 Group,利用 Group 内部的相对奖励均值与标准差计算优势函数 Ai=rimean({r})std({r})A_i = \frac{r_i - \text{mean}(\{r\})}{\text{std}(\{r\})},显存占用暴降 50%,是大模型强化学习长思维链推理 (o1 / R1) 的标准对齐算法。
💡使用场景
大模型安全性与幻觉抑制对齐、数学与代码逻辑长推理模型训练、对话风格微调。
解决的核心痛点
传统 PPO 训练需要同时在显存中维护 4 个大模型(Actor, Critic, Reward, Reference),训练极易发散崩盘且显存翻倍;DPO 与 GRPO 分别通过隐式解析和群组优势消除 Critic,实现了极速、极稳、低显存的现代偏好对齐。
🎯5 个高频面试考点 (Exam Points)
1
详细推导 DPO 如何从 Bradley-Terry 模型 P(y1y2x)=σ(r(x,y1)r(x,y2))P(y_1 \succ y_2|x) = \sigma(r(x, y_1) - r(x, y_2)) 严格推导出不含显式奖励函数 rr 的参数化损失公式?
2
DPO 中超参数 β\beta (通常设为 0.1~0.5) 的物理意义:如何控制当前策略与参考策略 πref\pi_{\text{ref}} 之间的 KL 散度漂移惩罚?
3
GRPO (Group Relative Policy Optimization) 为什么不需要 Critic 模型?详细画出其基于 Group 采样与优势标准化的算法流程图?
4
DeepSeek-R1 式纯强化学习训练:如何通过基于规则的奖励 (Rule-based Rewards: 编译器通过率、数学答案正确性、XML 格式标签) 驱动模型涌现长思考链?
5
DPO 训练中常见的问题:负样本似然同时下降 (Likelihood Displacement) 与数据偏好分布不平衡时的调优排障?
🔗核心前置底层技术卡片 (点击穿透复习)
更新于 2026-08-14
🎯
检验攻克程度:针对「DPO vs GRPO 偏好对齐算法」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点LoRA/QLoRA 显存与权重合并下一个知识点微调灾难性遗忘防范与重放

🔗 更多 AIE 系统工程师 知识点卡片

AIE vs MLE 能力模型与演进高级 Prompt 链与防越狱注入结构化输出与约束解码评估体系 RAGAS 与 SWE-bench