大模型人类偏好对齐前沿算法:直接偏好优化 (DPO) vs 群组相对策略优化 (GRPO) 体系 (DPO vs GRPO Preference Alignment & Reasoning RL) 是让大模型输出符合人类安全价值观、提升推理能力 (Reasoning / Math) 的核心对齐工程技术;1) DPO (直接偏好优化): 摒弃了传统 PPO 复杂的奖励模型 (Reward Model) 与强化学习训练回路,直接通过解析推导将隐式奖励函数代入 Bradley-Terry 偏好模型,构建基于成对偏好数据
(x,yw,yl) 的优雅封闭式二分类交叉熵损失函数:
LDPO(θ)=−E[lnσ(βlnπref(yw∣x)πθ(yw∣x)−βlnπref(yl∣x)πθ(yl∣x))],训练极度稳定;2) GRPO (DeepSeekMath / DeepSeek-R1 核心采用的群组相对策略优化): 彻底淘汰传统 PPO 的 Critic 价值评估网络,对每个 Query 采样
G 个候选回答组成 Group,利用 Group 内部的相对奖励均值与标准差计算优势函数
Ai=std({r})ri−mean({r}),显存占用暴降 50%,是大模型强化学习长思维链推理 (o1 / R1) 的标准对齐算法。