GRPO (Group Relative Policy Optimization, 组相对策略优化) 是 DeepSeekMath/R1 系列采用的在线策略优化算法,面向可验证奖励 (RLVR) 的推理强化。核心机制分三步: (1) 对提示
q 采样
G 个回答
{o1,…,oG}; (2) 验证器给每个回答打分
ri,组内归一化得到 Advantage:
Ai=std(r1,…,rG)ri−mean(r1,…,rG)
即减去组均值、除以组标准差——组内
Ai 均值为 0、标准差为 1,Advantage 只依赖组内相对排名、与奖励绝对尺度无关,这是免去 Critic 的关键; (3) 把
Ai 代入 PPO 式截断代理目标并加 KL 正则,得到完整目标:
JGRPO(θ)=E[G1i=1∑Gmin(πθold(oi∣q)πθ(oi∣q)Ai,clip(πθold(oi∣q)πθ(oi∣q),1−ε,1+ε)Ai)−βDKL(πθ∥πref)]
概率比
πθ(oi∣q)/πθold(oi∣q) 度量新旧策略对第
i 个回答的偏差,
min +
clip (
ε 通常取 0.2) 限制单步更新幅度;
βDKL(πθ∥πref) 惩罚策略偏离参考策略
πref,实践中用非归一化 KL 估计
DKL≈E[πθ(o∣q)πref(o∣q)−logπθ(o∣q)πref(o∣q)−1],方差更小且恒非负。