返回 强化学习 思维导图
中文·English
🎮 强化学习ID: grpo

GRPO 组相对策略优化

Group Relative Policy Optimization
🎯核心定义
GRPO (Group Relative Policy Optimization, 组相对策略优化) 是 DeepSeekMath/R1 系列采用的在线策略优化算法,面向可验证奖励 (RLVR) 的推理强化。核心机制分三步: (1) 对提示 qq 采样 GG 个回答 {o1,,oG}\{o_1, \dots, o_G\}; (2) 验证器给每个回答打分 rir_i,组内归一化得到 Advantage: Ai=rimean(r1,,rG)std(r1,,rG)A_i = \frac{r_i - \text{mean}(r_1, \dots, r_G)}{\text{std}(r_1, \dots, r_G)} 即减去组均值、除以组标准差——组内 AiA_i 均值为 0、标准差为 1,Advantage 只依赖组内相对排名、与奖励绝对尺度无关,这是免去 Critic 的关键; (3) 把 AiA_i 代入 PPO 式截断代理目标并加 KL 正则,得到完整目标: JGRPO(θ)=E[1Gi=1Gmin(πθ(oiq)πθold(oiq)Ai,  clip(πθ(oiq)πθold(oiq),1ε,1+ε)Ai)βDKL(πθπref)]\mathcal{J}_{GRPO}(\theta) = \mathbb{E}\left[ \frac{1}{G} \sum_{i=1}^{G} \min\left( \frac{\pi_\theta(o_i|q)}{\pi_{\theta_{old}}(o_i|q)} A_i, \; \operatorname{clip}\left( \frac{\pi_\theta(o_i|q)}{\pi_{\theta_{old}}(o_i|q)}, \, 1-\varepsilon, \, 1+\varepsilon \right) A_i \right) - \beta\, D_{KL}(\pi_\theta \| \pi_{ref}) \right] 概率比 πθ(oiq)/πθold(oiq)\pi_\theta(o_i|q)/\pi_{\theta_{old}}(o_i|q) 度量新旧策略对第 ii 个回答的偏差,min\min + clip\operatorname{clip} (ε\varepsilon 通常取 0.2) 限制单步更新幅度;βDKL(πθπref)\beta D_{KL}(\pi_\theta \| \pi_{ref}) 惩罚策略偏离参考策略 πref\pi_{ref},实践中用非归一化 KL 估计 DKLE[πref(oq)πθ(oq)logπref(oq)πθ(oq)1]D_{KL} \approx \mathbb{E}\left[ \frac{\pi_{ref}(o|q)}{\pi_\theta(o|q)} - \log\frac{\pi_{ref}(o|q)}{\pi_\theta(o|q)} - 1 \right],方差更小且恒非负。
📌核心概述
为什么免 Critic 省显存: PPO 的 Advantage 由 GAE 估计 At=δt+γλδt+1+γ2λ2δt+2+A_t = \delta_t + \gamma\lambda\delta_{t+1} + \gamma^2\lambda^2\delta_{t+2} + \dots,其中 TD 误差 δt=rt+γV(st+1)V(st)\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t) 依赖价值网络 VϕV_\phi——价值网络与策略同规模,其参数、梯度与优化器状态 (Adam 一阶/二阶矩) 的显存开销约等于再训一个同规模大模型,千亿级 LLM 上近乎不可行;GRPO 用一次前向采样 + 组内统计量替代整个价值网络,省掉 Critic 的前向/反向与 GAE 展开,训练显存近似降低一个同规模模型的量级——这正是 DeepSeek-V3/R1 能在 671B MoE 上做全参 RL 的关键。组内相对化还有额外收益:奖励绝对尺度漂移 (如从 0.5 涨到 0.8) 不改变组内排名,AiA_i 不变,训练对奖励尺度天然鲁棒。
💡使用场景
数学、代码等有可验证奖励的推理强化 (RLVR) 任务;奖励稀疏、需要大量探索时尤其合适;o1/R1 类推理模型的后训练标配,也用于通用对话策略优化。
解决的核心痛点
PPO+Critic 的显存与算力瓶颈、奖励尺度漂移导致的训练不稳定;GRPO 以组内相对化同时解决两者,配合显式 KL 正则防止策略漂移与崩溃。与 DPO 互补:GRPO 需要在线采样与验证器,适合 RLVR;DPO 离线,适合静态偏好数据对齐。
🎯5 个高频面试考点 (Exam Points)
1
写出 GRPO 组内 Advantage 公式,并解释为什么组内归一化能免去 Critic?
2
写出 GRPO 完整目标函数 (概率比、clip、KL 项),说明各符号含义?
3
GRPO 相比 PPO 为什么省显存?对比两者的显存构成 (价值网络/GAE)?
4
KL 惩罚项的作用?为什么用非归一化 KL 估计?组内相对化如何抗奖励尺度漂移?
5
GRPO、PPO、DPO 三者的适用场景与选择标准?
📖 关联深度指南:📄 alignment-and-rlhf-dpo
更新于 2026-08-12
🎯
检验攻克程度:针对「GRPO 组相对策略优化」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点具身智能与机器人下一个知识点DPO 直接偏好优化

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化