返回 大语言模型 思维导图
中文·English
大语言模型ID: grpo

GRPO 相对策略优化

Group Relative Policy Optimization
🎯核心定义
GRPO (Group Relative Policy Optimization, 组相对策略优化) 是 DeepSeek-R1 采用的强化学习对齐方法。核心思想:对同一个提示采样 GG 个回答,用组内回答的相对得分计算 Advantage —— 减去组均值、除以组标准差,从而完全去掉价值网络 (Critic),Advantage 的计算只依赖组内排名而非绝对分数。
💡使用场景
大规模推理模型的强化学习(数学、代码等有可验证奖励的任务),DeepSeek-R1/V3 系列标配;也适用于奖励信号稀疏、需要大量探索的推理强化场景。
解决的核心痛点
PPO 需要训练一个与策略同规模的价值网络,显存开销巨大(约等于多训一个大模型);GRPO 用组内统计替代价值网络,训练显存显著下降,且组内相对化天然抗奖励尺度漂移。
🎯5 个高频面试考点 (Exam Points)
1
GRPO 相比 PPO 的核心改进是什么?为什么能去掉 Critic 网络?
2
GRPO 的 Advantage 如何计算?组内相对化公式是什么?
3
GRPO 在 DeepSeek-R1 中如何使用可验证奖励 (RLVR) 做推理强化?
4
GRPO 组大小 G 对训练的影响?KL 惩罚项如何设计?
5
GRPO 和 DPO 的适用场景有什么区别?
📖 关联深度指南:📄 alignment-and-rlhf-dpo
更新于 2026-08-11
🎯
检验攻克程度:针对「GRPO 相对策略优化」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点无参考对齐 SimPO/ORPO/KTO下一个知识点对齐税与偏好数据

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用缩放点积注意力注意力变体 MHA/MQA/GQA评测基准 MMLU/GSM8K