TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
GRPO 相对策略优化
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
grpo
GRPO 相对策略优化
Group Relative Policy Optimization
🎯
核心定义
GRPO (Group Relative Policy Optimization, 组相对策略优化) 是 DeepSeek-R1 采用的强化学习对齐方法。核心思想:对同一个提示采样
G
G
G
个回答,用组内回答的相对得分计算 Advantage —— 减去组均值、除以组标准差,从而完全去掉价值网络 (Critic),Advantage 的计算只依赖组内排名而非绝对分数。
💡
使用场景
大规模推理模型的强化学习(数学、代码等有可验证奖励的任务),DeepSeek-R1/V3 系列标配;也适用于奖励信号稀疏、需要大量探索的推理强化场景。
⚡
解决的核心痛点
PPO 需要训练一个与策略同规模的价值网络,显存开销巨大(约等于多训一个大模型);GRPO 用组内统计替代价值网络,训练显存显著下降,且组内相对化天然抗奖励尺度漂移。
🎯
5 个高频面试考点 (Exam Points)
1
GRPO 相比 PPO 的核心改进是什么?为什么能去掉 Critic 网络?
2
GRPO 的 Advantage 如何计算?组内相对化公式是什么?
3
GRPO 在 DeepSeek-R1 中如何使用可验证奖励 (RLVR) 做推理强化?
4
GRPO 组大小 G 对训练的影响?KL 惩罚项如何设计?
5
GRPO 和 DPO 的适用场景有什么区别?
📖 关联深度指南:
📄 alignment-and-rlhf-dpo →
更新于 2026-08-11
🎯
检验攻克程度:针对「GRPO 相对策略优化」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
无参考对齐 SimPO/ORPO/KTO
下一个知识点 →
对齐税与偏好数据
🔗 更多 大语言模型 知识点卡片
Agent 与工具调用
缩放点积注意力
注意力变体 MHA/MQA/GQA
评测基准 MMLU/GSM8K