M5-054M5: NLP & Large Language ModelsGRPO & Reasoning ModelsEasy
Mastery:
GRPO & Reasoning Models: 写出 GRPO 的优势估计与损失。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 对每个 prompt 采样一组回答,用组内奖励的均值/标准差归一化作为优势(替代 Critic),再做 PPO 式裁剪优化。
📌 Key Takeaways
- •对每个 prompt 采样 G 个回答(一个 group)
- •优势 = (r_i − 组内均值)/组内标准差
- •去掉 Critic,用组内统计作为基线
📐 Mathematical Derivations
数学机理:<strong>GRPO(Group Relative Policy Optimization,DeepSeekMath)</strong> 的核心创新是<strong>用'组内相对奖励'替代 Critic</strong>。(1) <strong>采样组(group)</strong>——对每个 prompt x,用当前策略采样 <strong>G 个回答</strong>(如 G=8~64):{y_1, …, y_G};(2) <strong>计算奖励</strong>——对每个回答算奖励 r_i(可为 RM 打分或<strong>可验证奖励</strong>如答案对错);(3) <strong>组内归一化作为优势</strong>——Â_i=(r_i − mean(r))/std(r);这表示'该回答比同组平均好多少(以标准差为单位)';(4) <strong>PPO 式优化</strong>——用 Â_i 作为优势,做与 PPO 相同的裁剪优化(含 KL 惩罚)。<strong>为什么组内均值是好基线</strong>——(a) <strong>消去'题目难度'</strong>——同一 prompt 的 G 个回答共享相同难度,故组内比较自动扣除难度(比 Critic 估计的价值更准);(b) <strong>无需 Critic</strong>——省一个模型(显存与训练复杂度大降);(c) <strong>低方差</strong>——组内 G 个样本的均值是比单样本回报更好的基线。<strong>与 PPO 的对比</strong>——PPO 用 Critic V(s) 估计基线(需训练价值网络、且状态空间巨大难以准确);GRPO 用'同 prompt 的样本均值'(无需训练、天然准确)。<strong>与 RLOO 的关系</strong>——RLOO 用'留一法均值'(对第 i 个样本用其余样本的均值作基线);GRPO 用'全组均值 + 标准差归一化'(更简单且归一化使尺度一致)。<strong>优势的广播</strong>——Â_i 是<strong>序列级</strong>的(整个回答一个值),广播到该回答的所有 token(因为奖励是序列级的)。<strong>G 的选择</strong>——G 越大基线越准但采样成本越高(∝G);常用 8~64。<strong>注意</strong>——组内标准差为 0 时(所有回答奖励相同)优势为 0(无梯度),这是'全对或全错'的常见情况(需用其他技巧,如 DAPO 的动态采样)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'组内相对'的优雅性</strong>——它把'绝对奖励'转为'相对排名',天然处理了'奖励尺度不定'与'难度差异'两个问题;这是 GRPO 在 LLM 场景优于 PPO 的关键。② <strong>G 的成本-收益</strong>——采样 G 个回答的成本 ∝G(自回归生成),但 G 越大优势估计越准;实践中 G=8~16 常见(G=64 用于小模型或困难任务)。③ <strong>'全对/全错'的退化</strong>——若某 prompt 的所有 G 个回答都对(或都错),则组内奖励无差异、优势为 0(无梯度);这浪费了采样成本。<strong>DAPO</strong> 的'动态采样'正是解决此问题(过滤掉这类 prompt)。④ <strong>与可验证奖励的天然契合</strong>——GRPO 的奖励可以是'答案是否正确'(0/1),此时组内归一化直接给出'相对好坏';这使 GRPO 成为 <strong>RLVR</strong> 的主流算法(DeepSeek-R1 采用)。⑤ <strong>KL 惩罚仍需</strong>——GRPO 保留了 KL 惩罚(防偏离参考模型与语言退化);这是与 DPO 的重要区别(DPO 的 KL 是隐式的)。⑥ <strong>面试要点</strong>——被问'GRPO 是什么',应写出'<strong>组内采样 → 组内均值/标准差归一化作为优势 → PPO 式裁剪</strong>'并解释'<strong>组内基线消去难度、省去 Critic</strong>';能指出'全对/全错时优势为 0(需动态采样)'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为 GRPO 完全不需要基线(用组内均值作基线)
- ✕忽略'全对/全错'导致优势为 0 的退化
🎯 Interviewer Follow-ups
- ?为什么组内均值是好的基线?
- ?G 取多大合适?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.