M5-056M5: NLP & Large Language ModelsGRPO & Reasoning ModelsMedium
Mastery:
GRPO & Reasoning Models: 解释 GSPO 的改进动机。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: GRPO 的 token 级重要性比在长序列下方差爆炸;GSPO 用序列级(长度归一化)的重要性比,稳定长 CoT 训练。
📌 Key Takeaways
- •GRPO 的 ratio 是 token 级 → 长序列下乘积方差大
- •GSPO 用序列级(几何平均)ratio,尺度稳定
- •长 CoT 训练中 GSPO 更稳定(不易崩溃)
📐 Mathematical Derivations
数学机理:<strong>GRPO 的问题</strong>——GRPO 沿用 PPO 的 <strong>token 级重要性比</strong>:ρ_t=π_θ(y_t|·)/π_old(y_t|·),损失对每个 token 计算并平均。<strong>问题在于</strong>:(a) 序列的<strong>联合</strong>概率比是各 token 比的<strong>乘积</strong>:π_θ(y)/π_old(y)=∏_t ρ_t;当序列很长(长 CoT 可能数千 token)时,即使每个 ρ_t 接近 1,<strong>乘积的方差也会随长度指数增长</strong>(因为每个 token 的小偏差会累积);(b) 这导致 (i) 梯度估计的<strong>方差爆炸</strong>、(ii) clip 在长序列上频繁触发(因为某些 token 的 ρ_t 越界)、(iii) 训练不稳定甚至崩溃;(c) 更本质地,<strong>'哪个 token 的偏差导致了序列级奖励变化'是不明确的</strong>(信用分配问题)。<strong>GSPO(Group Sequence Policy Optimization)</strong> 的改进——用<strong>序列级</strong>的重要性比,并做<strong>长度归一化</strong>(几何平均):ρ=(π_θ(y|x)/π_old(y|x))^{1/|y|}(即序列级 log-ratio 除以长度)。<strong>效果</strong>:(a) <strong>尺度稳定</strong>——几何平均使 ratio 不随长度爆炸;(b) <strong>与序列级奖励对齐</strong>——因为奖励是序列级的,用序列级 ratio 更自然;(c) <strong>clip 更合理</strong>——在序列级裁剪(而非 token 级)避免了'长序列必然触发 clip'的问题;(d) <strong>长 CoT 训练更稳</strong>——这是 GSPO 的主要卖点(长推理模型训练中的稳定性)。<strong>相关方法</strong>——(a) <strong>Dr.GRPO</strong>:去掉 GRPO 中'除以长度'的偏置(GRPO 的损失按 token 平均,导致长回答的每个 token 权重更小,间接鼓励长输出);(b) <strong>DAPO</strong> 的'clip-higher'(非对称裁剪)也针对长序列的稳定性。<strong>共同主题</strong>——<strong>长序列 RL 的'信用分配与尺度'问题</strong>是 GRPO 系方法的核心改进方向。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'长序列下 ratio 乘积的方差'是关键洞察</strong>——它解释了为什么'短序列上工作良好的 GRPO 在长 CoT 上崩溃';这也是推理模型(长 CoT)训练需要专门算法改进的原因。② <strong>'序列级 vs token 级'的取舍</strong>——token 级 ratio 提供更细的信用分配(每个 token 单独裁剪);序列级 ratio 更稳定但与'每 token 的贡献'脱钩。GSPO 选择'稳定优先'(因为长 CoT 的稳定性是瓶颈)。③ <strong>长度归一化的重要性</strong>——不加归一化的序列级 ratio(直接 ∏ρ_t)会因长度指数偏离;几何平均(除以 |y|)使其成为'每 token 的平均偏差',尺度合理。④ <strong>与'长度偏置'的关系</strong>——GRPO 的损失按 token 平均会<strong>间接鼓励长输出</strong>(因为长回答的每个 token 权重小、且总损失被稀释);Dr.GRPO 通过'按序列而非 token 归一化'修正。这是'损失归一化方式影响长度'的又一例证(与 DPO 的长度偏置同源)。⑤ <strong>工程复杂度</strong>——GSPO 的实现改动不大(只需改 ratio 的计算与裁剪位置),但需与现有框架(如 TRL/verl)适配。⑥ <strong>面试要点</strong>——被问'GSPO 改进了什么',应给出'<strong>GRPO 的 token 级 ratio 在长序列下方差爆炸(乘积效应)→ GSPO 用序列级几何平均 ratio → 长 CoT 训练更稳</strong>',并联系到'信用分配与长度归一化';能提到 Dr.GRPO 的'按序列归一化修正长度偏置'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为 token 级 ratio 与序列级 ratio 等价(长序列下差异巨大)
- ✕忽略损失归一化方式对输出长度的影响
🎯 Interviewer Follow-ups
- ?为什么 token 级 ratio 在长序列下不稳?
- ?GSPO 与 GRPO 的差异在实现上如何体现?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.