M5-056M5: NLP & Large Language ModelsGRPO & Reasoning ModelsMedium
Mastery:

GRPO & Reasoning Models: 解释 GSPO 的改进动机。

📐 Mathematical Definition
GRPO: ρt=πθ(yt∣⋅)πold(yt∣⋅);GSPO: ρ=(πθ(y∣x)πold(y∣x))1/∣y∣\text{GRPO}:\ \rho_t=\frac{\pi_\theta(y_t|\cdot)}{\pi_{\text{old}}(y_t|\cdot)};\qquad \text{GSPO}:\ \rho=\left(\frac{\pi_\theta(y|x)}{\pi_{\text{old}}(y|x)}\right)^{1/|y|}
⚡ Executive Summary
Core Concept: GRPO 的 token 级重要性比在长序列下方差爆炸;GSPO 用序列级(长度归一化)的重要性比,稳定长 CoT 训练。

📌 Key Takeaways

  • •
    GRPO 的 ratio 是 token 级 → 长序列下乘积方差大
  • •
    GSPO 用序列级(几何平均)ratio,尺度稳定
  • •
    长 CoT 训练中 GSPO 更稳定(不易崩溃)

📐 Mathematical Derivations

数学机理:<strong>GRPO 的问题</strong>——GRPO 沿用 PPO 的 <strong>token 级重要性比</strong>:ρ_t=π_θ(y_t|·)/π_old(y_t|·),损失对每个 token 计算并平均。<strong>问题在于</strong>:(a) 序列的<strong>联合</strong>概率比是各 token 比的<strong>乘积</strong>:π_θ(y)/π_old(y)=∏_t ρ_t;当序列很长(长 CoT 可能数千 token)时,即使每个 ρ_t 接近 1,<strong>乘积的方差也会随长度指数增长</strong>(因为每个 token 的小偏差会累积);(b) 这导致 (i) 梯度估计的<strong>方差爆炸</strong>、(ii) clip 在长序列上频繁触发(因为某些 token 的 ρ_t 越界)、(iii) 训练不稳定甚至崩溃;(c) 更本质地,<strong>'哪个 token 的偏差导致了序列级奖励变化'是不明确的</strong>(信用分配问题)。<strong>GSPO(Group Sequence Policy Optimization)</strong> 的改进——用<strong>序列级</strong>的重要性比,并做<strong>长度归一化</strong>(几何平均):ρ=(π_θ(y|x)/π_old(y|x))^{1/|y|}(即序列级 log-ratio 除以长度)。<strong>效果</strong>:(a) <strong>尺度稳定</strong>——几何平均使 ratio 不随长度爆炸;(b) <strong>与序列级奖励对齐</strong>——因为奖励是序列级的,用序列级 ratio 更自然;(c) <strong>clip 更合理</strong>——在序列级裁剪(而非 token 级)避免了'长序列必然触发 clip'的问题;(d) <strong>长 CoT 训练更稳</strong>——这是 GSPO 的主要卖点(长推理模型训练中的稳定性)。<strong>相关方法</strong>——(a) <strong>Dr.GRPO</strong>:去掉 GRPO 中'除以长度'的偏置(GRPO 的损失按 token 平均,导致长回答的每个 token 权重更小,间接鼓励长输出);(b) <strong>DAPO</strong> 的'clip-higher'(非对称裁剪)也针对长序列的稳定性。<strong>共同主题</strong>——<strong>长序列 RL 的'信用分配与尺度'问题</strong>是 GRPO 系方法的核心改进方向。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'长序列下 ratio 乘积的方差'是关键洞察</strong>——它解释了为什么'短序列上工作良好的 GRPO 在长 CoT 上崩溃';这也是推理模型(长 CoT)训练需要专门算法改进的原因。② <strong>'序列级 vs token 级'的取舍</strong>——token 级 ratio 提供更细的信用分配(每个 token 单独裁剪);序列级 ratio 更稳定但与'每 token 的贡献'脱钩。GSPO 选择'稳定优先'(因为长 CoT 的稳定性是瓶颈)。③ <strong>长度归一化的重要性</strong>——不加归一化的序列级 ratio(直接 ∏ρ_t)会因长度指数偏离;几何平均(除以 |y|)使其成为'每 token 的平均偏差',尺度合理。④ <strong>与'长度偏置'的关系</strong>——GRPO 的损失按 token 平均会<strong>间接鼓励长输出</strong>(因为长回答的每个 token 权重小、且总损失被稀释);Dr.GRPO 通过'按序列而非 token 归一化'修正。这是'损失归一化方式影响长度'的又一例证(与 DPO 的长度偏置同源)。⑤ <strong>工程复杂度</strong>——GSPO 的实现改动不大(只需改 ratio 的计算与裁剪位置),但需与现有框架(如 TRL/verl)适配。⑥ <strong>面试要点</strong>——被问'GSPO 改进了什么',应给出'<strong>GRPO 的 token 级 ratio 在长序列下方差爆炸(乘积效应)→ GSPO 用序列级几何平均 ratio → 长 CoT 训练更稳</strong>',并联系到'信用分配与长度归一化';能提到 Dr.GRPO 的'按序列归一化修正长度偏置'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    以为 token 级 ratio 与序列级 ratio 等价(长序列下差异巨大)
  • ✕
    忽略损失归一化方式对输出长度的影响
🎯 Interviewer Follow-ups
  • ?
    为什么 token 级 ratio 在长序列下不稳?
  • ?
    GSPO 与 GRPO 的差异在实现上如何体现?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-055: GRPO & Reasoning Models: 解释可验证奖励(RLVR)与它的优势。📋Back to BankNext →M5-057: GRPO & Reasoning Models: 解释 DAPO 的改进点。