M5-060M5: NLP & Large Language ModelsGRPO & Reasoning ModelsHard
Mastery:

GRPO & Reasoning Models: 解释 GRPO 的 group size 与采样效率。

📐 Mathematical Definition
cost∝G;baseline variance∝1G;degenerate if all ri equal\text{cost}\propto G;\qquad \text{baseline variance}\propto\frac{1}{G};\qquad \text{degenerate if all }r_i\ \text{equal}
⚡ Executive Summary
Core Concept: G 越大基线越准但采样成本 ∝G;G 太小则优势估计噪声大;常用 8~64,且需处理'全对/全错'的退化。

📌 Key Takeaways

  • •
    G 大:基线更准、优势噪声小,但采样成本 ∝G
  • •
    G 小:成本低但优势估计噪声大、训练不稳
  • •
    全对/全错时优势为 0(G 的成本被浪费)

📐 Mathematical Derivations

数学机理:<strong>G 的两个作用</strong>。<strong>(1) 基线估计的准确性</strong>——组内均值 mean(r) 作为基线,其<strong>方差 ∝ 1/G</strong>(样本均值方差的经典结论);故 G 越大基线越准、优势估计的噪声越小、训练越稳定。G 太小(如 2)则基线噪声大,优势信号被噪声淹没。<strong>(2) 采样成本</strong>——每个 prompt 需生成 G 个完整回答(自回归,成本 ∝G × 平均长度);G 越大成本越高(线性增长)。故存在'稳定性 vs 成本'的权衡,常用 <strong>G=8~64</strong>(小模型或困难任务用更大的 G,因为需要更多样本才能区分好坏)。<strong>退化问题</strong>——若某 prompt 的所有 G 个回答奖励相同(<strong>全对</strong>或<strong>全错</strong>),则组内标准差为 0、优势全为 0 → <strong>该 prompt 无梯度贡献</strong>,采样成本被浪费。<strong>这在推理任务中很常见</strong>:(a) 简单题全对;(b) 极难题全错。<strong>对策</strong>:(a) <strong>动态采样(DAPO)</strong>——检测到组内奖励无差异则丢弃/重新采样;(b) <strong>难度筛选</strong>——训练时优先用'中等难度'的题目(模型有对也有错,提供有效信号);(c) <strong>课程学习</strong>——随模型变强,逐步引入更难题目(保持'部分正确'的比例)。<strong>采样效率的其他维度</strong>:(a) <strong>并行采样</strong>——G 个回答可并行生成(用大 batch 的推理引擎),故墙钟时间不是 ∝G(但算力成本仍是);(b) <strong>前缀共享</strong>——同一 prompt 的 G 个回答可共享 prompt 的 KV cache(prefix caching),降低采样成本;(c) <strong>温度与多样性</strong>——需用较高的采样温度保证 G 个回答有差异(否则都相同、无区分度)。<strong>与'有效 batch'的关系</strong>——GRPO 的有效样本数 = prompts 数 × G;故'每个 prompt 采样 G 个'等效于扩大了 batch(但成本也增加)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'全对/全错浪费'是 GRPO 的效率痛点</strong>——尤其当训练数据难度分布不均时(大量简单题全对、少量难题全错),采样成本被大量浪费;动态采样与难度筛选是必需的。② <strong>'中等难度'是黄金区间</strong>——模型'一半对一半错'的题目提供最大梯度信号(优势的方差最大);这与'主动学习'的思想一致。故<strong>难度调度</strong>(随训练进展调整题目难度)是提升效率的关键。③ <strong>温度与多样性的必要性</strong>——若采样温度过低,G 个回答几乎相同(无区分度);故 RL 采样常用<strong>较高温度</strong>(如 0.7~1.0)以保证多样性。这与'推理时用低温求准确'形成对比。④ <strong>前缀缓存的收益</strong>——同一 prompt 的 G 个回答共享 prompt 部分(通常很长);用 prefix caching 可大幅降低采样成本(prompt 的 KV 只算一次)。这是工程优化的重点。⑤ <strong>与'组内归一化'的关系</strong>——标准差归一化使优势的尺度与奖励的绝对尺度无关;但若组内奖励差异极小(如都是 0.9~1.0),归一化会<strong>放大微小差异</strong>(可能放大噪声)。故需注意'奖励的粒度'(0/1 奖励比连续奖励更稳健)。⑥ <strong>面试要点</strong>——被问'GRPO 的 G 怎么选',应给出'<strong>G 大基线准但成本 ∝G、常用 8~64</strong>'与'<strong>全对/全错导致优势为 0 需动态采样</strong>',并说明'<strong>中等难度题目提供最大信号 → 难度调度</strong>'与'<strong>prefix caching 降低采样成本</strong>';能指出'高温度采样保证多样性'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    用低温度采样(G 个回答无差异,无梯度)
  • ✕
    不处理全对/全错(浪费采样成本)
🎯 Interviewer Follow-ups
  • ?
    G 与训练稳定性的定量关系?
  • ?
    如何减少'全对/全错'的浪费?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-059: GRPO & Reasoning Models: 解释推理模型的评估与成本权衡。📋Back to BankNext →M5-061: GRPO & Reasoning Models: 解释零 RL / RLVR 的 cold start 问题。