M5-058M5: NLP & Large Language ModelsGRPO & Reasoning ModelsHard
Mastery:
GRPO & Reasoning Models: 解释推理模型的训练范式(长 CoT + RL)。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 用 RLVR 训练模型生成更长的推理链(CoT),奖励正确性;模型自发学会自我验证、回溯与更长的思考。
📌 Key Takeaways
- •长 CoT 是 RL 的涌现结果(不是人工教的)
- •奖励 = 答案正确性(RLVR),无需过程标注
- •模型自发学会:自我验证、回溯、多路径探索
📐 Mathematical Derivations
数学机理:<strong>推理模型的训练范式</strong>——核心是'用 RL 优化可验证奖励,让模型<strong>自发</strong>学会长链推理'。<strong>关键发现(DeepSeek-R1 等)</strong>:(1) <strong>长 CoT 自发涌现</strong>——从基座模型开始纯 RL(无 SFT 冷启动)也能观察到:模型学会生成<strong>更长的推理链</strong>(包含'等一下,让我重新检查…'、'换个思路…'等),且<strong>正确率随之提升</strong>;这被称为 'aha moment'(模型自发学会回溯与自我验证)。(2) <strong>奖励只需结果</strong>——用 0/1 的'答案是否正确'奖励即可,<strong>不需要过程标注</strong>(过程奖励模型虽可加速但非必需)。(3) <strong>行为涌现</strong>——模型学会:(a) <strong>自我验证</strong>(检查自己的推导)、(b) <strong>回溯</strong>(发现错误后重来)、(c) <strong>多路径探索</strong>(尝试不同解法)、(d) <strong>分解子问题</strong>。<strong>为什么长 CoT 有效</strong>——从计算复杂度视角:Transformer 是<strong>常数深度</strong>的,故'多步推理'的能力受限于深度;<strong>用生成的 token 作为'外部工作记忆'</strong>(把串行计算从'网络深度'搬到'序列长度')可突破这一限制(见 M4 的表达力题)。故'更长的 CoT = 更多的串行计算步骤 = 更强的推理能力'。(4) <strong>训练流程(R1 式)</strong>——(a) <strong>冷启动 SFT</strong>(少量长 CoT 数据,教格式);(b) <strong>RLVR(GRPO)</strong>(用可验证奖励优化);(c) <strong>拒绝采样 + SFT</strong>(用 RL 后的模型生成数据,筛选正确的做 SFT);(d) <strong>再 RL</strong>(迭代);(e) <strong>蒸馏到小模型</strong>(用大模型的 CoT 数据训练小模型)。<strong>代价</strong>——(a) <strong>推理成本 ∝ 长度</strong>(长 CoT 意味着更多 token,成本与延迟上升);(b) <strong>过度思考</strong>(简单问题也想很久);(c) <strong>长度失控</strong>(若不加控制,长度会持续增长而收益递减)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'长 CoT 是涌现而非人工设计'是重要认知</strong>——它说明'推理能力'可以通过'正确的奖励 + 足够的算力'自发获得;这改变了'必须用高质量 CoT 数据监督'的思路(虽然冷启动仍有用)。② <strong>'推理时计算'的经济学</strong>——长 CoT 是'用推理算力换质量';故需按任务难度分配(简单问题短思考、难题长思考)。这是'自适应推理'(见后续题)的动机。③ <strong>'长度与正确率的曲线'</strong>——通常长度增加伴随正确率提升,但<strong>边际收益递减</strong>且存在'过度思考'区间(长度继续增长但正确率不再提升甚至下降);故需<strong>长度控制</strong>(超长惩罚、目标长度)。④ <strong>与蒸馏的关系</strong>——大模型的长 CoT 能力可<strong>蒸馏</strong>到小模型(用大模型生成的推理轨迹做 SFT);这使'推理能力'可低成本扩散(DeepSeek-R1 蒸馏到 1.5B~70B 系列)。⑤ <strong>与'过程奖励'的对比</strong>——结果奖励(RLVR)简单但信用分配粗(不知道哪一步错了);过程奖励模型(PRM)提供细粒度信号(每步对不对)但需标注(贵)。实践中'结果奖励为主,过程奖励可选'。⑥ <strong>面试要点</strong>——被问'推理模型怎么训',应给出'<strong>RLVR(可验证奖励)+ GRPO + 长 CoT 自发涌现 + 冷启动/拒绝采样/蒸馏的完整流程</strong>',并解释'<strong>长 CoT 有效是因为把串行计算从深度搬到序列长度</strong>';能指出'长度与正确率边际递减、需长度控制'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为长 CoT 必须靠人工标注教
- ✕忽略长 CoT 的推理成本与过度思考问题
🎯 Interviewer Follow-ups
- ?为什么长 CoT 能提升正确率?
- ?长 CoT 的代价是什么?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.