M5-064M5: NLP & Large Language ModelsGRPO & Reasoning ModelsHard
Mastery:
GRPO & Reasoning Models: 解释过程奖励模型(PRM)在 RL 中的使用与标注成本。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: PRM 对每个推理步骤打分,提供细粒度信用分配;但需步骤级标注(贵、主观),常与结果奖励结合。
📌 Key Takeaways
- •PRM 逐步打分(细粒度信用分配)
- •优点:定位错误步骤、引导搜索(beam/树搜索)
- •缺点:步骤级标注贵、主观、易被钻空子
📐 Mathematical Derivations
数学机理:<strong>ORM vs PRM</strong>。<strong>ORM(Outcome Reward Model)</strong>——只对<strong>最终结果</strong>打分(答案对错);优点:标注简单(只需最终答案)、信号明确;缺点:<strong>信用分配粗</strong>(不知道哪一步错了)、且无法区分'推理正确但答案笔误'与'推理错误'。<strong>PRM(Process Reward Model)</strong>——对<strong>每个推理步骤</strong>打分(该步是否正确/合理);优点:(a) <strong>细粒度信用分配</strong>(能定位错误步骤);(b) <strong>引导搜索</strong>(在树搜索/beam search 中可用 PRM 选分支,大幅提升 test-time compute 的效率);(c) 能识别'蒙对'(推理错但答案对)。<strong>PRM 的标注成本</strong>——(a) <strong>人工标注</strong>——需逐步判断每步是否正确(比只标最终答案贵得多、且更主观);(b) <strong>自动标注</strong>——(i) <strong>蒙特卡洛估计</strong>:从某步骤出发多次采样,看最终正确率(若正确率高则该步好)——计算昂贵但无需人工;(ii) <strong>用强模型标注</strong>(RLAIF 风格);(iii) <strong>从最终答案反向推断</strong>(只标注'导致正确答案的步骤')。<strong>PRM 在 RL 中的使用</strong>——(a) <strong>作为奖励</strong>——把 PRM 的逐步分数聚合(求和/最小/最后一步)作为奖励;但需注意 PRM 可能被'钻空子'(模型学会'看起来正确的步骤')。(b) <strong>作为搜索的引导</strong>——在<strong>推理时</strong>用 PRM 做树搜索/beam search(每个节点用 PRM 打分、优先扩展高分分支);这是'推理时计算'的重要形式(见推理时计算题)。(c) <strong>与 ORM 结合</strong>——用 ORM 提供结果信号、PRM 提供过程信号(加权组合),兼顾两者。<strong>与 RLVR 的关系</strong>——对可验证任务,ORM 就是'程序验证'(精确、免费);PRM 是'更细但更贵'的补充。<strong>实证</strong>——PRM 在数学推理的搜索中显著提升(如 OpenAI 的'Let's Verify Step by Step');但在纯 RL 训练中,PRM 的收益不如其在搜索中明显(且可能被钻空子)。<strong>标注成本是主要瓶颈</strong>——这是'结果奖励为主'的原因。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'PRM 在搜索中比在 RL 中更有价值'</strong>——这是重要的实践观察:PRM 用于<strong>推理时搜索</strong>(引导分支)效果显著(因为它能'提前发现错误路径');而用于 RL 奖励时可能被钻空子(模型学会'写看起来对的步骤')。② <strong>蒙特卡洛自动标注的巧妙</strong>——它用'从该步出发的最终正确率'作为该步质量的代理,<strong>无需人工</strong>;代价是计算量(每个步骤需多次采样)。这是'用算力换标注'的典型。③ <strong>'蒙对'问题的解决</strong>——ORM 无法区分'推理对答案对'与'推理错答案对';PRM 可以;这对'训练可靠推理'很重要(避免模型学会'猜答案')。④ <strong>与'可验证奖励'的层次</strong>——(a) 结果可验证(数学/代码)→ 用 ORM(免费精确);(b) 结果不可验证但过程可判断 → 用 PRM;(c) 两者都不可验证(写作)→ 用 RM/RLAIF。⑤ <strong>'步骤的定义'问题</strong>——推理步骤的切分不唯一(一行一步?一段一步?),这影响 PRM 的设计与标注一致性。⑥ <strong>面试要点</strong>——被问'PRM 是什么、值得吗',应给出'<strong>逐步打分 + 细粒度信用分配 + 引导搜索</strong>'的收益与'<strong>步骤级标注贵、主观、易被钻空子</strong>'的成本,并指出'<strong>PRM 在推理时搜索中比在 RL 中更有价值</strong>';能提到'蒙特卡洛自动标注'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为 PRM 一定优于 ORM(标注成本与钻空子风险)
- ✕忽略'蒙对'问题(ORM 无法区分)
🎯 Interviewer Follow-ups
- ?PRM 与 ORM 的对比?
- ?PRM 如何在 RL 中使用?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.