M5-119M5: NLP & Large Language ModelsInference-Time Compute & ScalingMedium
Mastery:
Inference-Time Compute & Scaling: 解释过程奖励模型(PRM)与结果奖励模型(ORM)。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: ORM 只评最终结果(易标、信号粗);PRM 评每步(信用分配细、可引导搜索,但标注贵)。
📌 Key Takeaways
- •ORM:只评最终答案(标注简单、信号粗)
- •PRM:评每步(信用分配细、可引导搜索、标注贵)
- •PRM 在'搜索'中比在'RL 奖励'中更有价值
📐 Mathematical Derivations
数学机理:<strong>两类奖励模型</strong>。<strong>ORM(Outcome Reward Model)</strong>——只对<strong>最终结果</strong>打分:V(x, y)(y 是完整回答)。<strong>优点</strong>:(a) <strong>标注简单</strong>(只需判断最终答案对错);(b) 信号明确(与真实目标对齐);(c) 可程序验证(对可验证任务,ORM 就是验证器)。<strong>缺点</strong>:(a) <strong>信用分配粗</strong>——不知道'哪一步错了';(b) <strong>无法区分'推理正确但答案错(笔误)'与'推理错误但蒙对'</strong>;(c) 无法引导<strong>搜索</strong>(搜索需要评估中间状态)。<strong>PRM(Process Reward Model)</strong>——对<strong>每个推理步骤</strong>打分:V(x, s_1, …, s_k)(逐步评分)。<strong>优点</strong>:(a) <strong>细粒度信用分配</strong>(能定位错误步骤);(b) <strong>可引导搜索</strong>(在树搜索/束搜索中用 PRM 评估中间节点、优先扩展高分分支);(c) 能识别'蒙对'(推理错但答案对)。<strong>缺点</strong>:(a) <strong>标注成本高</strong>——需逐步判断(比只标最终答案贵得多、更主观);(b) <strong>步骤定义不唯一</strong>(切分方式影响标注);(c) <strong>可能被钻空子</strong>——在 RL 中,模型可能学会'写看起来合理的步骤'(而非真正正确)。<strong>PRM 的标注方法</strong>——(1) <strong>人工标注</strong>(最准但最贵);(2) <strong>蒙特卡洛估计(自动)</strong>——对某个中间状态,从它出发<strong>多次采样</strong>到最终答案,用'最终正确率'作为该步骤的质量估计;<strong>无需人工</strong>但计算昂贵(每步多次采样);(3) <strong>用强模型标注</strong>(RLAIF 风格);(4) <strong>从最终答案反推</strong>(只标注'通向正确答案的步骤')。<strong>使用场景的差异(重要)</strong>——(a) <strong>在搜索中</strong>(推理时)——PRM 价值大(能提前发现错误路径、剪枝);(b) <strong>在 RL 奖励中</strong>——PRM 的收益不如搜索中明显,且<strong>更易被钻空子</strong>(模型学会'写好看的步骤');故实践中'RL 用 ORM/程序验证为主,PRM 用于搜索'。<strong>组合</strong>——(a) <strong>PRM + ORM</strong>(过程分 + 结果分加权);(b) <strong>PRM 做搜索、ORM 做最终选择</strong>。<strong>实证</strong>——'Let's Verify Step by Step'(OpenAI)显示 PRM 在数学搜索中显著优于 ORM;但 PRM 的标注成本是其应用的主要障碍。<strong>与'可验证奖励'的关系</strong>——对可验证任务,ORM 就是程序验证(免费精确);PRM 是'更细但更贵'的补充(用于'结果不可验证但过程可判断'的任务,或用于提升搜索效率)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'PRM 在搜索中比在 RL 中更有价值'是重要实践观察</strong>——面试中能指出这一点(而非'PRM 全面优于 ORM')是深度理解的标志。② <strong>'蒙特卡洛自动标注'是降低 PRM 成本的关键</strong>——它用'从该步出发的最终正确率'作为该步质量的代理;代价是计算量(每步多次采样),但省去人工。这是'用算力换标注'的典型。③ <strong>'蒙对'问题的解决</strong>——ORM 无法区分'推理对答案对'与'推理错答案对';PRM 可以;这对'训练可靠推理'很重要(避免模型学会'猜')。④ <strong>'步骤切分'的工程影响</strong>——推理步骤的边界不唯一(一行一步?一段一步?);这影响 PRM 的输入格式与标注一致性;实践中常用'换行'或'句号'作为切分。⑤ <strong>'与可验证任务的优先级'</strong>——对数学/代码,<strong>程序验证(ORM)免费且精确</strong>,应优先;PRM 只在'需要引导搜索'或'结果不可验证'时使用。⑥ <strong>面试要点</strong>——被问'PRM 与 ORM 的区别',应给出'<strong>评估粒度(最终 vs 每步)+ 标注成本 + 信用分配 + 搜索引导能力</strong>'与'<strong>PRM 在搜索中更有价值、在 RL 中易被钻空子</strong>',并提到'<strong>蒙特卡洛自动标注</strong>';这是推理时计算类问题的高分回答。
⚠️ Common Interview Pitfalls
- ✕在 RL 奖励中用 PRM(易被钻空子)
- ✕对可验证任务用 PRM 而非程序验证(浪费标注)
🎯 Interviewer Follow-ups
- ?PRM 的标注成本如何降低?
- ?为什么 PRM 在 RL 中可能被钻空子?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.