返回 强化学习 思维导图
中文·English
🎮 强化学习ID: prm

过程奖励模型 PRM

Process Reward Model
🎯核心定义
PRM (Process Reward Model) 对推理的每个中间步骤打分,把 credit assignment 从"结果对错"细化到"第几步出错":结果奖励 (ORM) 只给整体 0/1,无法告诉策略哪一步该负责;逐步奖励则让 RL 的梯度信号落到具体步骤。训练标签可来自人工逐步标注,也可用蒙特卡洛估计 (MC-EST):从某一步骤出发采样多条 rollout,取终局结果的平均作为该步骤质量——Math-Shepherd 等工作的标准做法。
📌核心概述
RL 视角: PRM 与 RLVR 结果奖励互补——RLVR 提供廉价、无偏、不可 hack 的终局信号,PRM 提供细粒度过程信号;推理期 PRM 可作为 MCTS 的节点价值函数 (见本模块 mcts 卡),或在 best-of-N 中重排轨迹。详见 LLM 模块: 完整定义、公式与考点见 LLM 模块的 prmRlvr 卡 (id: prm-rlvr)。
💡使用场景
推理模型训练 (逐步奖励信号)、推理时搜索 (MCTS 节点价值、逐步重排)、多步任务的错误定位。
解决的核心痛点
结果奖励稀疏导致的 credit assignment 难题——只能判断整体对错、无法定位哪步出错,RL 信号近似随机;PRM 把奖励分配到步骤级,配合搜索显著提升困难推理任务的解出率。
🎯5 个高频面试考点 (Exam Points)
1
PRM 与 ORM (结果奖励模型) 的区别?PRM 细化 credit assignment 的原理?
2
PRM 的训练标签如何获得 (人工逐步标注 / 蒙特卡洛 MC-EST 估计)?
3
PRM 在 MCTS 与 best-of-N 重排中各起什么作用?
4
PRM 的主要挑战 (标签噪声、误差累积、生成器与验证器的覆盖偏差)?
5
RLVR 结果奖励与 PRM 过程奖励如何配合?各自的取舍?
更新于 2026-08-12
🎯
检验攻克程度:针对「过程奖励模型 PRM」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点奖励设计与 Hacking下一个知识点MCTS 规划

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化