🎯核心定义
PRM (Process Reward Model) 对推理的每个中间步骤打分,把 credit assignment 从"结果对错"细化到"第几步出错":结果奖励 (ORM) 只给整体 0/1,无法告诉策略哪一步该负责;逐步奖励则让 RL 的梯度信号落到具体步骤。训练标签可来自人工逐步标注,也可用蒙特卡洛估计 (MC-EST):从某一步骤出发采样多条 rollout,取终局结果的平均作为该步骤质量——Math-Shepherd 等工作的标准做法。
📌核心概述
RL 视角: PRM 与 RLVR 结果奖励互补——RLVR 提供廉价、无偏、不可 hack 的终局信号,PRM 提供细粒度过程信号;推理期 PRM 可作为 MCTS 的节点价值函数 (见本模块 mcts 卡),或在 best-of-N 中重排轨迹。详见 LLM 模块: 完整定义、公式与考点见 LLM 模块的 prmRlvr 卡 (id: prm-rlvr)。
💡使用场景
推理模型训练 (逐步奖励信号)、推理时搜索 (MCTS 节点价值、逐步重排)、多步任务的错误定位。
⚡解决的核心痛点
结果奖励稀疏导致的 credit assignment 难题——只能判断整体对错、无法定位哪步出错,RL 信号近似随机;PRM 把奖励分配到步骤级,配合搜索显著提升困难推理任务的解出率。