过程监督奖励模型 (Process Supervision Reward Model, PRM / OpenAI 提出) 与基于蒙特卡洛树搜索的细粒度信用分配体系 (PRM & Monte Carlo Tree Search for Step-Level Credit Assignment) 是在大模型多步逻辑推理中消除“过程胡扯但碰巧猜对答案”与“单步犯错全盘皆输”的核心前沿对齐技术;核心机制:1) ORM vs PRM:传统结果奖励模型 (Outcome-supervised Reward Model, ORM) 仅在整条链最终给出单个标量奖励,无法区分中间哪一步逻辑发生致命断裂;过程奖励模型 (PRM) 对推理链中的
每一个独立中间步骤 (Step) 分别给出正确性奖励评估
r(st)∈[0,1];2) 弱监督 PRM 自动标注 (Math-Shepherd / RLHFlow): 从中间某个 Step 开始,利用策略模型发起
K 次独立的蒙特卡洛随机展开 (Monte Carlo Rollouts),若后续最终答对的概率显著高,则赋予该 Step 高过程分,彻底自动化了昂贵的逐步人工标注;3) 引导树搜索:在推理期直接作为 Value 评估网络引导 MCTS 剪枝。