返回 RS 算法研究员 思维导图
中文·English
🎓 RS 算法研究员ID: rs-process-reward-models-prm

过程奖励模型 PRM 与蒙特卡洛搜索

Process Reward Models PRM & Monte Carlo
🎯核心定义
过程监督奖励模型 (Process Supervision Reward Model, PRM / OpenAI 提出) 与基于蒙特卡洛树搜索的细粒度信用分配体系 (PRM & Monte Carlo Tree Search for Step-Level Credit Assignment) 是在大模型多步逻辑推理中消除“过程胡扯但碰巧猜对答案”与“单步犯错全盘皆输”的核心前沿对齐技术;核心机制:1) ORM vs PRM:传统结果奖励模型 (Outcome-supervised Reward Model, ORM) 仅在整条链最终给出单个标量奖励,无法区分中间哪一步逻辑发生致命断裂;过程奖励模型 (PRM) 对推理链中的每一个独立中间步骤 (Step) 分别给出正确性奖励评估 r(st)[0,1]r(s_t) \in [0, 1];2) 弱监督 PRM 自动标注 (Math-Shepherd / RLHFlow): 从中间某个 Step 开始,利用策略模型发起 KK 次独立的蒙特卡洛随机展开 (Monte Carlo Rollouts),若后续最终答对的概率显著高,则赋予该 Step 高过程分,彻底自动化了昂贵的逐步人工标注;3) 引导树搜索:在推理期直接作为 Value 评估网络引导 MCTS 剪枝。
💡使用场景
复杂数学竞赛定理证明搜索、长推理链错误定位、强化学习细粒度信用分配 (Credit Assignment)。
解决的核心痛点
结果奖励由于极度稀疏与延迟导致长链强化学习训练方差极大且极易产生虚假捷径学习;PRM 提供了高密度的单步强化信号与精准的剪枝引导。
🎯5 个高频面试考点 (Exam Points)
1
详细对比结果监督 (Outcome Supervision, ORM) 与过程监督 (Process Supervision, PRM) 在抑制逻辑幻觉与防止“侥幸做对”上的数学机理?
2
Math-Shepherd 算法如何通过从中间步骤发起 KK 次 Monte Carlo Rollouts 自动化构建海量 PRM 训练数据集?
3
为什么在 Best-of-NN 搜索中,采用“每步 PRM 概率连乘积 t=1TP(stept=correct)\prod_{t=1}^T P(\text{step}_t = \text{correct})”对候选链打分显著优于仅使用链末尾分?
4
PRM 遭遇的对抗性攻击 (Adversarial Exploitation): 为什么当搜索宽度 NN 扩大至数千时,生成模型会学会生成欺骗 PRM 的看似专业假步骤?
5
在强化学习策略梯度中,如何利用 PRM 提供的单步稠密奖励替代传统 GAE 中的稀疏优势计算?
更新于 2026-08-14
🎯
检验攻克程度:针对「过程奖励模型 PRM 与蒙特卡洛搜索」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点DeepSeek-R1 纯 RL 自我纠错与长思维下一个知识点Flow Matching 连续流匹配与最优传输

🔗 更多 RS 算法研究员 知识点卡片

DPO 闭式最优策略与隐式奖励推导PPO 剪切代理目标函数下界证明RoPE 旋转位置编码复数内积证明扩散模型 SDE 连续随机微分推导