返回 大语言模型 思维导图
中文·English
大语言模型ID: prm-rlvr

PRM 与 RLVR

PRM & RLVR
🎯核心定义
PRM (Process Reward Model, 过程奖励模型) 对推理的每个中间步骤打分,细化 credit assignment;RLVR (Reinforcement Learning from Verifiable Rewards, 可验证奖励强化学习) 用规则/程序可自动判定的奖励替代人类或 AI 奖励模型——如数学答案匹配、代码单元测试 (pass@kpass@k),从而零成本、无偏、不可被黑客攻击 (unhackable)。DeepSeek-R1 正是用 RLVR(配合 GRPO 组内 GG 个采样、免 Critic)在数学/代码上强化出推理能力。
💡使用场景
数学、代码、逻辑推理等存在 ground-truth 验证的任务;PRM 用于训练(逐步奖励信号)与推理(配合 MCTS 搜索、逐步重排);RLVR 是 o1/R1 类推理模型训练的核心范式,也连接 RL 模块的知识链路。
解决的核心痛点
结果奖励稀疏,无法定位哪一步出错(credit assignment 难题);人工/AI 奖励模型成本高且可被 reward hacking。PRM 提供细粒度过程信号,RLVR 提供自动化的可验证奖励,两者共同支撑推理模型的大规模强化训练。
🎯5 个高频面试考点 (Exam Points)
1
PRM 与 ORM (结果奖励模型) 的区别?PRM 的优点与主要挑战?
2
RLVR 为什么能消除奖励黑客?举几个可验证奖励的例子?
3
DeepSeek-R1 如何结合 RLVR 与 GRPO 训练推理能力?
4
PRM 在推理时搜索 (MCTS / Best-of-N 重排) 中如何使用?
5
PRM/RLVR 的局限?对任务的验证性有什么要求?
📖 关联深度指南:📄 reasoning-and-cot
更新于 2026-08-12
🎯
检验攻克程度:针对「PRM 与 RLVR」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点MCTS 推理搜索下一个知识点幻觉类型与成因

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA