PRM (Process Reward Model, 过程奖励模型) 对推理的每个中间步骤打分,细化 credit assignment;RLVR (Reinforcement Learning from Verifiable Rewards, 可验证奖励强化学习) 用规则/程序可自动判定的奖励替代人类或 AI 奖励模型——如数学答案匹配、代码单元测试 (
pass@k),从而零成本、无偏、不可被黑客攻击 (unhackable)。DeepSeek-R1 正是用 RLVR(配合 GRPO 组内
G 个采样、免 Critic)在数学/代码上强化出推理能力。