返回 强化学习 思维导图
中文·English
🎮 强化学习ID: rlvr

RLVR 可验证奖励

RL with Verifiable Rewards
🎯核心定义
RLVR (Reinforcement Learning from Verifiable Rewards, 可验证奖励强化学习) 用程序/规则可自动判定的信号作为奖励,替代人工或 AI 奖励模型:数学任务用答案精确匹配 (解析为规范形式后比较);代码任务用单元测试,奖励取 pass@kpass@k——采样 kk 个程序、至少一个通过全部测试的概率;逻辑/多选任务用标准答案比对。这类奖励零标注成本、无打分模型偏差,且验证器是确定性的、不存在可被 exploit 的漏洞,因此"不可被黑客攻击" (unhackable)。
📌核心概述
与 GRPO 的组合: RLVR 与 GRPO 是天然配对——对每个提示 qq 采样 GG 个回答 {o1,,oG}\{o_1, \dots, o_G\},验证器逐回答打分 rir_i,组内归一化得到 Advantage Ai=rimean(r1,,rG)std(r1,,rG)A_i = \frac{r_i - \text{mean}(r_1, \dots, r_G)}{\text{std}(r_1, \dots, r_G)} 后再做截断策略更新,全程无需奖励模型与 Critic;DeepSeek-R1 正是 "RLVR + GRPO" 的标准化范式。
💡使用场景
数学、代码、逻辑等存在 ground-truth 验证的任务;作为 o1/R1 类推理模型后训练的主奖励源,常与过程奖励 (PRM) 互补——RLVR 给终局结果,PRM 给逐步信号。
解决的核心痛点
RLHF 奖励模型训练成本高、打分有噪声且会被 hacking;RLVR 提供零成本、无偏、确定性的奖励信号,使大规模推理强化成为可能;局限是需要可验证的任务——开放式生成任务仍需奖励模型或 PRM 辅助。
🎯5 个高频面试考点 (Exam Points)
1
RLVR 的可验证奖励有哪几类?为什么说它是不可被黑客攻击 (unhackable) 的?
2
RLVR 如何与 GRPO 组合 (采样 G 个回答、组内 Advantage、免 Critic)?
3
代码任务中 pass@k 奖励如何定义?与数学答案匹配有何不同?
4
哪些任务适合 RLVR?对任务的验证性有什么要求?开放式任务怎么办?
5
RLVR 与奖励模型 RLHF 的对比:成本、偏差、鲁棒性三方面?
更新于 2026-08-12
🎯
检验攻克程度:针对「RLVR 可验证奖励」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点长效留存延迟奖励下一个知识点奖励设计与 Hacking

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化