RLVR (Reinforcement Learning from Verifiable Rewards, 可验证奖励强化学习) 用程序/规则可自动判定的信号作为奖励,替代人工或 AI 奖励模型:数学任务用答案精确匹配 (解析为规范形式后比较);代码任务用单元测试,奖励取
pass@k——采样
k 个程序、至少一个通过全部测试的概率;逻辑/多选任务用标准答案比对。这类奖励零标注成本、无打分模型偏差,且验证器是确定性的、不存在可被 exploit 的漏洞,因此"不可被黑客攻击" (unhackable)。