返回 强化学习 思维导图
中文·English
🎮 强化学习ID: reward-design

奖励设计与 Hacking

Reward Design & Hacking
🎯核心定义
奖励设计分三类:稀疏奖励 (仅终止时给 ±1\pm 1,信号少但无偏,探索困难)、密集奖励 (每步有信号、学习快,但可能引入误导)、势函数 shaping (Potential-Based Reward Shaping)——在原奖励上加 F(s,a,s)=γΦ(s)Φ(s)F(s, a, s') = \gamma\Phi(s') - \Phi(s) 其中 Φ(s)\Phi(s) 为任意势函数 (如到目标距离的负值),γ\gamma 为折扣因子。Ng et al. (1999) 定理:势函数 shaping 不改变最优策略——因为沿任意轨迹求和 tFt=γΦ(sT)Φ(s0)\sum_t F_t = \gamma\Phi(s_T) - \Phi(s_0) (望远镜求和) 只差首尾常数,价值排序不变,故可放心用领域知识加速学习而不错导。
📌核心概述
reward hacking: 策略发现并 exploit 奖励函数的漏洞,获得高奖励却没有真正完成任务——例如 LLM 绕过程序测试、对奖励模型输出"我很诚实"类话术刷分、游戏 agent 卡 bug 或死循环。缓解手段:改用可验证奖励 (RLVR,验证器无漏洞)、KL 约束限制策略漂移、奖励模型对抗性训练/正则化、多次采样验证与人工抽查。
💡使用场景
游戏/机器人/LLM 对齐的奖励函数设计;面试高频考点为 shaping 定理的推导与 LLM 场景下的 hacking 案例。
解决的核心痛点
稀疏奖励下探索效率低、训练几乎无法起步;设计不良的密集奖励会被 exploit 导致能力退化——好的奖励设计在加速学习 (shaping) 与防止 hacking (可验证性) 之间取得平衡。
🎯5 个高频面试考点 (Exam Points)
1
稀疏奖励与密集奖励各自的优缺点?如何根据任务选择?
2
写出势函数 shaping 公式 F = γΦ(s') − Φ(s),并说明为什么它不改变最优策略 (Ng 定理)?
3
什么是 reward hacking?举一个 LLM 场景 (RLHF/RLVR) 的例子?
4
如何缓解 reward hacking?可验证奖励为什么天然免疫?
5
LLM 推理 RL 中奖励设计的最佳实践 (可验证奖励 vs 奖励模型 vs PRM)?
更新于 2026-08-12
🎯
检验攻克程度:针对「奖励设计与 Hacking」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点RLVR 可验证奖励下一个知识点过程奖励模型 PRM

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化