返回 强化学习 思维导图
中文·English
🎮 强化学习ID: gail-inverse-rl

GAIL 与逆向 RL

GAIL & Inverse RL
🎯核心定义
逆向强化学习 (Inverse RL, IRL) 从专家轨迹中反推奖励函数;GAIL (Generative Adversarial Imitation Learning, 生成对抗模仿学习) 将对抗训练与最大熵 IRL 结合,直接学策略: minπmaxDEπE[logD(s,a)]+Eπ[log(1D(s,a))]λH(π)\min_\pi \max_D \mathbb{E}_{\pi_E}[\log D(s,a)] + \mathbb{E}_\pi[\log(1-D(s,a))] - \lambda \mathcal{H}(\pi)——判别器 DD 区分专家与策略的状态-动作对,策略通过最大化『骗过 D』逐步逼近专家分布,熵项 H(π)\mathcal{H}(\pi) 防止策略坍缩。
💡使用场景
奖励难以人工设计但演示数据充足的场景——机器人示教、自动驾驶、游戏;学到的隐式奖励还可用于行为解释与跨任务迁移。
解决的核心痛点
从『被动拟合专家动作』(BC) 升级为『主动匹配专家轨迹分布』:每一步都有判别器提供的密集对抗信号,误差不会像 BC 那样累积成 O(T2)\mathcal{O}(T^2) 复合误差;而最大熵 IRL 假设专家轨迹概率 p(τ)exp(R(τ))p(\tau) \propto \exp(R(\tau))——轨迹奖励越高被专家选取的概率指数越大——既给出了奖励估计的合理解空间,又避免了平凡解 (如恒定奖励) 与 IRL 的多解性问题。
🎯5 个高频面试考点 (Exam Points)
1
写出 GAIL 的目标函数,解释每一项的含义;它最小化的是专家与策略轨迹分布之间的什么散度?
2
GAIL 相比 BC 为什么能缓解复合误差?判别器提供了什么样的信号?
3
最大熵 IRL 的假设 p(τ)exp(R(τ))p(\tau) \propto \exp(R(\tau)) 是什么?它解决了 IRL 的什么病态问题 (如恒定奖励平凡解)?
4
GAIL 训练中判别器 (即隐式奖励) 的常见问题?熵正则 λH(π)-\lambda \mathcal{H}(\pi) 的作用?
5
IRL/GAIL 与 RLHF 的奖励建模同为『从行为反推偏好』,两者区别在哪里?
更新于 2026-08-12
🎯
检验攻克程度:针对「GAIL 与逆向 RL」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点行为克隆 BC下一个知识点CQL 保守 Q 学习

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架上下文老虎机思维链与推理强化Offline 分布偏移