TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
GAIL 与逆向 RL
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
gail-inverse-rl
GAIL 与逆向 RL
GAIL & Inverse RL
🎯
核心定义
逆向强化学习 (Inverse RL, IRL) 从专家轨迹中反推奖励函数;GAIL (Generative Adversarial Imitation Learning, 生成对抗模仿学习) 将对抗训练与最大熵 IRL 结合,直接学策略:
min
π
max
D
E
π
E
[
log
D
(
s
,
a
)
]
+
E
π
[
log
(
1
−
D
(
s
,
a
)
)
]
−
λ
H
(
π
)
\min_\pi \max_D \mathbb{E}_{\pi_E}[\log D(s,a)] + \mathbb{E}_\pi[\log(1-D(s,a))] - \lambda \mathcal{H}(\pi)
min
π
max
D
E
π
E
[
lo
g
D
(
s
,
a
)]
+
E
π
[
lo
g
(
1
−
D
(
s
,
a
))]
−
λ
H
(
π
)
——判别器
D
D
D
区分专家与策略的状态-动作对,策略通过最大化『骗过 D』逐步逼近专家分布,熵项
H
(
π
)
\mathcal{H}(\pi)
H
(
π
)
防止策略坍缩。
💡
使用场景
奖励难以人工设计但演示数据充足的场景——机器人示教、自动驾驶、游戏;学到的隐式奖励还可用于行为解释与跨任务迁移。
⚡
解决的核心痛点
从『被动拟合专家动作』(BC) 升级为『主动匹配专家轨迹分布』:每一步都有判别器提供的密集对抗信号,误差不会像 BC 那样累积成
O
(
T
2
)
\mathcal{O}(T^2)
O
(
T
2
)
复合误差;而最大熵 IRL 假设专家轨迹概率
p
(
τ
)
∝
exp
(
R
(
τ
)
)
p(\tau) \propto \exp(R(\tau))
p
(
τ
)
∝
exp
(
R
(
τ
))
——轨迹奖励越高被专家选取的概率指数越大——既给出了奖励估计的合理解空间,又避免了平凡解 (如恒定奖励) 与 IRL 的多解性问题。
🎯
5 个高频面试考点 (Exam Points)
1
写出 GAIL 的目标函数,解释每一项的含义;它最小化的是专家与策略轨迹分布之间的什么散度?
2
GAIL 相比 BC 为什么能缓解复合误差?判别器提供了什么样的信号?
3
最大熵 IRL 的假设
p
(
τ
)
∝
exp
(
R
(
τ
)
)
p(\tau) \propto \exp(R(\tau))
p
(
τ
)
∝
exp
(
R
(
τ
))
是什么?它解决了 IRL 的什么病态问题 (如恒定奖励平凡解)?
4
GAIL 训练中判别器 (即隐式奖励) 的常见问题?熵正则
−
λ
H
(
π
)
-\lambda \mathcal{H}(\pi)
−
λ
H
(
π
)
的作用?
5
IRL/GAIL 与 RLHF 的奖励建模同为『从行为反推偏好』,两者区别在哪里?
📖 关联深度指南:
📄 offline-rl-and-imitation-learning →
更新于 2026-08-12
🎯
检验攻克程度:针对「GAIL 与逆向 RL」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
行为克隆 BC
下一个知识点 →
CQL 保守 Q 学习
🔗 更多 强化学习 知识点卡片
Actor-Critic 框架
上下文老虎机
思维链与推理强化
Offline 分布偏移