返回 强化学习 思维导图
中文·English
🎮 强化学习ID: iql

IQL expectile 回归

Implicit Q-Learning
🎯核心定义
隐式 Q 学习 (Implicit Q-Learning, IQL) 是离线 RL 的 SOTA 基线之一,核心是用 expectile 回归 L2τ(u)=τ1(u<0)u2\mathcal{L}_2^\tau(u) = |\tau - \mathbb{1}(u<0)| u^2 更新价值函数:残差 u=r+γQ(s,a)Q(s,a)u = r + \gamma Q(s',a') - Q(s,a) 为正 (TD 目标更高) 时权重为 τ\tau,为负时权重为 1τ1-\tau;取 τ0.70.9\tau \approx 0.7\text{–}0.9 时,更新主要惩罚『低估』、几乎忽略『高估』,使 QQ 回归到 TD 目标的上分位。
💡使用场景
纯离线任务 (推荐、决策日志、机器人历史数据);结构简单 (只有 value 与 actor 两个网络),同样适合 offline-to-online 微调。
解决的核心痛点
expectile 隐式逼近 maxaQ(s,a)\max_{a'} Q(s',a') 但从不显式计算 OOD 动作的 Q 值——每次更新只用数据内实际出现的 (s,a)(s,a'),从根上避免外推误差;随后用受行为策略约束的 actor 从价值中提取策略 (求稳不求精确最优),整体实现『无需评估 OOD 动作』的离线 Q 学习。
🎯5 个高频面试考点 (Exam Points)
1
IQL 的 expectile 回归损失 L2τ(u)=τ1(u<0)u2\mathcal{L}_2^\tau(u) = |\tau - \mathbb{1}(u<0)| u^2 如何工作?τ1\tau \to 1 时回归到哪个分位?
2
IQL 为什么不需要评估 OOD 动作?它与 CQL 的『显式压低 OOD Q』有何根本区别?
3
IQL 中价值提取与策略提取如何配合?actor 的目标函数是什么?
4
expectile 如何隐式近似 maxaQ(s,a)\max_{a'} Q(s',a')?它的 bias-variance 权衡是什么?
5
IQL 与 CQL 在 offline-to-online 场景中的表现差异及原因?
更新于 2026-08-12
🎯
检验攻克程度:针对「IQL expectile 回归」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点CQL 保守 Q 学习下一个知识点离线到在线微调

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化