TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
IQL expectile 回归
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
iql
IQL expectile 回归
Implicit Q-Learning
🎯
核心定义
隐式 Q 学习 (Implicit Q-Learning, IQL) 是离线 RL 的 SOTA 基线之一,核心是用 expectile 回归
L
2
τ
(
u
)
=
∣
τ
−
1
(
u
<
0
)
∣
u
2
\mathcal{L}_2^\tau(u) = |\tau - \mathbb{1}(u<0)| u^2
L
2
τ
(
u
)
=
∣
τ
−
1
(
u
<
0
)
∣
u
2
更新价值函数:残差
u
=
r
+
γ
Q
(
s
′
,
a
′
)
−
Q
(
s
,
a
)
u = r + \gamma Q(s',a') - Q(s,a)
u
=
r
+
γ
Q
(
s
′
,
a
′
)
−
Q
(
s
,
a
)
为正 (TD 目标更高) 时权重为
τ
\tau
τ
,为负时权重为
1
−
τ
1-\tau
1
−
τ
;取
τ
≈
0.7
–
0.9
\tau \approx 0.7\text{–}0.9
τ
≈
0.7
–
0.9
时,更新主要惩罚『低估』、几乎忽略『高估』,使
Q
Q
Q
回归到 TD 目标的上分位。
💡
使用场景
纯离线任务 (推荐、决策日志、机器人历史数据);结构简单 (只有 value 与 actor 两个网络),同样适合 offline-to-online 微调。
⚡
解决的核心痛点
expectile 隐式逼近
max
a
′
Q
(
s
′
,
a
′
)
\max_{a'} Q(s',a')
max
a
′
Q
(
s
′
,
a
′
)
但从不显式计算 OOD 动作的 Q 值——每次更新只用数据内实际出现的
(
s
,
a
′
)
(s,a')
(
s
,
a
′
)
,从根上避免外推误差;随后用受行为策略约束的 actor 从价值中提取策略 (求稳不求精确最优),整体实现『无需评估 OOD 动作』的离线 Q 学习。
🎯
5 个高频面试考点 (Exam Points)
1
IQL 的 expectile 回归损失
L
2
τ
(
u
)
=
∣
τ
−
1
(
u
<
0
)
∣
u
2
\mathcal{L}_2^\tau(u) = |\tau - \mathbb{1}(u<0)| u^2
L
2
τ
(
u
)
=
∣
τ
−
1
(
u
<
0
)
∣
u
2
如何工作?
τ
→
1
\tau \to 1
τ
→
1
时回归到哪个分位?
2
IQL 为什么不需要评估 OOD 动作?它与 CQL 的『显式压低 OOD Q』有何根本区别?
3
IQL 中价值提取与策略提取如何配合?actor 的目标函数是什么?
4
expectile 如何隐式近似
max
a
′
Q
(
s
′
,
a
′
)
\max_{a'} Q(s',a')
max
a
′
Q
(
s
′
,
a
′
)
?它的 bias-variance 权衡是什么?
5
IQL 与 CQL 在 offline-to-online 场景中的表现差异及原因?
📖 关联深度指南:
📄 offline-rl-and-imitation-learning →
更新于 2026-08-12
🎯
检验攻克程度:针对「IQL expectile 回归」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
CQL 保守 Q 学习
下一个知识点 →
离线到在线微调
🔗 更多 强化学习 知识点卡片
Actor-Critic 框架
行为克隆 BC
上下文老虎机
思维链与推理强化