TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
Offline 分布偏移
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
distribution-shift
Offline 分布偏移
Offline Distribution Shift
🎯
核心定义
分布偏移 (Distribution Shift) 是离线 RL 的核心难题——价值函数与策略只能从固定数据集
D
\mathcal{D}
D
中学习,但训练过程中策略会不断把
Q
Q
Q
泛化到数据集从未覆盖的 (OOD, out-of-distribution) 状态-动作上;由于这些动作没有真实回报监督,
Q
Q
Q
只能外推,产生系统性虚高的错误估计 (外推误差, Extrapolation Error)。
💡
使用场景
无法安全在线交互、只有历史日志的领域——推荐系统、广告、自动驾驶、医疗、机器人;也是 RLHF 用离线偏好数据训练时的隐患来源。在线 RL 因环境反馈实时纠错而不存在此问题。
⚡
解决的核心痛点
解释了『为什么离线 Q-Learning 必然失败』: 外推误差一旦产生,会被 Bellman 自举放大 (Bootstrapping Error Amplification)——按
Q
(
s
,
a
)
←
r
+
γ
max
a
′
Q
^
(
s
′
,
a
′
)
Q(s,a) \leftarrow r + \gamma \max_{a'} \hat{Q}(s',a')
Q
(
s
,
a
)
←
r
+
γ
max
a
′
Q
^
(
s
′
,
a
′
)
更新时,
max
\max
max
算子挑选误差最大的
a
′
a'
a
′
,错误逐轮传播、Q 值整体虚高,策略最终偏向 OOD 动作;由此催生 CQL/IQL/BCQ 等保守派离线算法。
🎯
5 个高频面试考点 (Exam Points)
1
外推误差 (Extrapolation Error) 的产生机制是什么?为什么 Q 对 OOD 动作的估计会系统性虚高?
2
Bellman 自举如何放大外推误差?写出
Q
(
s
,
a
)
=
r
+
γ
max
a
′
Q
^
(
s
′
,
a
′
)
Q(s,a)=r+\gamma \max_{a'} \hat{Q}(s',a')
Q
(
s
,
a
)
=
r
+
γ
max
a
′
Q
^
(
s
′
,
a
′
)
的误差传播链,解释 max 算子的放大作用。
3
Offline 分布偏移与在线 DQN 的 overestimation 问题有何区别与联系?
4
为什么说离线 RL 的策略必须『待在数据分布内』?列出三类缓解思路并各举一例算法 (策略约束 / 保守 Q / 数据生成)。
5
给定覆盖度差的固定数据集,如何从 Q 值诊断外推误差?哪个训练指标能预警策略崩溃?
📖 关联深度指南:
📄 offline-rl-and-imitation-learning →
更新于 2026-08-12
🎯
检验攻克程度:针对「Offline 分布偏移」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
MCTS 规划
下一个知识点 →
行为克隆 BC
🔗 更多 强化学习 知识点卡片
Actor-Critic 框架
上下文老虎机
思维链与推理强化
CQL 保守 Q 学习