返回 强化学习 思维导图
中文·English
🎮 强化学习ID: distribution-shift

Offline 分布偏移

Offline Distribution Shift
🎯核心定义
分布偏移 (Distribution Shift) 是离线 RL 的核心难题——价值函数与策略只能从固定数据集 D\mathcal{D} 中学习,但训练过程中策略会不断把 QQ 泛化到数据集从未覆盖的 (OOD, out-of-distribution) 状态-动作上;由于这些动作没有真实回报监督,QQ 只能外推,产生系统性虚高的错误估计 (外推误差, Extrapolation Error)。
💡使用场景
无法安全在线交互、只有历史日志的领域——推荐系统、广告、自动驾驶、医疗、机器人;也是 RLHF 用离线偏好数据训练时的隐患来源。在线 RL 因环境反馈实时纠错而不存在此问题。
解决的核心痛点
解释了『为什么离线 Q-Learning 必然失败』: 外推误差一旦产生,会被 Bellman 自举放大 (Bootstrapping Error Amplification)——按 Q(s,a)r+γmaxaQ^(s,a)Q(s,a) \leftarrow r + \gamma \max_{a'} \hat{Q}(s',a') 更新时,max\max 算子挑选误差最大的 aa',错误逐轮传播、Q 值整体虚高,策略最终偏向 OOD 动作;由此催生 CQL/IQL/BCQ 等保守派离线算法。
🎯5 个高频面试考点 (Exam Points)
1
外推误差 (Extrapolation Error) 的产生机制是什么?为什么 Q 对 OOD 动作的估计会系统性虚高?
2
Bellman 自举如何放大外推误差?写出 Q(s,a)=r+γmaxaQ^(s,a)Q(s,a)=r+\gamma \max_{a'} \hat{Q}(s',a') 的误差传播链,解释 max 算子的放大作用。
3
Offline 分布偏移与在线 DQN 的 overestimation 问题有何区别与联系?
4
为什么说离线 RL 的策略必须『待在数据分布内』?列出三类缓解思路并各举一例算法 (策略约束 / 保守 Q / 数据生成)。
5
给定覆盖度差的固定数据集,如何从 Q 值诊断外推误差?哪个训练指标能预警策略崩溃?
更新于 2026-08-12
🎯
检验攻克程度:针对「Offline 分布偏移」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点MCTS 规划下一个知识点行为克隆 BC

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架上下文老虎机思维链与推理强化CQL 保守 Q 学习