返回 强化学习 思维导图
中文·English
🎮 强化学习ID: q-learning

Q-Learning 离策略

Q-Learning (Off-Policy)
🎯核心定义
Q-Learning 是时序差分离策略控制算法, 直接学习最优动作值函数 QQ^*, 更新规则为 Q(s,a)Q(s,a)+α[r+γmaxaQ(s,a)Q(s,a)]Q(s,a) \leftarrow Q(s,a) + \alpha\left[ r + \gamma \max_{a'} Q(s',a') - Q(s,a) \right], 其中 α\alpha 是学习率, rr 是执行动作后的立即奖励, γ\gamma 是折扣因子, ss' 是转移后的下一个状态, maxaQ(s,a)\max_{a'} Q(s',a') 是对下一状态所有动作取最大 (贪婪目标), 括号整体是 TD 误差。它被称为"离策略" (off-policy): 行为策略 (如何采样, 如 ε\varepsilon-greedy) 与目标策略 (学到什么, 贪婪 max\max) 分离——即用任意探索策略收集的经验, 优化贪心目标策略 π(s)=argmaxaQ(s,a)\pi(s) = \arg\max_a Q(s,a)。表格型收敛条件: 每个 (s,a)(s,a) 被访问无穷多次, 步长满足 Robbins-Monro 条件 tαt=,  tαt2<\sum_t \alpha_t = \infty,\; \sum_t \alpha_t^2 < \infty (如 αt=1/t\alpha_t = 1/t), 最终 QQQ \to Q^*
💡使用场景
已知奖励但无模型的离策略学习——导航、游戏、推荐动作优化; 也是深度 RL 的基石: DQN 把表格换成神经网络 + 经验回放 + 目标网络, Double-DQN 专治本算法的 max 高估。
解决的核心痛点
同策略算法 (如 SARSA) 学到的是行为策略自身的值函数, 且学习必须跟随当前策略探索;Q-Learning 用 max\max 算子把 TD 目标指向最优策略, 使历史经验 (任意行为策略收集的样本) 可被复用、加速学习, 同时只需单步更新即可逼近 QQ^*——是离策略学习 (offline RL、经验回放) 的理论源头。
🎯5 个高频面试考点 (Exam Points)
1
手推并完整写出 Q-Learning 更新公式,逐项解释 α、γ、max 项与 TD 误差?
2
为什么 Q-Learning 是离策略算法?行为策略与目标策略分别是什么?
3
表格型 Q-Learning 的收敛条件?Robbins-Monro 步长条件是什么?
4
max 算子带来的过估计 (overestimation) 问题?Double Q-Learning 如何解决?
5
Q-Learning 与 SARSA 的区别?悬崖行走 (Cliff Walking) 场景下两者的行为差异?
📖 关联深度指南:📄 foundations-and-deep-rl
更新于 2026-08-12
🎯
检验攻克程度:针对「Q-Learning 离策略」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点蒙特卡洛 vs 时序差分下一个知识点探索-利用权衡

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化