Q-Learning 是时序差分离策略控制算法, 直接学习最优动作值函数
Q∗, 更新规则为
Q(s,a)←Q(s,a)+α[r+γmaxa′Q(s′,a′)−Q(s,a)], 其中
α 是学习率,
r 是执行动作后的立即奖励,
γ 是折扣因子,
s′ 是转移后的下一个状态,
maxa′Q(s′,a′) 是对下一状态所有动作取最大 (贪婪目标), 括号整体是 TD 误差。它被称为"离策略" (off-policy): 行为策略 (如何采样, 如
ε-greedy) 与目标策略 (学到什么, 贪婪
max) 分离——即用任意探索策略收集的经验, 优化贪心目标策略
π(s)=argmaxaQ(s,a)。表格型收敛条件: 每个
(s,a) 被访问无穷多次, 步长满足 Robbins-Monro 条件
∑tαt=∞,∑tαt2<∞ (如
αt=1/t), 最终
Q→Q∗。