时序差分 (TD) 用单步转移 + 当前估计自举 (bootstrap), 目标为
rt+1+γV(st+1)——用
t+1 步的真实奖励
rt+1 加上对自己当前估计
V(st+1) 的折现;更新规则
V(st)←V(st)+α[rt+1+γV(st+1)−V(st)], 括号内即 TD 误差。因为目标里含估计值, TD 有偏 (偏置朝当前估计方向), 但只依赖少量随机量、方差低, 每步都可学习, 也适用于持续性任务。MC 相当于 TD 误差跨整条轨迹累加 (
λ=1), DP 是
λ=0 的完全自举——TD 是两者的中间体;表格型任务中 TD(0) 在收敛条件下最终收敛到真实
vπ。