推导链:
1. Bellman 最优方程给出 TD 目标
y=r+γmaxa′Qθ−(s′,a′):
目标网络 θ−(每
C 步硬拷贝或 Polyak 加权平均
θ−←τθ+(1−τ)θ−)把自举回归变成对固定常数的回归,消除“目标随自身一起漂移”的振荡;
2. 对
θ 求梯度:
∇θL=−2E[(y−Qθ(s,a))∇θQθ(s,a)],目标
y 不参与反传;
3.
经验回放 D:按
(s,a,r,s′) 存储、均匀随机抽样,打破相邻样本的强时间相关性,并支持样本复用与稳定批训练;
4.
双 DQN 高估修正:
max 算子带来正偏差——
E[maxXi]≥maxE[Xi](max 为凸函数,由 Jensen 不等式),噪声 + 自举使误差层层放大,高估的坏动作被不断选中。Double DQN 把
动作选择与价值评估解耦:
y=r+γQθ−(s′,argmaxa′Qθ(s′,a′)) —— 在线网络选动作、目标网络打分,显著压低高估。