直接对概率求导困难,且整段回报估计方差极大。引入基线
b(s) 得
∇θJ=E[∇θlogπθ(a∣s)(Gt−b(s))]。
基线无偏性证明:
E[∇θlogπθ(a∣s)b(s)]=b(s)∑aπθ(a∣s)πθ(a∣s)∇θπθ(a∣s)=b(s)∇θ∑aπθ(a∣s)=b(s)∇θ1=0,即减基线不改变梯度期望(无偏),只抵消与动作无关的方差分量;取
b(s)=V(s) 即优势形式,催生 Actor-Critic;步长敏感性则催生 TRPO/PPO。