推导链:
1. 对替代目标在
θold 处一阶(线性)近似:
maxgTΔθ,其中
g=∇θEs,a∼πθold[πθold(a∣s)πθ(a∣s)A] —— 期望按旧策略采样即可,无需重采样(重要性采样权重恰为概率比);
2. KL 约束在
θold 处一阶为零(散度在相等点取极小)、展开到二阶:
21ΔθTFΔθ≤δ,其中
Fisher 矩阵 F=Es,a[∇θlogπθ(a∣s)∇θlogπθ(a∣s)T] 是期望海森的负值(海森近似),无需二阶导即可估计;
3. 拉格朗日法求解得
自然梯度方向 Δθ=αF−1g:用共轭梯度法解线性系统
Fx=g(避免
O(n2) 的显式逆矩阵),再按单调改进界(KKL 定理,系数
C=(1−γ)24εγ)做线性搜索回溯步长
α,保证目标不降。