返回 强化学习 思维导图
中文·English
🎮 强化学习ID: trpo

TRPO 与 PPO 脉络

TRPO → PPO Lineage
🎯核心定义
TRPO (Trust Region Policy Optimization, 信任域策略优化) 用 KL 散度信任域约束限制策略单步更新幅度,保证单调改进。优化问题:
📌核心概述
maxθ  Es,aπθold[πθ(as)πθold(as)Aπθold(s,a)]s.t.  Es[DKL(πθold(s)πθ(s))]δ\max_\theta\; \mathbb{E}_{s,a\sim\pi_{\theta_{old}}}\left[\frac{\pi_\theta(a|s)}{\pi_{\theta_{old}}(a|s)} A^{\pi_{\theta_{old}}}(s,a)\right] \quad \text{s.t.}\; \mathbb{E}_s\left[D_{KL}(\pi_{\theta_{old}}(\cdot|s) \| \pi_\theta(\cdot|s))\right] \le \delta
📌核心概述
推导链: 1. 对替代目标在 θold\theta_{old} 处一阶(线性)近似:maxgTΔθ\max g^T\Delta\theta,其中 g=θEs,aπθold[πθ(as)πθold(as)A]g = \nabla_\theta\mathbb{E}_{s,a\sim\pi_{\theta_{old}}}[\frac{\pi_\theta(a|s)}{\pi_{\theta_{old}}(a|s)} A] —— 期望按旧策略采样即可,无需重采样(重要性采样权重恰为概率比); 2. KL 约束在 θold\theta_{old} 处一阶为零(散度在相等点取极小)、展开到二阶:12ΔθTFΔθδ\frac{1}{2}\Delta\theta^T F\Delta\theta \le \delta,其中 Fisher 矩阵 F=Es,a[θlogπθ(as)θlogπθ(as)T]F = \mathbb{E}_{s,a}[\nabla_\theta\log\pi_\theta(a|s)\nabla_\theta\log\pi_\theta(a|s)^T] 是期望海森的负值(海森近似),无需二阶导即可估计; 3. 拉格朗日法求解得自然梯度方向 Δθ=αF1g\Delta\theta = \alpha F^{-1}g:用共轭梯度法解线性系统 Fx=gFx = g(避免 O(n2)O(n^2) 的显式逆矩阵),再按单调改进界(KKL 定理,系数 C=4εγ(1γ)2C = \frac{4\varepsilon\gamma}{(1-\gamma)^2})做线性搜索回溯步长 α\alpha,保证目标不降。
💡使用场景
需要单调改进保证、采样昂贵(样本量有限)的连续控制任务;也是离线 RL 中约束策略更新的思想源头。
解决的核心痛点
普通策略梯度一步过大即策略崩溃。TRPO 用二阶 KL 约束给出信任域,但每次迭代要解 Fisher 逆(共轭梯度)与线性搜索,工程复杂、代价高。PPO 用概率比截断 [1ε,1+ε][1-\varepsilon, 1+\varepsilon] 一阶近似同一约束(一个小的 KL 信任域),得到 TRPO 的稳定性而只需一阶 SGD —— 这就是 TRPO → PPO 的脉络:约束优化被转化为带 clip 的代理目标。
🎯5 个高频面试考点 (Exam Points)
1
写出 TRPO 的约束优化问题:替代目标与 KL 约束 E[D_KL]≤δ 分别是什么?
2
白板手推: 目标线性化 + KL 二阶展开,推导自然梯度方向 Δθ=αF⁻¹g,说明 Fisher 矩阵为何是海森近似?
3
TRPO 如何保证单调改进?线性搜索与系数 C=4εγ/(1-γ)² 的作用?
4
TRPO 与 PPO 的脉络:概率比 clip 如何近似 KL 信任域?
5
TRPO 的计算瓶颈(海森/共轭梯度)在哪?实践中如何加速?
📖 关联深度指南:📄 foundations-and-deep-rl
更新于 2026-08-12
🎯
检验攻克程度:针对「TRPO 与 PPO 脉络」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点策略梯度 REINFORCE下一个知识点DQN 三件套

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化