返回 强化学习 思维导图
中文·English
🎮 强化学习ID: ppo

PPO 截断目标

PPO Clipped Objective
🎯核心定义
PPO (Proximal Policy Optimization, 近端策略优化) 用截断的概率比近似 TRPO 的 KL 信任域,只需一阶优化。概率比 rt(θ)=πθ(atst)πθold(atst)r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}(重要性采样权重,衡量新旧策略在该状态动作上的相对概率),截断目标:
📌核心概述
LCLIP(θ)=Et[min(rt(θ)A^t,  clip(rt(θ),1ε,1+ε)A^t)],ε=0.2\mathcal{L}^{CLIP}(\theta) = \mathbb{E}_t\left[\min\left(r_t(\theta)\hat{A}_t,\; \operatorname{clip}(r_t(\theta), 1-\varepsilon, 1+\varepsilon)\hat{A}_t\right)\right],\quad \varepsilon = 0.2
📌核心概述
推导链: 1. 从策略梯度替代目标 LPG(θ)=Et[rt(θ)A^t]L^{PG}(\theta) = \mathbb{E}_t[r_t(\theta)\hat{A}_t] 出发:无约束最大化会让 rtr_t 无界增大,单步大更新即导致策略崩溃(TRPO 的问题动机); 2. 加 clip:rtr_t 越出 [1ε,1+ε][1-\varepsilon, 1+\varepsilon] 后取截断值;再与未截断项取 min —— 更新越界后目标对 rtr_t 变为常数、梯度为 0,不再激励越界,这就是信任域的 one-line 实现; 3. 数值例(ε=0.2\varepsilon = 0.2):A^t=+1,rt=2\hat{A}_t = +1, r_t = 2min(21,  1.21)=1.2\min(2\cdot 1,\; 1.2\cdot 1) = 1.2,正优势下概率比封顶 1.21.2; A^t=1,rt=0.5\hat{A}_t = -1, r_t = 0.5min(0.5,  0.8)=0.8\min(-0.5,\; -0.8) = -0.8,负优势下保底 0.80.8(截断方向相反)。单步概率比漂移被限制在约 ±20%\pm 20\%,等价于一个小 KL 信任域。
💡使用场景
RLHF 第三阶段策略优化(与 KL 惩罚、GAE 搭配)、RLVR/推理强化;OpenAI 默认的通用 RL 算法,连续/离散动作均可,支持大规模分布式训练。
解决的核心痛点
REINFORCE 步长敏感,TRPO 需二阶优化工程复杂。PPO 用 min+clip 把更新“钉”在信任域内,一阶 SGD 即可稳定训练,简单、鲁棒、可复现,成为 RLHF 事实标准。
🎯5 个高频面试考点 (Exam Points)
1
写出 PPO 截断目标 min(r·A, clip(r,1−ε,1+ε)·A),ε 默认取多少?为什么要 min?
2
白板手推: 用数值例(A=+1,r=2 与 A=−1,r=0.5)演示 min+clip 如何限制更新幅度?
3
概率比 r_t(θ) 的意义?重要性采样在其中扮演什么角色?
4
Advantage 为正和为负时截断为何方向相反?clip 何时生效、何时不生效?
5
PPO 与 TRPO 的关系?为什么 RLHF/RLVR 默认用 PPO?
📖 关联深度指南:📄 foundations-and-deep-rl
更新于 2026-08-12
🎯
检验攻克程度:针对「PPO 截断目标」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Actor-Critic 框架下一个知识点SAC 最大熵

🔗 更多 强化学习 知识点卡片

行为克隆 BC上下文老虎机思维链与推理强化CQL 保守 Q 学习