返回 大语言模型 思维导图
中文·English
大语言模型ID: ppo-clip

PPO 截断损失

PPO Clipped Objective
🎯核心定义
PPO (Proximal Policy Optimization, 近端策略优化) 用截断的概率比约束策略更新幅度。定义概率比rt(θ)=πθ(atst)πθold(atst)r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{\text{old}}}(a_t|s_t)},截断目标为LCLIP(θ)=Et[min(rt(θ)A^t,  clip(rt(θ),1ε,1+ε)A^t)]L^{CLIP}(\theta) = \mathbb{E}_t[\min(r_t(\theta) \hat{A}_t,\; \operatorname{clip}(r_t(\theta), 1-\varepsilon, 1+\varepsilon) \hat{A}_t)],常用 ε=0.2\varepsilon = 0.2:Advantage 为正时 rr 至多取 1.21.2,为负时至少取 0.80.8(截断方向相反),如 r=2r=2 被按 1.21.2 截断,防止策略单步突跳。
💡使用场景
RLHF 第三阶段的策略优化(与 KL 惩罚、GAE 一起使用);也是 OpenAI 默认的通用 RL 算法,适用于连续与离散动作空间的大规模分布式训练。
解决的核心痛点
传统策略梯度 (REINFORCE) 对步长极其敏感,一步更新过大策略立即崩溃;TRPO 用约束保证单调改进但需解二阶优化,工程复杂。PPO 用 clip 近似约束,一阶优化即可稳定训练,简单而可靠。
🎯5 个高频面试考点 (Exam Points)
1
写出 PPO 截断目标函数并解释 clip 的作用?为什么 ε 取 0.2?
2
Advantage 为正和为负时,截断分别如何生效?r=2 时会发生什么?
3
概率比 r_t(θ) 的含义?重要性采样在其中扮演什么角色?
4
PPO 与 TRPO 的关系?为什么实践中 PPO 更常用?
5
RLHF 中 PPO 的奖励如何构造?GAE 和 KL 惩罚的作用?
📖 关联深度指南:📄 alignment-and-rlhf-dpo
更新于 2026-08-12
🎯
检验攻克程度:针对「PPO 截断损失」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点RLHF 三阶段下一个知识点DPO 直接偏好优化

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA