近端策略优化 (Proximal Policy Optimization, PPO) 悲观剪切代理目标函数与下界严格数学证明 (PPO Clipped Surrogate Objective & Pessimistic Bound Proof) 是强化学习理论与研究科学家考察信任域策略优化 (TRPO) 向一阶优化演进的经典推导;TRPO 证明了新旧策略性能单调提升下界:
η(π)≥Lπold(π)−C⋅DKLmax(πold,π),但计算二阶自然梯度与 Fisher 信息矩阵逆矩阵开销巨大;PPO-Clip 提出极简的一阶悲观下界代理目标:
LCLIP(θ)=E^t[min(rt(θ)A^t,clip(rt(θ),1−ϵ,1+ϵ)A^t)](其中概率比
rt(θ)=πθold(at∣st)πθ(at∣st));通过
min 算子构造了对未剪切目标的悲观下界 (Pessimistic Lower Bound),当优势
A^t>0 时限制策略过大增长,当
A^t<0 时限制策略剧烈恶化,在仅用一阶 SGD 的前提下保证了策略更新的单调稳定性。