返回 强化学习 思维导图
中文·English
🎮 强化学习ID: policy-gradient

策略梯度 REINFORCE

Policy Gradient Theorem
🎯核心定义
策略梯度定理给出目标 J(θ)=Eτ[R(τ)]J(\theta)=\mathbb{E}_{\tau}[R(\tau)] 对参数 θ\theta 的无模型梯度,核心是 Log-Derivative Trick 与期望形式 θJ=Eτ[tθlogπθ(atst)Gt]\nabla_\theta J = \mathbb{E}_{\tau}[\sum_t \nabla_\theta \log \pi_\theta(a_t|s_t) G_t]。推导链:
📌核心概述
1. 对目标求导并乘除 πθ(τ)\pi_\theta(\tau):θJ=θπθ(τ)R(τ)dτ=πθ(τ)θπθ(τ)πθ(τ)R(τ)dτ=Eτ[θlogπθ(τ)R(τ)]\nabla_\theta J = \nabla_\theta\int \pi_\theta(\tau)R(\tau)\,d\tau = \int \pi_\theta(\tau)\frac{\nabla_\theta \pi_\theta(\tau)}{\pi_\theta(\tau)}R(\tau)\,d\tau = \mathbb{E}_{\tau}[\nabla_\theta \log \pi_\theta(\tau) R(\tau)],其中 Log-Derivative Trickθlogπθ(as)=θπθ(as)πθ(as)\nabla_\theta \log \pi_\theta(a|s) = \frac{\nabla_\theta \pi_\theta(a|s)}{\pi_\theta(a|s)}(把对概率求导转为对对数概率求导,期望仍无偏); 2. 分解轨迹 πθ(τ)=μ(s0)tπθ(atst)P(st+1st,at)\pi_\theta(\tau) = \mu(s_0)\prod_t \pi_\theta(a_t|s_t)P(s_{t+1}|s_t,a_t) 并取对数:动力学项 μ,P\mu, P 不含 θ\theta,求导后消去,只剩 tθlogπθ(atst)\sum_t \nabla_\theta \log \pi_\theta(a_t|s_t) —— 这就是“无需模型、状态分布不可导也能更新”的关键; 3. 因果性:动作 ata_t 只影响未来回报,把整段回报换成 reward-to-go Gt=ktγktrkG_t = \sum_{k\ge t}\gamma^{k-t}r_k(方差更低),得到期望形式,即 REINFORCE 的更新量 θθ+ηtθlogπθ(atst)Gt\theta \leftarrow \theta + \eta \sum_t \nabla_\theta \log \pi_\theta(a_t|s_t) G_t
💡使用场景
回合式任务(需完整轨迹、MC 风格)、连续动作空间;REINFORCE 是最简实现,GRPO/RLHF 的组内相对更新也以其为出发点。
解决的核心痛点
直接对概率求导困难,且整段回报估计方差极大。引入基线 b(s)b(s)θJ=E[θlogπθ(as)(Gtb(s))]\nabla_\theta J = \mathbb{E}[\nabla_\theta \log \pi_\theta(a|s)(G_t - b(s))]基线无偏性证明:E[θlogπθ(as)b(s)]=b(s)aπθ(as)θπθ(as)πθ(as)=b(s)θaπθ(as)=b(s)θ1=0\mathbb{E}[\nabla_\theta \log \pi_\theta(a|s) b(s)] = b(s)\sum_a \pi_\theta(a|s)\frac{\nabla_\theta \pi_\theta(a|s)}{\pi_\theta(a|s)} = b(s)\nabla_\theta\sum_a \pi_\theta(a|s) = b(s)\nabla_\theta 1 = 0,即减基线不改变梯度期望(无偏),只抵消与动作无关的方差分量;取 b(s)=V(s)b(s) = V(s) 即优势形式,催生 Actor-Critic;步长敏感性则催生 TRPO/PPO。
🎯5 个高频面试考点 (Exam Points)
1
白板手推: 从 J(θ)=E_τ[R(τ)] 出发推导策略梯度定理,说明动力学项为何消去?
2
Log-Derivative Trick 的原理?为什么由此得到的梯度估计是无偏的?
3
证明 E[∇log π(a|s)·b(s)] = 0,并解释基线为什么能降方差而不改变梯度期望?
4
reward-to-go G_t 与整段回报相比为什么方差更低?REINFORCE 与 MC 的关系?
5
策略梯度高方差与步长敏感的根源?演化出哪些改进(TRPO/PPO/GAE)?
📖 关联深度指南:📄 foundations-and-deep-rl
更新于 2026-08-12
🎯
检验攻克程度:针对「策略梯度 REINFORCE」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点探索-利用权衡下一个知识点TRPO 与 PPO 脉络

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化