返回 强化学习 思维导图
中文·English
🎮 强化学习ID: actor-critic

Actor-Critic 框架

Actor-Critic
🎯核心定义
Actor-Critic 由 Actor(策略网络 πθ(as)\pi_\theta(a|s),负责产生动作)与 Critic(价值网络 Vw(s)V_w(s),负责评估状态)组成:策略梯度方向上更新 Actor,Critic 提供价值基线优势估计降方差。核心公式:
📌核心概述
θJ=Es,a[θlogπθ(as)Aπ(s,a)],A(s,a)=Qπ(s,a)Vπ(s)\nabla_\theta J = \mathbb{E}_{s,a}\left[\nabla_\theta \log \pi_\theta(a|s) A^{\pi}(s,a)\right],\quad A(s,a) = Q^{\pi}(s,a) - V^{\pi}(s)
📌核心概述
推导链: 1. 从策略梯度定理出发,用 Qπ(s,a)=r+γVπ(s)Q^{\pi}(s,a) = r + \gamma V^{\pi}(s') 代入优势并移项,得一步 TD 误差形式:θJ=E[θlogπθ(as)(r+γVw(s)Vw(s))δTD]\nabla_\theta J = \mathbb{E}[\nabla_\theta \log \pi_\theta(a|s)\underbrace{(r + \gamma V_w(s') - V_w(s))}_{\delta_{TD}}] —— 用单步自举的 TD 误差充当优势估计; 2. Critic 以最小二乘拟合价值:L(w)=E[(r+γVw(s)Vw(s))2]L(w) = \mathbb{E}[(r + \gamma V_w(s') - V_w(s))^2],wL=2E[δTDwVw(s)]\nabla_w L = -2\mathbb{E}[\delta_{TD}\nabla_w V_w(s)](TD(0):有偏低方差,因自举); 3. 推广到 TD(λ\lambda)/GAE:At=l=0(γλ)lδt+lA_t = \sum_{l=0}^{\infty}(\gamma\lambda)^l\delta_{t+l},δt=rt+γV(st+1)V(st)\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)λ=0\lambda=0 即纯 TD 优势(低方差高偏差),λ=1\lambda=1 即 MC 优势(高方差低偏差),0<λ<10<\lambda<1 折中;GAE 是 PPO/RLHF 的标准配置; 4. Actor 更新:θθ+ηθlogπθ(atst)A^t\theta \leftarrow \theta + \eta \nabla_\theta \log \pi_\theta(a_t|s_t)\hat{A}_t。基线无偏性同策略梯度:E[θlogπV(s)]=0\mathbb{E}[\nabla_\theta \log \pi \cdot V(s)] = 0,减基线不改期望只降方差。
💡使用场景
在线(on-policy)与离策略算法的通用骨架——A2C/A3C、PPO、SAC、TD3、GRPO(以组内相对奖励替代 Critic)都是 Actor-Critic 的变体。
解决的核心痛点
REINFORCE 用整段回报、方差高,且只学策略不学价值。Critic 提供 V(s)V(s) 基线,在不改变梯度期望的前提下抵消与状态相关的高方差分量,并给出信用分配(评估每一步动作的相对优劣 A(s,a)A(s,a));Actor 与 Critic 交替更新、互为监督信号,是深度 RL 最重要的框架。
🎯5 个高频面试考点 (Exam Points)
1
写出优势函数 A(s,a)=Q(s,a)−V(s),说明为何用优势而非 Q 或奖励本身更新策略?
2
白板手推: 从策略梯度定理推导 Actor 的 TD 误差更新方向,并证明价值基线 V(s) 无偏?
3
Critic 的损失 L=E[(r+γV(s')−V(s))²] 如何得到?TD(λ)/GAE 如何折中偏差与方差?
4
Actor-Critic 相比 REINFORCE 改进在哪?方差为何更低、可在线训练?
5
A2C/A3C、PPO、SAC、GRPO 如何复用 Actor-Critic 骨架?各做了哪些改动?
📖 关联深度指南:📄 foundations-and-deep-rl
更新于 2026-08-12
🎯
检验攻克程度:针对「Actor-Critic 框架」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点DQN 三件套下一个知识点PPO 截断目标

🔗 更多 强化学习 知识点卡片

行为克隆 BC上下文老虎机思维链与推理强化CQL 保守 Q 学习