TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
Actor-Critic 框架
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
actor-critic
Actor-Critic 框架
Actor-Critic
🎯
核心定义
Actor-Critic 由
Actor
(策略网络
π
θ
(
a
∣
s
)
\pi_\theta(a|s)
π
θ
(
a
∣
s
)
,负责产生动作)与
Critic
(价值网络
V
w
(
s
)
V_w(s)
V
w
(
s
)
,负责评估状态)组成:策略梯度方向上更新 Actor,Critic 提供
价值基线
与
优势估计
降方差。核心公式:
📌
核心概述
∇
θ
J
=
E
s
,
a
[
∇
θ
log
π
θ
(
a
∣
s
)
A
π
(
s
,
a
)
]
,
A
(
s
,
a
)
=
Q
π
(
s
,
a
)
−
V
π
(
s
)
\nabla_\theta J = \mathbb{E}_{s,a}\left[\nabla_\theta \log \pi_\theta(a|s) A^{\pi}(s,a)\right],\quad A(s,a) = Q^{\pi}(s,a) - V^{\pi}(s)
∇
θ
J
=
E
s
,
a
[
∇
θ
lo
g
π
θ
(
a
∣
s
)
A
π
(
s
,
a
)
]
,
A
(
s
,
a
)
=
Q
π
(
s
,
a
)
−
V
π
(
s
)
📌
核心概述
推导链: 1. 从策略梯度定理出发,用
Q
π
(
s
,
a
)
=
r
+
γ
V
π
(
s
′
)
Q^{\pi}(s,a) = r + \gamma V^{\pi}(s')
Q
π
(
s
,
a
)
=
r
+
γ
V
π
(
s
′
)
代入优势并移项,得一步
TD 误差
形式:
∇
θ
J
=
E
[
∇
θ
log
π
θ
(
a
∣
s
)
(
r
+
γ
V
w
(
s
′
)
−
V
w
(
s
)
)
⏟
δ
T
D
]
\nabla_\theta J = \mathbb{E}[\nabla_\theta \log \pi_\theta(a|s)\underbrace{(r + \gamma V_w(s') - V_w(s))}_{\delta_{TD}}]
∇
θ
J
=
E
[
∇
θ
lo
g
π
θ
(
a
∣
s
)
δ
T
D
(
r
+
γ
V
w
(
s
′
)
−
V
w
(
s
))
]
—— 用单步自举的 TD 误差充当优势估计; 2. Critic 以最小二乘拟合价值:
L
(
w
)
=
E
[
(
r
+
γ
V
w
(
s
′
)
−
V
w
(
s
)
)
2
]
L(w) = \mathbb{E}[(r + \gamma V_w(s') - V_w(s))^2]
L
(
w
)
=
E
[(
r
+
γ
V
w
(
s
′
)
−
V
w
(
s
)
)
2
]
,
∇
w
L
=
−
2
E
[
δ
T
D
∇
w
V
w
(
s
)
]
\nabla_w L = -2\mathbb{E}[\delta_{TD}\nabla_w V_w(s)]
∇
w
L
=
−
2
E
[
δ
T
D
∇
w
V
w
(
s
)]
(TD(0):有偏低方差,因自举); 3. 推广到 TD(
λ
\lambda
λ
)/
GAE
:
A
t
=
∑
l
=
0
∞
(
γ
λ
)
l
δ
t
+
l
A_t = \sum_{l=0}^{\infty}(\gamma\lambda)^l\delta_{t+l}
A
t
=
∑
l
=
0
∞
(
γ
λ
)
l
δ
t
+
l
,
δ
t
=
r
t
+
γ
V
(
s
t
+
1
)
−
V
(
s
t
)
\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)
δ
t
=
r
t
+
γ
V
(
s
t
+
1
)
−
V
(
s
t
)
。
λ
=
0
\lambda=0
λ
=
0
即纯 TD 优势(低方差高偏差),
λ
=
1
\lambda=1
λ
=
1
即 MC 优势(高方差低偏差),
0
<
λ
<
1
0<\lambda<1
0
<
λ
<
1
折中;GAE 是 PPO/RLHF 的标准配置; 4. Actor 更新:
θ
←
θ
+
η
∇
θ
log
π
θ
(
a
t
∣
s
t
)
A
^
t
\theta \leftarrow \theta + \eta \nabla_\theta \log \pi_\theta(a_t|s_t)\hat{A}_t
θ
←
θ
+
η
∇
θ
lo
g
π
θ
(
a
t
∣
s
t
)
A
^
t
。基线无偏性同策略梯度:
E
[
∇
θ
log
π
⋅
V
(
s
)
]
=
0
\mathbb{E}[\nabla_\theta \log \pi \cdot V(s)] = 0
E
[
∇
θ
lo
g
π
⋅
V
(
s
)]
=
0
,减基线不改期望只降方差。
💡
使用场景
在线(on-policy)与离策略算法的通用骨架——A2C/A3C、PPO、SAC、TD3、GRPO(以组内相对奖励替代 Critic)都是 Actor-Critic 的变体。
⚡
解决的核心痛点
REINFORCE 用整段回报、方差高,且只学策略不学价值。Critic 提供
V
(
s
)
V(s)
V
(
s
)
基线,在不改变梯度期望的前提下抵消与状态相关的高方差分量,并给出
信用分配
(评估每一步动作的相对优劣
A
(
s
,
a
)
A(s,a)
A
(
s
,
a
)
);Actor 与 Critic 交替更新、互为监督信号,是深度 RL 最重要的框架。
🎯
5 个高频面试考点 (Exam Points)
1
写出优势函数 A(s,a)=Q(s,a)−V(s),说明为何用优势而非 Q 或奖励本身更新策略?
2
白板手推: 从策略梯度定理推导 Actor 的 TD 误差更新方向,并证明价值基线 V(s) 无偏?
3
Critic 的损失 L=E[(r+γV(s')−V(s))²] 如何得到?TD(λ)/GAE 如何折中偏差与方差?
4
Actor-Critic 相比 REINFORCE 改进在哪?方差为何更低、可在线训练?
5
A2C/A3C、PPO、SAC、GRPO 如何复用 Actor-Critic 骨架?各做了哪些改动?
📖 关联深度指南:
📄 foundations-and-deep-rl →
更新于 2026-08-12
🎯
检验攻克程度:针对「Actor-Critic 框架」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
DQN 三件套
下一个知识点 →
PPO 截断目标
🔗 更多 强化学习 知识点卡片
行为克隆 BC
上下文老虎机
思维链与推理强化
CQL 保守 Q 学习