返回 强化学习 思维导图
中文·English
🎮 强化学习ID: sac

SAC 最大熵

SAC Max-Entropy
🎯核心定义
SAC (Soft Actor-Critic, 软演员-评论家) 是最大熵离策略 Actor-Critic 算法,目标在累积回报外加入策略熵正则:
📌核心概述
J(π)=Eτπ[tγt(r(st,at)+αH(π(st)))],H(π(s))=Eaπ[logπ(as)]\mathcal{J}(\pi) = \mathbb{E}_{\tau\sim\pi}\left[\sum_t \gamma^t\left(r(s_t,a_t) + \alpha\mathcal{H}(\pi(\cdot|s_t))\right)\right],\quad \mathcal{H}(\pi(\cdot|s)) = -\mathbb{E}_{a\sim\pi}[\log \pi(a|s)]
📌核心概述
推导链: 1. 软策略评估:熵奖励使 Bellman 目标变为 y=r+γ(Qθ(s,a)αlogπϕ(as))y = r + \gamma\left(Q_{\theta^-}(s',a') - \alpha\log\pi_\phi(a'|s')\right),aπϕa'\sim\pi_\phi(价值中减去熵项);Critic 最小化 L(θi)=E[(yQθi(s,a))2]L(\theta_i) = \mathbb{E}[(y - Q_{\theta_i}(s,a))^2]; 2. 软策略改进:求解 πnew=argmaxπEaπ[Qπold(s,a)]+αH(π(s))\pi_{new} = \arg\max_\pi \mathbb{E}_{a\sim\pi}[Q^{\pi_{old}}(s,a)] + \alpha\mathcal{H}(\pi(\cdot|s)),闭式解为玻尔兹曼策略 π(as)exp(Q(s,a)/α)\pi^*(a|s) \propto \exp(Q(s,a)/\alpha)(按价值指数的 softmax 采样,温度 α\alpha 控制随机性);实践中用重参数化高斯 a=μϕ(s)+σϕ(s)ϵa = \mu_\phi(s) + \sigma_\phi(s)\odot\epsilon 可微采样,最小化 J(ϕ)=Eϵ[Q(s,a~)+αlogπϕ(a~s)]J(\phi) = \mathbb{E}_{\epsilon}[-Q(s,\tilde{a}) + \alpha\log\pi_\phi(\tilde{a}|s)]; 3. 双 Q 取 min:两个 Critic 独立回归同一目标,目标值取 miniQθi(s,a)\min_i Q_{\theta_i^-}(s',a') 抑制 max 高估(比 Double DQN 更直接的离策略解法); 4. 自动温度:把 α\alpha 视为约束 H(π)Htarget\mathcal{H}(\pi) \ge \mathcal{H}_{target} 的对偶变量,损失 J(α)=Eaπ[αlogπ(as)αHtarget]J(\alpha) = \mathbb{E}_{a\sim\pi}[-\alpha\log\pi(a|s) - \alpha\mathcal{H}_{target}],梯度 αJ=E[logπ(as)+Htarget]\nabla_\alpha J = -\mathbb{E}[\log\pi(a|s) + \mathcal{H}_{target}]:实测熵低于目标时 logπ>Htarget-\log\pi > \mathcal{H}_{target},αJ<0\nabla_\alpha J < 0α\alpha 增大(加强探索);熵过高则 α\alpha 减小。
💡使用场景
连续动作控制(机器人、模拟器)的事实 SOTA 基线;需要随机策略(多峰最优动作)、样本效率要求高的场景。
解决的核心痛点
确定性策略梯度(DDPG/TD3)易陷局部最优、对超参敏感。SAC 的熵正则鼓励探索、天然抗局部最优与多峰动作,离策略 + 回放带来样本效率,双 Q 与自动温度让训练鲁棒,是连续控制领域的默认选择。
🎯5 个高频面试考点 (Exam Points)
1
写出 SAC 的目标 J=E[Σ(r_t + αH(π(·|s_t)))],解释最大熵的意义?
2
白板手推: 从熵正则目标推导软 Bellman 方程与策略改进的闭式解 π∝exp(Q/α)?
3
双 Q 取 min 解决什么问题?与 Double DQN 有何异同?
4
温度 α 自动调节的损失 J(α) 如何设计?熵低于目标时 α 增大还是减小?
5
SAC 为什么是连续控制的默认选择?离策略+随机策略+熵正则的组合优势?
📖 关联深度指南:📄 foundations-and-deep-rl
更新于 2026-08-12
🎯
检验攻克程度:针对「SAC 最大熵」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点PPO 截断目标下一个知识点多智能体 CTDE/MAPPO

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化