返回 强化学习 思维导图
中文·English
🎮 强化学习ID: marl

多智能体 CTDE/MAPPO

Multi-Agent RL (CTDE)
🎯核心定义
MARL (Multi-Agent Reinforcement Learning) 让多个智能体同时学习。每个智能体视角下的环境非平稳——其他智能体的策略也在演化,直接套用单智能体算法会不稳定。主流范式是 CTDE(集中训练,分布执行):训练时共享全局信息(全局状态、所有智能体动作)以利于信用分配,执行时每个智能体只看自身局部观测 oio_i 独立决策。
📌核心概述
1. MAPPO: 多智能体 PPO。Actor 沿用策略梯度与截断目标:θiJi=E[θilogπθi(aioi)A^i]\nabla_{\theta_i} J_i = \mathbb{E}[\nabla_{\theta_i}\log\pi_{\theta_i}(a_i|o_i)\hat{A}_i],但共享一个集中式 Critic Vϕ(s)V_\phi(s)(输入全局状态 ss),优势 A^i=ri+γVϕ(s)Vϕ(s)\hat{A}_i = r_i + \gamma V_\phi(s') - V_\phi(s) 由全局信息计算,显著减少非平稳带来的偏差;同构智能体常用参数共享(同一网络 + one-hot 身份特征),样本效率大幅提升; 2. MADDPG: DDPG 的集中式扩展。每个智能体一个集中式 Critic Qiμ(s,a1,,aN)Q_i^{\mu}(s, a_1, \ldots, a_N)(输入所有智能体的动作,把环境动态固定在给定联合动作下),Actor μi(oi)\mu_i(o_i) 只用局部观测执行;训练时用其他智能体的策略做拟合重要性采样估计对手行为,缓解非平稳; 3. 核心难点与缓解: 非平稳(目标随对手策略漂移)→ CTDE/对手建模;credit assignment(团队奖励难归因到个体)→ 差分奖励 ri=RRir_i = R - R_{-i}、熵激励;联合动作空间随 NN 指数爆炸 → 分解 Q 值(VDN/QMIX)、角色/层级结构。
💡使用场景
机器人协作、自动驾驶交互、游戏(OpenAI Five、StarCraft)、多智能体 LLM 协作与博弈。
解决的核心痛点
独立学习者把其他智能体当作环境噪声,目标非平稳导致单智能体收敛保证失效;CTDE 在训练期集中信息、执行期保持可扩展,是精度与计算成本的折中,也是 MAPPO/MADDPG/VDN/QMIX 的共同范式。
🎯5 个高频面试考点 (Exam Points)
1
解释 CTDE:集中训练与分布执行分别指什么?为什么要这样做?
2
MAPPO 的共享集中式 Critic 与单智能体 PPO 有何不同?优势函数如何计算?
3
MADDPG 的集中式 Critic Q_i(s,a₁..a_N) 如何缓解环境非平稳?与 MAPPO 有何异同?
4
白板手推: 写出 MAPPO 的 Actor 梯度与优势计算公式,并说明其与 PPO/策略梯度定理的继承关系?
5
MARL 三大难点:非平稳、credit assignment、指数动作空间,各有哪些缓解手段?
📖 关联深度指南:📄 foundations-and-deep-rl
更新于 2026-08-12
🎯
检验攻克程度:针对「多智能体 CTDE/MAPPO」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点SAC 最大熵下一个知识点多臂老虎机 MAB

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化