1.
MAPPO: 多智能体 PPO。Actor 沿用策略梯度与截断目标:
∇θiJi=E[∇θilogπθi(ai∣oi)A^i],但
共享一个集中式 Critic Vϕ(s)(输入全局状态
s),优势
A^i=ri+γVϕ(s′)−Vϕ(s) 由全局信息计算,显著减少非平稳带来的偏差;同构智能体常用
参数共享(同一网络 + one-hot 身份特征),样本效率大幅提升;
2.
MADDPG: DDPG 的集中式扩展。每个智能体一个
集中式 Critic Qiμ(s,a1,…,aN)(输入
所有智能体的动作,把环境动态固定在给定联合动作下),Actor
μi(oi) 只用局部观测执行;训练时用其他智能体的策略做拟合重要性采样估计对手行为,缓解非平稳;
3.
核心难点与缓解: 非平稳(目标随对手策略漂移)→ CTDE/对手建模;credit assignment(团队奖励难归因到个体)→ 差分奖励
ri=R−R−i、熵激励;联合动作空间随
N 指数爆炸 → 分解 Q 值(VDN/QMIX)、角色/层级结构。