返回 强化学习 思维导图
中文·English
🎮 强化学习ID: muzero

MuZero 潜空间模型

MuZero Latent Model
🎯核心定义
MuZero 把棋类 AlphaZero 的树搜索扩展到规则未知的环境,在潜空间中学习动态与奖励,用三个神经网络函数: ① 表示函数 (representation): st0=hθ(st1,at1)s^0_t = h_\theta(s_{t-1}, a_{t-1})——把(历史的)观测压缩成潜状态;② 动态函数 (dynamics): (sk,rk)=gθ(sk1,ak)(s^k, r^k) = g_\theta(s^{k-1}, a^k)——在潜空间前推,并预测奖励 prp^r;③ 预测函数 (prediction): (pk,vk)=fθ(sk)(p^k, v^k) = f_\theta(s^k)——预测策略与价值 pvp^v
📌核心概述
MCTS 结合: 搜索树的每条边由网络展开(而非真实环境/规则模拟器),模拟时用预测奖励 rkr^k 沿路径累加回报、用预测价值 vkv^k 回溯估计 GG,根节点策略由访问计数 softmax 给出;训练时用 MCTS 输出的策略目标与真实观测的奖励/价值目标回训三个函数。关键:奖励在潜空间中被 gθg_\theta 预测,而非显式建模真实环境的奖励——因此不需要真实奖励函数也能规划。
💡使用场景
棋类(西洋棋/将棋/围棋超人类水平)、Atari 像素输入、规则或奖励未知的任务;面试高频题是"AlphaZero 之后如何去掉显式规则"。
解决的核心痛点
AlphaZero 依赖已知环境(规则 + 模拟器)做树搜索;MuZero 用潜空间模型替代环境模拟器,把 MCTS 扩展到奖励/规则未知的真实世界,同时保持超人类棋力——用模型偏差换取对环境的通用性。
🎯5 个高频面试考点 (Exam Points)
1
MuZero 三个函数(representation/dynamics/prediction)的输入输出与各自作用?
2
MuZero 如何不显式建模真实奖励也能规划?潜空间奖励预测如何训练?
3
MuZero 的 MCTS 与 AlphaZero 的 MCTS 有什么区别?
4
MuZero 的策略/价值训练目标如何由搜索构造?
5
相比 AlphaZero,MuZero 在何种意义上能推广到真实世界?
📖 关联深度指南:📄 model-based-rl-and-planning
更新于 2026-08-12
🎯
检验攻克程度:针对「MuZero 潜空间模型」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点MPC 规划 (Model Predictive Control)下一个知识点Dreamer RSSM 潜想象

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化