TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
MuZero 潜空间模型
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
muzero
MuZero 潜空间模型
MuZero Latent Model
🎯
核心定义
MuZero 把棋类 AlphaZero 的树搜索扩展到规则未知的环境,在潜空间中学习动态与奖励,用三个神经网络函数: ① 表示函数 (representation):
s
t
0
=
h
θ
(
s
t
−
1
,
a
t
−
1
)
s^0_t = h_\theta(s_{t-1}, a_{t-1})
s
t
0
=
h
θ
(
s
t
−
1
,
a
t
−
1
)
——把(历史的)观测压缩成潜状态;② 动态函数 (dynamics):
(
s
k
,
r
k
)
=
g
θ
(
s
k
−
1
,
a
k
)
(s^k, r^k) = g_\theta(s^{k-1}, a^k)
(
s
k
,
r
k
)
=
g
θ
(
s
k
−
1
,
a
k
)
——在潜空间前推,并预测奖励
p
r
p^r
p
r
;③ 预测函数 (prediction):
(
p
k
,
v
k
)
=
f
θ
(
s
k
)
(p^k, v^k) = f_\theta(s^k)
(
p
k
,
v
k
)
=
f
θ
(
s
k
)
——预测策略与价值
p
v
p^v
p
v
。
📌
核心概述
MCTS 结合
: 搜索树的每条边由网络展开(而非真实环境/规则模拟器),模拟时用预测奖励
r
k
r^k
r
k
沿路径累加回报、用预测价值
v
k
v^k
v
k
回溯估计
G
G
G
,根节点策略由访问计数 softmax 给出;训练时用 MCTS 输出的策略目标与真实观测的奖励/价值目标回训三个函数。关键:奖励在潜空间中被
g
θ
g_\theta
g
θ
预测,而非显式建模真实环境的奖励——因此不需要真实奖励函数也能规划。
💡
使用场景
棋类(西洋棋/将棋/围棋超人类水平)、Atari 像素输入、规则或奖励未知的任务;面试高频题是"AlphaZero 之后如何去掉显式规则"。
⚡
解决的核心痛点
AlphaZero 依赖已知环境(规则 + 模拟器)做树搜索;MuZero 用潜空间模型替代环境模拟器,把 MCTS 扩展到奖励/规则未知的真实世界,同时保持超人类棋力——用模型偏差换取对环境的通用性。
🎯
5 个高频面试考点 (Exam Points)
1
MuZero 三个函数(representation/dynamics/prediction)的输入输出与各自作用?
2
MuZero 如何不显式建模真实奖励也能规划?潜空间奖励预测如何训练?
3
MuZero 的 MCTS 与 AlphaZero 的 MCTS 有什么区别?
4
MuZero 的策略/价值训练目标如何由搜索构造?
5
相比 AlphaZero,MuZero 在何种意义上能推广到真实世界?
📖 关联深度指南:
📄 model-based-rl-and-planning →
更新于 2026-08-12
🎯
检验攻克程度:针对「MuZero 潜空间模型」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
MPC 规划 (Model Predictive Control)
下一个知识点 →
Dreamer RSSM 潜想象
🔗 更多 强化学习 知识点卡片
Actor-Critic 框架
行为克隆 BC
上下文老虎机
思维链与推理强化