TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
Dreamer RSSM 潜想象
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
dreamer
Dreamer RSSM 潜想象
Dreamer RSSM (Latent Imagination)
🎯
核心定义
Dreamer 用 RSSM (Recurrent State-Space Model, 循环状态空间模型) 从像素观测学习世界模型,再在潜想象中训练策略。RSSM 的潜状态分两条路径: ① 确定性路径:
h
t
=
f
(
h
t
−
1
,
z
t
−
1
,
a
t
−
1
)
h_t = f(h_{t-1}, z_{t-1}, a_{t-1})
h
t
=
f
(
h
t
−
1
,
z
t
−
1
,
a
t
−
1
)
——循环网络整合历史信息;② 随机路径:
z
t
∼
q
(
z
t
∣
h
t
,
o
t
)
z_t \sim q(z_t | h_t, o_t)
z
t
∼
q
(
z
t
∣
h
t
,
o
t
)
——编码当前观测的随机潜变量; 重建头:
o
^
t
=
o
(
h
t
,
z
t
)
\hat{o}_t = o(h_t, z_t)
o
^
t
=
o
(
h
t
,
z
t
)
(重建观测)、
r
^
t
=
r
(
h
t
,
z
t
)
\hat{r}_t = r(h_t, z_t)
r
^
t
=
r
(
h
t
,
z
t
)
(预测奖励)。
📌
核心概述
潜想象训练策略
: 两阶段——先只用真实序列训练世界模型(重建观测 + 预测奖励 + KL 正则,使
q
q
q
贴近先验);然后冻结模型"做梦":从当前潜状态出发,用当前策略在潜空间展开 rollout,得到纯想象的轨迹序列,再用 actor-critic 在这条想象轨迹上最大化折扣回报。策略与价值头只在潜空间训练,不接触真实环境。
💡
使用场景
像素级控制(DMC、Atari)、机器人学习;Dreamer V1/V2/V3 是 Model-Based 像素控制 SOTA 系列;面试关注"潜空间做梦"如何省样本。
⚡
解决的核心痛点
像素级无模型 RL 样本效率极低;RSSM 的确定+随机混合设计同时捕捉时序依赖与观测不确定性,使长程想象 rollout 保持稳定(纯随机模型在想象中发散),样本效率比无模型 SOTA 高约一个数量级。
🎯
5 个高频面试考点 (Exam Points)
1
RSSM 的确定性状态与随机状态分别建模什么?写出更新式 h_t = f(h_{t-1}, z_{t-1}, a_{t-1}) 并解释。
2
Dreamer 如何"做梦"训练策略?潜想象 rollout 的完整流程?
3
为什么随机潜变量 z_t 对想象 rollout 是必要的?纯确定性/纯随机模型会怎样?
4
Dreamer 与 MuZero 的潜空间建模有何异同?
5
Dreamer 在像素控制上的样本效率比无模型 SOTA 高多少?为什么?
📖 关联深度指南:
📄 model-based-rl-and-planning →
更新于 2026-08-12
🎯
检验攻克程度:针对「Dreamer RSSM 潜想象」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
MuZero 潜空间模型
下一个知识点 →
基于模型 vs 无模型 (MB vs MF)
🔗 更多 强化学习 知识点卡片
Actor-Critic 框架
行为克隆 BC
上下文老虎机
思维链与推理强化