返回 强化学习 思维导图
中文·English
🎮 强化学习ID: dreamer

Dreamer RSSM 潜想象

Dreamer RSSM (Latent Imagination)
🎯核心定义
Dreamer 用 RSSM (Recurrent State-Space Model, 循环状态空间模型) 从像素观测学习世界模型,再在潜想象中训练策略。RSSM 的潜状态分两条路径: ① 确定性路径: ht=f(ht1,zt1,at1)h_t = f(h_{t-1}, z_{t-1}, a_{t-1})——循环网络整合历史信息;② 随机路径: ztq(ztht,ot)z_t \sim q(z_t | h_t, o_t)——编码当前观测的随机潜变量; 重建头: o^t=o(ht,zt)\hat{o}_t = o(h_t, z_t)(重建观测)、r^t=r(ht,zt)\hat{r}_t = r(h_t, z_t)(预测奖励)。
📌核心概述
潜想象训练策略: 两阶段——先只用真实序列训练世界模型(重建观测 + 预测奖励 + KL 正则,使 qq 贴近先验);然后冻结模型"做梦":从当前潜状态出发,用当前策略在潜空间展开 rollout,得到纯想象的轨迹序列,再用 actor-critic 在这条想象轨迹上最大化折扣回报。策略与价值头只在潜空间训练,不接触真实环境。
💡使用场景
像素级控制(DMC、Atari)、机器人学习;Dreamer V1/V2/V3 是 Model-Based 像素控制 SOTA 系列;面试关注"潜空间做梦"如何省样本。
解决的核心痛点
像素级无模型 RL 样本效率极低;RSSM 的确定+随机混合设计同时捕捉时序依赖与观测不确定性,使长程想象 rollout 保持稳定(纯随机模型在想象中发散),样本效率比无模型 SOTA 高约一个数量级。
🎯5 个高频面试考点 (Exam Points)
1
RSSM 的确定性状态与随机状态分别建模什么?写出更新式 h_t = f(h_{t-1}, z_{t-1}, a_{t-1}) 并解释。
2
Dreamer 如何"做梦"训练策略?潜想象 rollout 的完整流程?
3
为什么随机潜变量 z_t 对想象 rollout 是必要的?纯确定性/纯随机模型会怎样?
4
Dreamer 与 MuZero 的潜空间建模有何异同?
5
Dreamer 在像素控制上的样本效率比无模型 SOTA 高多少?为什么?
📖 关联深度指南:📄 model-based-rl-and-planning
更新于 2026-08-12
🎯
检验攻克程度:针对「Dreamer RSSM 潜想象」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点MuZero 潜空间模型下一个知识点基于模型 vs 无模型 (MB vs MF)

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化