返回 强化学习 思维导图
中文·English
🎮 强化学习ID: world-model

世界模型学习 (World Model)

World Model Learning
🎯核心定义
世界模型 (World Model) 用参数 ϕ\phi 学习环境的转移与奖励分布 Pϕ(s,rs,a)P_\phi(s', r | s, a):给定状态 ss 与动作 aa,预测下一状态 ss' 与即时奖励 rr。训练目标为最大似然估计 (MLE): maxϕ  E(s,a,r,s)D[logPϕ(s,rs,a)]\max_\phi \; \mathbb{E}_{(s, a, r, s') \sim \mathcal{D}} \left[ \log P_\phi(s', r | s, a) \right] 其中 D\mathcal{D} 为收集的真实交互数据集。学好的模型可替代真实环境生成"想象 rollout",把每条真实样本复用到多次模拟训练与规划中。
💡使用场景
真实交互采样昂贵或危险的环境(机器人、自动驾驶、医疗);高维像素输入需潜空间建模(见 Dreamer/MuZero);与规划器结合做想象规划(见 MPC);面试常以"无模型 vs 有模型"切入考察。
解决的核心痛点
无模型 RL 依赖海量真实交互,样本效率低;世界模型把环境"内化"为一阶近似,让智能体在想象中反复训练与规划,样本效率可提升约一个数量级;代价是模型误差会污染下游策略——复合误差 O(H2ε)O(H^2\varepsilon),详见 model-vs-model-free。
🎯5 个高频面试考点 (Exam Points)
1
世界模型学习的目标函数是什么?写出 MLE 训练目标及各项含义。
2
世界模型为什么能提升样本效率?想象 rollout 与真实交互的差异?
3
模型误差如何影响下游策略?什么是复合误差 O(H²ε)?
4
显式(像素/状态级)与隐式(潜空间)世界模型的区别?各举一例。
5
除了经典 RL,世界模型在 LLM/Agent 场景有哪些新应用?
📖 关联深度指南:📄 model-based-rl-and-planning
更新于 2026-08-12
🎯
检验攻克程度:针对「世界模型学习 (World Model)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点离线到在线微调下一个知识点Dyna 架构 (Dyna-Q)

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化