TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
世界模型学习 (World Model)
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
world-model
世界模型学习 (World Model)
World Model Learning
🎯
核心定义
世界模型 (World Model) 用参数
ϕ
\phi
ϕ
学习环境的转移与奖励分布
P
ϕ
(
s
′
,
r
∣
s
,
a
)
P_\phi(s', r | s, a)
P
ϕ
(
s
′
,
r
∣
s
,
a
)
:给定状态
s
s
s
与动作
a
a
a
,预测下一状态
s
′
s'
s
′
与即时奖励
r
r
r
。训练目标为最大似然估计 (MLE):
max
ϕ
E
(
s
,
a
,
r
,
s
′
)
∼
D
[
log
P
ϕ
(
s
′
,
r
∣
s
,
a
)
]
\max_\phi \; \mathbb{E}_{(s, a, r, s') \sim \mathcal{D}} \left[ \log P_\phi(s', r | s, a) \right]
ϕ
max
E
(
s
,
a
,
r
,
s
′
)
∼
D
[
lo
g
P
ϕ
(
s
′
,
r
∣
s
,
a
)
]
其中
D
\mathcal{D}
D
为收集的真实交互数据集。学好的模型可替代真实环境生成"想象 rollout",把每条真实样本复用到多次模拟训练与规划中。
💡
使用场景
真实交互采样昂贵或危险的环境(机器人、自动驾驶、医疗);高维像素输入需潜空间建模(见 Dreamer/MuZero);与规划器结合做想象规划(见 MPC);面试常以"无模型 vs 有模型"切入考察。
⚡
解决的核心痛点
无模型 RL 依赖海量真实交互,样本效率低;世界模型把环境"内化"为一阶近似,让智能体在想象中反复训练与规划,样本效率可提升约一个数量级;代价是模型误差会污染下游策略——复合误差
O
(
H
2
ε
)
O(H^2\varepsilon)
O
(
H
2
ε
)
,详见 model-vs-model-free。
🎯
5 个高频面试考点 (Exam Points)
1
世界模型学习的目标函数是什么?写出 MLE 训练目标及各项含义。
2
世界模型为什么能提升样本效率?想象 rollout 与真实交互的差异?
3
模型误差如何影响下游策略?什么是复合误差 O(H²ε)?
4
显式(像素/状态级)与隐式(潜空间)世界模型的区别?各举一例。
5
除了经典 RL,世界模型在 LLM/Agent 场景有哪些新应用?
📖 关联深度指南:
📄 model-based-rl-and-planning →
更新于 2026-08-12
🎯
检验攻克程度:针对「世界模型学习 (World Model)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
离线到在线微调
下一个知识点 →
Dyna 架构 (Dyna-Q)
🔗 更多 强化学习 知识点卡片
Actor-Critic 框架
行为克隆 BC
上下文老虎机
思维链与推理强化