返回 多模态 思维导图
中文·English
👁️ 多模态ID: embodied-rl

具身智能 (跨模块)

Embodied AI (cross-module)
🎯核心定义
具身智能把多模态感知 (VLM) 与决策 (RL) 闭环: 世界模型做想象 rollout 供 MPC 规划, 策略经 RL 优化, Diffusion Policy 直接生成连续动作轨迹。
💡使用场景
具身/机器人面试涉及"感知到动作"链路时, 按 RL 模块知识回答。
解决的核心痛点
把连续动作决策交给成熟 RL 框架, 多模态模型只负责感知, 避免端到端耦合难以训练。详见 RL 模块: 世界模型、MPC、RL 策略见 RL 模块 (指南 model-based-rl-and-planning)。
🎯5 个高频面试考点 (Exam Points)
1
具身智能中感知 (VLM) 与决策 (RL) 如何闭环? 世界模型在链路中处于什么位置?
2
MPC 用世界模型做想象规划的原理? 与纯策略学习的区别?
3
Diffusion Policy 为什么适合机器人动作生成?
4
世界模型误差在具身闭环中的影响? 如何缓解复合误差?
5
具身训练数据从哪来? 遥操作/仿真与真实数据的各自优劣?
📖 关联深度指南:📄 model-based-rl-and-planning
更新于 2026-08-12
🎯
检验攻克程度:针对「具身智能 (跨模块)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点LLM 底座 (跨模块)下一个知识点多模态 RAG (跨模块)

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用