🎯核心定义
具身智能把多模态感知 (VLM) 与决策 (RL) 闭环: 世界模型做想象 rollout 供 MPC 规划, 策略经 RL 优化, Diffusion Policy 直接生成连续动作轨迹。
💡使用场景
具身/机器人面试涉及"感知到动作"链路时, 按 RL 模块知识回答。
⚡解决的核心痛点
把连续动作决策交给成熟 RL 框架, 多模态模型只负责感知, 避免端到端耦合难以训练。详见 RL 模块: 世界模型、MPC、RL 策略见 RL 模块 (指南 model-based-rl-and-planning)。