Back to Reinforcement Learning Mind Map
中文·English
🎮 Reinforcement LearningID: robotics-embodied

Embodied AI & Robotics

具身智能与机器人
🎯Core Definition
Embodied AI couples RL/planning with visual world models for robot control: V-JEPA predicts visual features in latent space (a visual world model), while Diffusion Policy directly predicts multimodal continuous action distributions — Gaussian policies cannot express multimodal actions, but diffusion policies can.
💡Use Cases
continuous-action control (manipulation, navigation), cross-task generalization, sample-efficient learning; interviews often enter via 'RL meets vision models'.
Key Problems Solved
multimodal action modeling and real-interaction sample efficiency. See the Multimodal module: full content on V-JEPA and Diffusion Policy in the Multimodal module's cards (guide world-models-jepa).
🎯5 High-Frequency Exam Points
1
How do RL and visual world models split roles in embodied AI? V-JEPA's role?
2
Why can't Gaussian policies model multimodal actions? How does Diffusion Policy fix it?
3
Sample-efficiency bottleneck in robot RL? How do world models/demonstrations help?
4
Commonalities between embodied AI and LLM reasoning RL (prediction/planning/world models)?
5
V-JEPA latent-space prediction vs explicit pixel prediction: pros and cons?
📖 In-depth Guide:📄 world-models-jepa
Updated 2026-08-12
🎯
Test Your Knowledge: Practice Questions for "Embodied AI & Robotics"
Single choice pitfall questions with instant feedback and mistake tracking.
🚀 Start Card Practice
Previous CardModel-Based vs Model-FreeNext CardGroup Relative Policy Optimization

🔗 More Reinforcement Learning Knowledge Cards

Actor-CriticBehavioral CloningContextual BanditCoT & Reasoning RL