🎯Core Definition
Embodied AI couples RL/planning with visual world models for robot control: V-JEPA predicts visual features in latent space (a visual world model), while Diffusion Policy directly predicts multimodal continuous action distributions — Gaussian policies cannot express multimodal actions, but diffusion policies can.
💡Use Cases
continuous-action control (manipulation, navigation), cross-task generalization, sample-efficient learning; interviews often enter via 'RL meets vision models'.
⚡Key Problems Solved
multimodal action modeling and real-interaction sample efficiency. See the Multimodal module: full content on V-JEPA and Diffusion Policy in the Multimodal module's cards (guide world-models-jepa).