Embodied Vision-Language-Action (VLA) Foundation Models (RT-2, OpenVLA, Octo) transform multimodal foundation models from passive image-text understanding into closed-loop physical perception, spatial reasoning, and continuous robotic motor actuation; the 3 core principles encompass: 1) Action Tokenization: quantizing continuous 7-DoF end-effector trajectory controls (
[x,y,z,roll,pitch,yaw,gripper]) into 256 discrete bins, embedding them directly into the language vocabulary as action tokens co-trained within autoregressive self-attention; 2) Unified Cross-Modal Pre-training: co-fine-tuning large VLM backbones (SigLIP + Llama) on multimodal web datasets combined with robotic teleoperation demonstrations, enabling models to translate high-level natural language intent directly into low-level physical joint trajectories; 3) Action Chunking & Diffusion Policies (ACT): predicting contiguous action trajectory blocks to guarantee smooth physical execution.