VLA (Vision-Language-Action) models unify vision, language, and action in one autoregressive generator. RT-2 discretizes each dimension of the 7-DOF end-effector pose (3D translation + 3D rotation + gripper) into 0–256 bin tokens appended to the vocabulary, generating action sequences jointly with image-text tokens; the quantization is:
abin=⌊amax−amina−amin×256⌋,abin∈{0,…,255}
OpenVLA fine-tunes a pretrained VLM to output discrete action tokens similarly. The alternative Diffusion Policy route uses a conditional diffusion model to generate continuous action trajectories directly, with training objective:
L=Et,ϵ[∥ϵθ(at,t,c)−ϵ∥2]
denoising action trajectories conditioned on observations
c.