VLA (Vision-Language-Action) 模型把视觉-语言-动作统一为自回归生成。RT-2 将 7-DOF 末端执行器位姿 (3D 平移 + 3D 旋转 + 夹爪) 逐维归一化后离散化为 0–256 的 bin token 并入词表, 与图文 token 一起生成动作序列, 量化方式:
abin=⌊amax−amina−amin×256⌋,abin∈{0,…,255}
OpenVLA 在预训练 VLM 上微调, 同样输出离散动作 token。另一路线 Diffusion Policy 用条件扩散模型直接生成连续动作轨迹, 训练目标为:
L=Et,ϵ[∥ϵθ(at,t,c)−ϵ∥2]
以观测条件
c 去噪动作轨迹。