具身智能视觉-语言-动作一体化基础大模型 (Embodied Vision-Language-Action Models, VLA / RT-2, OpenVLA, Octo 架构体系) 是将多模态大模型从“被动语义图文理解”升级为“具备物理实体感知、空间推理与闭环运动控制”的核心前沿通用架构;核心机制:1) 动作空间离散化与 Token 化 (Action Tokenization): 将机械臂或人形机器人的连续 7 自由度运动动作 (7-DoF:
[x,y,z,roll,pitch,yaw,gripper]) 离散量化为 256 个等距分箱,作为特殊动作 Token 直接拓展接入大语言模型的输出词表(与标准文本 Token 共享自回归自注意力计算);2) 跨模态统一监督学习:将海量互联网多模态预训练权重(如 VLM/SigLIP + Llama)与机器人遥操作轨迹数据联合微调,使模型能够将高层抽象人类指令(如“把那罐可乐拿给穿红衣服的人”)直接端到端映射输出精确的电机轨迹 Token;3) 扩散策略与动作分块 (Diffusion Policy & Action Chunking / ACT): 预测未来时间窗口的动作轨迹块以保证控制平滑性。