返回 RS 算法研究员 思维导图
中文·English
🎓 RS 算法研究员ID: rs-embodied-vla-foundation-models

具身智能 VLA 视觉语言动作联合建模

Embodied VLA Vision-Language-Action Models
🎯核心定义
具身智能视觉-语言-动作一体化基础大模型 (Embodied Vision-Language-Action Models, VLA / RT-2, OpenVLA, Octo 架构体系) 是将多模态大模型从“被动语义图文理解”升级为“具备物理实体感知、空间推理与闭环运动控制”的核心前沿通用架构;核心机制:1) 动作空间离散化与 Token 化 (Action Tokenization): 将机械臂或人形机器人的连续 7 自由度运动动作 (7-DoF: [x,y,z,roll,pitch,yaw,gripper][x, y, z, \text{roll}, \text{pitch}, \text{yaw}, \text{gripper}]) 离散量化为 256 个等距分箱,作为特殊动作 Token 直接拓展接入大语言模型的输出词表(与标准文本 Token 共享自回归自注意力计算);2) 跨模态统一监督学习:将海量互联网多模态预训练权重(如 VLM/SigLIP + Llama)与机器人遥操作轨迹数据联合微调,使模型能够将高层抽象人类指令(如“把那罐可乐拿给穿红衣服的人”)直接端到端映射输出精确的电机轨迹 Token;3) 扩散策略与动作分块 (Diffusion Policy & Action Chunking / ACT): 预测未来时间窗口的动作轨迹块以保证控制平滑性。
💡使用场景
人形机器人通用运动控制、机械臂自主抓取与装配、具身智能实验室前沿研究。
解决的核心痛点
传统机器人控制策略缺乏对开放世界语义常识与未见物体的泛化能力;VLA 实现了互联网海量通用语义常识向物理机械动作的端到端直接迁移。
🎯5 个高频面试考点 (Exam Points)
1
详细剖析 RT-2 如何将 7 自由度机械臂动作空间离散化为 256 个分箱并作为特殊 Token 融入大模型输出词表的数学机制?
2
动作分块与时序平滑 (Action Chunking & Temporal Ensembling / ACT): 为什么一次性预测未来 KK 步动作轨迹并做滑动平均加权比单步逐帧自回归更平稳?
3
扩散策略 (Diffusion Policy for Robotic Manipulation): 如何利用条件扩散模型对多模态动作分布(解决多峰行为歧义,如绕过障碍物的左右双向选择)进行建模?
4
Sim-to-Real 跨越真实世界差距:如何通过域随机化 (Domain Randomization) 与触觉/本体感知反馈闭环提升端到端操控成功率?
5
具身智能世界模型与策略学习的融合:如何利用 Sora 式视频预测模型作为内部物理模拟器生成合成遥操作数据供 VLA 训练?
更新于 2026-08-14
🎯
检验攻克程度:针对「具身智能 VLA 视觉语言动作联合建模」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Sora 视频生成世界模型与时空 Patch

🔗 更多 RS 算法研究员 知识点卡片

DPO 闭式最优策略与隐式奖励推导PPO 剪切代理目标函数下界证明RoPE 旋转位置编码复数内积证明扩散模型 SDE 连续随机微分推导