返回 多模态 思维导图
中文·English
👁️ 多模态ID: vla-embodied

VLA 具身大模型 (跨模块)

VLA Models (cross-module)
🎯核心定义
VLA (Vision-Language-Action) 模型把视觉-语言-动作统一为自回归生成。RT-2 将 7-DOF 末端执行器位姿 (3D 平移 + 3D 旋转 + 夹爪) 逐维归一化后离散化为 0–256 的 bin token 并入词表, 与图文 token 一起生成动作序列, 量化方式: abin=aaminamaxamin×256,abin{0,,255}a_{\text{bin}} = \left\lfloor \frac{a - a_{\min}}{a_{\max} - a_{\min}} \times 256 \right\rfloor, \quad a_{\text{bin}} \in \{0, \dots, 255\} OpenVLA 在预训练 VLM 上微调, 同样输出离散动作 token。另一路线 Diffusion Policy 用条件扩散模型直接生成连续动作轨迹, 训练目标为: L=Et,ϵ[ϵθ(at,t,c)ϵ2]\mathcal{L} = \mathbb{E}_{t, \epsilon} \left[ \lVert \epsilon_\theta(a_t, t, c) - \epsilon \rVert^2 \right] 以观测条件 cc 去噪动作轨迹。
💡使用场景
机器人操作、具身大模型面试; 常问"连续动作怎么表示""离散化 vs 扩散"。
解决的核心痛点
机器人策略数据稀缺, 直接复用 VLM 的视觉-语言先验; 动作表示上, 离散化 (0–256 bin) 让动作融入现成自回归架构, Diffusion Policy 用迭代去噪避免离散化的分辨率损失、对多峰动作分布更鲁棒。详见 RL 模块: 世界模型/RL 闭环见 RL 模块 (指南 model-based-rl-and-planning)。
🎯5 个高频面试考点 (Exam Points)
1
RT-2 如何把 7-DOF 连续动作离散化为 0–256 的 bin token? 写出量化公式?
2
动作离散化与 Diffusion Policy 生成动作的本质区别? 各解决什么问题?
3
OpenVLA 与 RT-2 的异同 (底座、训练数据、动作输出方式)?
4
VLA 为什么能复用 VLM 先验? 动作 token 与文本 token 如何统一训练?
5
写出 Diffusion Policy 的扩散训练目标, 与 DDPM 图像去噪的关系?
📖 关联深度指南:📄 model-based-rl-and-planning
更新于 2026-08-12
🎯
检验攻克程度:针对「VLA 具身大模型 (跨模块)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点ColPali Late-Interaction 视觉检索

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用