视觉-语言-动作模型
概述
视觉-语言-动作模型(VLA)是将预训练视觉-语言模型(VLM)直接微调为机器人控制策略的范式:通过将机器人动作离散化为文本 token,使模型能利用互联网规模的视觉-语言知识指导物理操作,实现"理解世界"与"操控世界"的端到端统一。由 RT-2(Google DeepMind, 2023)正式提出。
关键内容
核心思想:动作即语言(Action as Tokens)
传统方法:VLM "看"场景 → 分离的控制模块执行动作
VLA 方法:将动作离散化为 token(如 "1 128 91 241 5 101 127 0")
→ 映射到语言模型词表中的 token
→ VLM 自回归生成"动作文本"
→ 与生成普通文字的计算完全相同
关键洞察:动作与语言共享同一 Transformer 架构,无需修改模型结构,无需添加解码头——只是将动作编码为文字。
RT-2:VLA 的参考实现(2023)
| 维度 | 细节 |
|---|---|
| 骨干模型 | PaLI-X(55B)或 PaLM-E(12B) |
| 动作离散化 | 每维度 256 个 bin → 整数序列 |
| 训练策略 | 协同微调:50% 机器人数据 + 50% 网络视觉语言数据 |
| 机器人数据 | ~13 万条真实演示轨迹(RT-1 数据集) |
协同微调(Co-fine-tuning)防止灾难性遗忘:同时使用机器人数据和网络视觉语言数据,确保模型在学习动作的同时保留语义理解能力。
涌现能力:互联网知识→物理操作
VLA 最引人注目的发现:在网络视觉语言数据上预训练的知识可以直接迁移到物理操作:
| 能力类型 | 示例 |
|---|---|
| 符号理解 | "把物体放到数字 3 上"(训练数据中从未出现的符号) |
| 语义推理 | "选出不是食物的物体"、"把最大的物体移到右边" |
| 语言泛化 | 理解训练中未见过的新指令和新概念组合 |
这验证了"具身认知"假说:理解一个概念的语义(知道苹果是什么)与知道如何物理操作它(抓苹果),可能共享同一种能力。
链式推理(Chain-of-Thought)
RT-2 的 CoT 变体:先输出自然语言计划,再输出动作 token:
输入: "拿起可以用来敲钉子的东西"
输出: "Plan: I need to pick up a rock because it can be used as a hammer"
→ [动作 token 序列]
提供可解释性,并支持多步语义推理任务。
历史位置
VLA 是端到端机器人学习演进的第三阶段:
GPS/Visuomotor (2016) → RT-1 (2022) → RT-2/VLA (2023)
专用小网络 (92K参数) Transformer, 3500万参数 基础模型, 55B参数
单任务, 仿真数据 700+任务, 真实数据 互联网知识迁移
VLA 后续影响:OpenVLA、π0(Physical Intelligence)、Open X-Embodiment 等跨机器人平台的通用机器人大脑。
与 sim-to-real 的关系
VLA 代表了解决"机器人数据稀缺"问题的另一条路径: - 域随机化路线:仿真中生成大量数据 - VLA 路线:用互联网数据补充机器人数据,减少对机器人专属数据的依赖
来源
- raw/books/机器人学/16-brohan-rt2-vision-language-action.md
相关
- 端到端视觉运动学习 — VLA 的前驱范式(Levine 2016)
- 域随机化 — 解决机器人数据稀缺的另一路径
- Sergey-Levine — RT-2 核心贡献者之一