Type: concept
Confidence: 0.93
Created: 2026-04-15
Updated: 2026-04-15
Tags: 机器人学大模型VLA具身智能视觉语言模型

视觉-语言-动作模型

概述

视觉-语言-动作模型(VLA)是将预训练视觉-语言模型(VLM)直接微调为机器人控制策略的范式:通过将机器人动作离散化为文本 token,使模型能利用互联网规模的视觉-语言知识指导物理操作,实现"理解世界"与"操控世界"的端到端统一。由 RT-2(Google DeepMind, 2023)正式提出。

关键内容

核心思想:动作即语言(Action as Tokens)

传统方法:VLM "看"场景 → 分离的控制模块执行动作

VLA 方法:将动作离散化为 token(如 "1 128 91 241 5 101 127 0")
         → 映射到语言模型词表中的 token
         → VLM 自回归生成"动作文本"
         → 与生成普通文字的计算完全相同

关键洞察:动作与语言共享同一 Transformer 架构,无需修改模型结构,无需添加解码头——只是将动作编码为文字。

RT-2:VLA 的参考实现(2023)

维度 细节
骨干模型 PaLI-X(55B)或 PaLM-E(12B)
动作离散化 每维度 256 个 bin → 整数序列
训练策略 协同微调:50% 机器人数据 + 50% 网络视觉语言数据
机器人数据 ~13 万条真实演示轨迹(RT-1 数据集)

协同微调(Co-fine-tuning)防止灾难性遗忘:同时使用机器人数据和网络视觉语言数据,确保模型在学习动作的同时保留语义理解能力。

涌现能力:互联网知识→物理操作

VLA 最引人注目的发现:在网络视觉语言数据上预训练的知识可以直接迁移到物理操作:

能力类型 示例
符号理解 "把物体放到数字 3 上"(训练数据中从未出现的符号)
语义推理 "选出不是食物的物体"、"把最大的物体移到右边"
语言泛化 理解训练中未见过的新指令和新概念组合

这验证了"具身认知"假说:理解一个概念的语义(知道苹果是什么)与知道如何物理操作它(抓苹果),可能共享同一种能力。

链式推理(Chain-of-Thought)

RT-2 的 CoT 变体:先输出自然语言计划,再输出动作 token:

输入: "拿起可以用来敲钉子的东西"
输出: "Plan: I need to pick up a rock because it can be used as a hammer"
     → [动作 token 序列]

提供可解释性,并支持多步语义推理任务。

历史位置

VLA 是端到端机器人学习演进的第三阶段:

GPS/Visuomotor (2016)  →  RT-1 (2022)         →  RT-2/VLA (2023)
专用小网络 (92K参数)     Transformer, 3500万参数    基础模型, 55B参数
单任务, 仿真数据         700+任务, 真实数据         互联网知识迁移

VLA 后续影响:OpenVLA、π0(Physical Intelligence)、Open X-Embodiment 等跨机器人平台的通用机器人大脑。

与 sim-to-real 的关系

VLA 代表了解决"机器人数据稀缺"问题的另一条路径: - 域随机化路线:仿真中生成大量数据 - VLA 路线:用互联网数据补充机器人数据,减少对机器人专属数据的依赖

来源

相关