一句话定义:VLA(Vision-Language-Action Model)是一类把「看画面」和「听懂指令」合在一起、直接输出机器人动作的模型。它不回答文字,它动手。
它是怎么工作的
过去的机器人流水线很长:相机识别物体 → 建地图、算位姿 → 规划一条轨迹 → 控制器把轨迹变成电机指令。每一环都是单独写的程序,换个场景就得重调。
VLA 把这条链压成一个模型。输入是摄像头图像、一句自然语言指令、以及机器人自身的状态(关节角度、末端位置等),输出就是动作——通常是未来一小段时间的关节增量或末端位移序列。
打个比方:传统做法像给学徒写一本操作手册,先测距、再对齐、再拧螺丝。VLA 更像让学徒反复看别人干活的录像,看多了之后,听到「把桌上那个杯子拿过来」,手就自然伸过去了。它没有在内部显式地算几何距离,而是把「画面里有什么」「话里要做什么」「手该怎么动」这三件事在训练中关联了起来。
和相邻概念的区别
| 模型类型 | 输入 | 输出 | 典型用途 |
|---|---|---|---|
| 视觉语言模型(VLM) | 图像 + 文字 | 文字 | 看图问答、图像描述 |
| VLA | 图像 + 指令 + 机器人自身状态 | 动作序列 | 直接驱动机器人 |
关键差别在输出端。VLM 说错一句话,重说一遍就行;VLA 做错一个动作,可能撞坏东西、伤到人。所以动作模型对延迟、稳定性、安全边界的要求,比纯文本图像模型高一个量级。
为什么它被认为是具身智能的核心形态
因为它把大模型积累的常识和语义理解,接到了物理身体上。你说「把挡路的盒子挪开」,VLM 能指出哪个是盒子;VLA 则进一步伸手去挪。而且因为训练数据里见过大量不同物体和场景,它有机会处理训练时没见过的任务,这是靠规则编程很难做到的。
对从业者和普通人的意义
对从业者:机器人开发的重心从「写规则」转向「收数据 + 微调」,动作怎么表示(末端位姿还是关节角、一次预测多长的动作块)成了核心设计问题。评估标准也变了,不再只看语言能力,而是看真机任务成功率和面对新物体的表现。
对普通人:仓储分拣、家庭服务、产线上的柔性操作,会逐步从「专机专用」走向「一台能听懂人话的机器」。但别高估进度——动作数据比文字图像难采集得多,采一台真机数据往往要人在旁边操作几个小时。短期内更可能是限定场景加人工兜底,而不是全能管家。
具体产品的能力边界与开放程度,以各家官方页面为准。
