一句话定义:空间具身智能(Spatial Embodied Intelligence)指智能体(agent)借助身体与传感器,在真实三维空间中理解自己在哪、哪里能走、东西能不能够到,并据此决定下一步动作的能力。
它到底在理解什么
打个比方:关灯后你在自家客厅走动,不会撞到沙发——不是因为你看见了,而是身体长期与这个空间互动,攒下了尺度感和位置感。传统视觉模型更像在看照片:它能说出“图里有一把椅子”,但不知道椅子离你一米出头、能不能绕过去、伸脚会不会绊倒。空间具身智能要补的就是这一层,通常包含三件事:
- 自我定位:我在哪、朝哪边、姿态如何;
- 几何与占据:哪块区域是空的、哪里是障碍、门有多宽;
- 可供性(affordance):这个东西我能不能抓、推、坐上去。
只有前两项,模型是“会描述空间”;接上第三项和动作闭环,才算“会使用空间”。动作带来的后果又会反过来校正空间表征,这个循环是它和纯感知模型的根本差别。
和相邻概念的边界
| 概念 | 核心问题 | 典型输出 |
|---|---|---|
| 视觉语言模型(VLM) | 这是什么、发生了什么 | 文字、标签、回答 |
| 世界模型(AI 词典:World Model">World Model) | 如果这样做,接下来会怎样 | 预测的未来状态或画面 |
| 空间具身智能 | 我在哪、能否过去、怎么动 | 空间表征 + 动作序列 |
VLM 说的“左边”“上面”,通常是以图像为参照的语义关系,不是以身体为原点的度量。世界模型关心的是预测,可以完全没有身体——纯视频预测模型也能算世界模型。空间具身智能则要求表征与动作绑定,并以自我为中心(egocentric)计量距离、高度和可通行性。
为什么成了多模态的新断层
上一轮多模态竞赛拼的是“看懂”:识别、描述、问答。当这些能力逐渐普及,差别就落到“能不能在物理世界里可靠地做事”。机器人、辅助驾驶、AR 眼镜面对的是同一类问题:把三维空间理解成可操作的结构,而不是一堆语义标签。难处在于数据——互联网上有海量图文,却没有等量的“动作—后果”数据,只能靠仿真、真机采集与遥操作慢慢补。这让它比纯视觉语言路线更难,也更难被快速追平。
对从业者:做多模态的,可以问自己一句——我的表征里有没有以自我为中心的度量、可通行性和可供性?做产品的,别把“能描述场景”当成“能操作场景”。对普通人:更早能感知到的,大概是家用机器人、AR 导航、辅助驾驶在“绕开、伸手、通过”这类动作上的进步,而不是聊天更顺畅。具体产品能力以官方页面为准。
