一句话定义:遥操作数据采集(Teleoperation Data Collection)是人戴着动捕手套、外骨骼或 VR 设备实时操控机器人,同时把"看到什么、做了什么"完整录下来,攒成可训练的动作数据。
打个比方
教小孩包饺子,给他看一百个视频大概还是包不好;握住他的手带捏一遍褶才行。遥操作就是"握住机器人的手"——人动,机器人跟着动,全程录像。
流程大致是:操作员穿戴设备,系统把人的关节角和手部姿态映射成机器人的控制指令(这一步叫重定向,retargeting);机器人头部相机、腕部相机、关节编码器、力矩传感器同步打时间戳录制;一条完整的"拿起杯子放进架子"叫一个 episode(回合);录完还要做时间对齐、滤波、切分、标注成败,才进训练库。
钱花在哪
这份数据是一帧一帧雇人演出来的:
- 硬件:机器人本体、遥操作主手、动捕设备、相机阵列;
- 人力:操作员按接近 1:1 的工时投入,效率往往还低于人手本身;
- 场地:物体要摆、要复位、要随机化,布置场景的时间经常比采集还长;
- 返工:机器摔了、东西掉了,这一段基本作废。
成本大体随数据量线性上涨,这是它和互联网文本最本质的差别。
质量指标
不是录得多就行。通常盯这几项:有效 episode 占比、动作平滑度与延迟、相机与关节角的时间同步精度、任务与场景多样性、语言标注一致性("把杯子放左边"每次都得对应同一种动作)、跨场景可复现性。
与相邻概念的区别
| 数据来源 | 动作标签 | 规模 | 主要问题 |
|---|---|---|---|
| 遥操作采集 | 精确,含力/触觉 | 受人力限制 | 贵、慢 |
| 仿真合成 | 精确 | 近乎无限 | 仿真到现实的落差 |
| 人类第一视角视频 | 基本没有 | 极大 | 只有"看",没有"做" |
| 机器人自主探索 | 精确 | 增长慢 | 样本效率低、有风险 |
为什么被当成物理世界 Scaling Law 的燃料
语言模型的燃料是互联网上人类已经写好的文本,机器人没有这种现成语料,必须有人替它把动作演出来。遥操作是目前少有的能同时拿到三样东西的路径:多模态观测、精确动作指令、任务语义标签——正好是模仿学习(Imitation Learning)和视觉-语言-动作模型(Vision-Language-Action,VLA)最想吃的口粮。
它的天花板也很清楚:采集速度受限于人的速度,操作员的熟练度就是数据质量的上限。所以主流思路是压低单条数据的成本——更轻便的外骨骼与手套、众包采集、让采集本身滚成数据飞轮。具体硬件规格与价格各家差异很大,以官方页面为准。
对你的意义
做机器人的,卡脖子的常常不是模型结构,而是数据工程:采集流程、质检规则、版本管理。不做机器人的,可以留意一个新工种正在成形——机器人数据采集员,工作内容接近动作替身加质检员。
