一句话定义:人类视频预训练(Human Video Pretraining)是指让机器人在没有动作标签的前提下,先看海量人类第一视角或第三视角视频,学会"人在什么场景下会怎么动",把这套视觉—动作常识作为初始化,再迁移到真实机器人上。
为什么"刷视频"能教会机器人
视频里没有关节角度、没有力矩、没有遥控指令,看起来信息不全。但它藏着三样东西:目标(要拿杯子)、物体(杯子在哪、什么姿态)、动作轨迹(手从哪伸过去、怎么绕开障碍)。预训练通常做两件事:预测未来画面,以及从画面反推手和身体的动作表示。
打个比方:孩子学打乒乓球,教练手把手纠正的次数其实不多,更多是看球怎么飞、拍子怎么挥。看得够多,身体就有了预感。
规模是这条路的命门。这类预训练的表现会随数据量增长按幂律(power law)下降误差——有工作把人类动作数据堆到千亿 token 量级(例如约 1200 亿),误差随规模呈幂律下降。这说明它主要靠"看得够多",而不是靠精巧调参,和语言模型的经验一致。
和相邻概念的分工
| 环节 | 数据来源 | 成本 | 提供什么 | 短板 |
|---|---|---|---|---|
| 人类视频预训练 | 海量人类视频 | 低(量大) | 通用视觉—动作表征 | 无动作标签、有身体差异 |
| 遥操作示教 | 人遥控真机 | 高(慢) | 精确动作标签 | 场景窄、样本少 |
| VLA 微调(Vision-Language-Action) | 少量示教+语言指令 | 中 | 对齐到自家机器人 | 依赖预训练质量 |
一句话概括:视频预训练负责"看得懂",遥操作负责"标得准",VLA 微调负责"接得上"——把通用表征对齐到你家机器人的动作空间和任务上。
差距与意义
视频里没有力反馈和触觉,人也不会录下自己打翻杯子重试三十次的片段;再加上手型、视角、臂长差异,模型容易"知道该拿杯子,却捏不住"。所以它解决的是感知与意图,不直接解决精细控制。
对从业者:别一上来就堆遥操作数据,先想清楚表征从哪来、数据配比怎么定、手部或末端执行器的动作表示怎么选。对普通人:未来教机器人做家务、分拣、装配,成本可能从"手把手示范几百次"降到"看视频+少量示教"。具体数据规模与模型指标以各家官方页面为准。
