跳到主内容
快讯直播
AI智模界
论文

刷视频教机器人:1200亿tokens误差幂律下降

机器人操作技能的学习长期依赖真机交互或遥操作数据,采集成本高、规模受限。一篇新论文提出并验证了另一条路径:让机器人通过观看人类视频来预训练动作能力。论文披露的预训练规模达到 1200 亿 tokens 人类动作数据,意味着视频数据已被用于大规模动作表征学习,而不再只是视觉层面的辅助信号。

更值得关注的信号是“误差按幂律下降”。在机器学习中,幂律下降通常意味着性能随数据量、模型规模或计算量的增加而可预测地改善,而非很快饱和。如果这一趋势在人类动作预训练中成立,视频就有望成为机器人策略学习的 scaling law 来源之一。对具身智能而言,这比单一任务上的性能提升更重要:它提供了一条可扩展的路线——用互联网规模的视频,弥补真机数据稀缺,降低对昂贵遥操作采集的依赖。

当然,视频预训练与真实机器人部署之间仍存在差距,包括视角差异、动作空间映射、物理交互反馈等。论文的具体方法、实验设置与任务范围,需要回到原文确认。但 1200 亿 tokens 的规模与幂律下降的趋势,已经传递出明确信号:机器人学习的数据来源可能不再局限于机器人自身,人类视频正在成为新的预训练燃料。对从业者来说,值得关注的是数据配方、动作表示与缩放规律如何结合,以及这种预训练能否稳定迁移到真实操作任务。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。