Scalable Behavior Cloning with Open Data, Training, and Evaluation
本文介绍了 ABC,这是一个用于机器人操控行为克隆的全开源技术栈,其特点是拥有迄今为止最大的遥操作数据集(ABC-130K)、一套包含协同训练配方的可复现硬件与仿真流水线,以及对扩散 Transformer(Diffusion Transformer)和视觉-语言-动作(Vision-Language-Action)架构在复杂灵巧任务上的全面评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,如果你想教一个机器人完成复杂的家务,比如折叠纸箱、分类乐高积木,甚至从紧凑的钱包里取出信用卡。在过去,教机器人就像试图通过展示一张模糊的照片来教孩子一项任务,并寄希望于他们能自己悟出来。这种方式既昂贵又缓慢,而且机器人经常会直接放弃。
这篇论文介绍了一个名为 ABC 的大规模开源“入门套件”,旨在教机器人如何通过观察人类来学习。你可以把它想象成机器人训练领域的“维基百科”或“YouTube”,但它提供的不仅仅是视频,还包括了实际的食谱、厨具和测试厨房,让任何人都可以亲自动手尝试。
以下是他们使用简单类比对 “ABC 技术栈”进行的拆解:
1. 图书馆:ABC-130K(“食谱”)
想象一个图书馆,它不仅有一两份食谱,而是拥有 3,500 小时 的人类动作视频素材,涵盖了 130,000 种不同的任务。
- 内容包含: 人类使用双臂机器人完成各种工作,从简单的“拿起并放下”到极其复杂的灵巧任务,比如折叠纸飞机或用钥匙开锁。
- 重要意义: 在此之前,大多数机器人数据要么规模太小、收集成本太高,要么被锁在大型企业的秘密库房里。这是同类中规模最大的开放式集合,其构建所用的机器人成本仅约 8,000 美元(对于机器人而言非常便宜),这使得普通研究人员也能参与其中,而不仅仅局限于科技巨头。
2. 大脑:ABC-Models(“学生”)
作者不仅提供了数据,还构建了两种不同类型的“学生”机器人,并测试了哪种学习风格效果更好。
- “扩散 Transformer”(DiT): 可以把这想象成一个非常擅长观察图片并逐步推测下一步动作的学生,就像是在填空填字游戏一样。
- “视觉-语言-动作”(VLA): 可以把这想象成一个能够同时阅读指令、观察图像并理解上下文的学生。
- 实验过程: 他们测试了这些学生在面对不同“老师”(不同的摄像头视角和语言输入)时的表现。他们发现,在获得更多计算能力时,VLA 学生学得更快;而在计算资源较少时,DiT 学生则更具效率。他们发布了这些“毕业后的大脑”(模型权重),供任何人使用。
3. 模拟器:ABC-Sim(“飞行模拟器”)
通常情况下,要测试一个机器人是否聪明,你必须让它在现实世界中尝试。如果失败了,它可能会损坏物品,或者需要花费数小时来重置环境。
- 解决方案: 作者为机器人构建了一个虚拟现实“飞行模拟器”。他们创建了 4、00 里的数据,人类在电脑游戏中通过遥操作控制机器人。
- 神奇之处: 他们证明了如果机器人在这个电子游戏中表现出色,那么它在现实世界中也会表现出色。这就像是在说:“如果你能在模拟器里驾驶这架飞机,那么你大概已经准备好飞向真实的蓝天了。”这让研究人员可以在不需要实体机器人或承担损坏风险的情况下测试他们的想法。
4. 路测:ABC-Eval(“驾照考试”)
他们不只是口头上说“有效”;他们实际上让机器人通过了一系列任务的考验。
- 结果: 机器人成功学会了折叠盒子、分类物品以及执行像将钥匙插入锁孔这样精细的任务。
- “DAgger”技巧: 对于最难的任务(折叠盒子),机器人一直失败。作者使用了一种名为 DAgger 的技术。想象一位驾驶教练,他让学生开车,但每当学生快要撞车时,教练就会立刻接管方向盘进行修正,然后让学生再次尝试。通过收集这些“修正时刻”,机器人学会了如何从错误中恢复,并最终掌握了折叠盒子的技巧。
宏观愿景
作者们想要表达的是:“我们构建了整个机器人学习的学校系统。我们有教科书(数据)、老师(模型)、模拟考试(模拟器)以及最终测试(现实世界结果)。我们将这一切全部免费开放。”
他们的目标是让机器人学习不再是一个只有富有的公司才能加入的秘密俱乐部,而是变成一个全民参与的社区努力。他们并不承诺明天就能让机器人帮你洗衣服,但他们正在打下基础,让研究人员终于能够开始着手实现这一目标。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。