Cross-Embodiment Transfer via Behavior-Aligned Representations
本文提出在视觉-语言-动作模型中使用行为对齐表示(特别是末端执行器轨迹),以统一多样化的跨具身数据并显著提升机器人的迁移性能,在经过仿真预训练后,实现了真实世界任务完成率 28% 的提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图教一个机器人做家务。在机器学习领域,有一个流行的观点:如果你向模型输入来自各处的海量数据,它会比只喂给它单一、特定来源的数据变得更聪明。这和人类通过环游世界学习多种语言,从而比那些只生活在一个小镇上的人更能适应新环境的道理是一样的。对于机器人来说,这意味着我们希望在从各种不同类型的机器人收集到的数据上训练它们——有的手臂长,有的手臂短,有的抓取器看起来像爪子,有的则像钳子。这被称为“跨具身”(cross-embodiment)学习。其目标是创建一个“通用”的机器人大脑,使其能够从许多不同机器人的经验库中学习,并将这些知识应用到一个它从未见过的全新机器人身上。然而,这里有一个大问题:安装在高处机器人上的摄像头从高角度观察世界,而矮个子机器人则从地面观察。它们的“手”移动方式不同,它们的动作指令所使用的“语言”也不同。尝试混合这些混乱、不匹配的数据集,就像是在试图通过同时展示汽车、卡车和自行车的视频来教学生开车,却不解释它们之间的区别一样。这会令人感到困惑,而且机器人往往会陷入停滞。
这篇题为《通过行为对齐表示实现跨具身迁移》(Cross-Embodiment Transfer via Behavior-Aligned Representations)的论文通过提出一个聪明的疑问解决了这种困惑:与其试图强迫机器人看起来或移动得完全一样,我们能否教会它们一种通用的“行为语言”?来自斯坦福大学和丰田研究院(Toyota Research Institute)的研究团队提出,我们可以通过关注动作的“故事”而非具体的机械细节,来弥合不同机器人之间的差距。他们建议使用“行为对齐表示”——这基本上是动作的简化摘要,比如对动作的文本描述(如“向左下方移动”)、围绕被抓取物体画出的一个框,或者一条描绘机器人手部在空中移动路径的线。
研究人员使用他们构建的一个名为 RoboCasa-X 的新模拟基准测试来测试这个想法。他们在一个包含三种不同源机器人海量数据的集合上训练了他们的机器人大脑(具体来说是一种被称为视觉-语言-动作模型的模型)。然后,他们尝试将这些知识迁移到四种不在训练数据中的不同目标机器人身上。他们对比了仅使用原始数据进行训练与加入这些额外的“行为摘要”进行训练的效果。
结果非常具有启发性。研究发现,添加这些行为摘要显著帮助了机器人将技能迁移到新的躯体上。在他们测试的不同类型的摘要中,“末端执行器轨迹”(end-effector traces)——即机器人的手在摄像头视图中所绘制的二维路径——是最强大的工具。当机器人在训练中使用这些轨迹时,它们在适应新硬件方面表现得更好。事实上,当机器人将预训练于模拟数据的策略应用于真实世界的机器人进行测试时,使用这些表示法使任务完成进度提升了 28%。
有趣的是,论文还发现,你并不一定需要机器人在实际执行任务时去“思考”这些轨迹。模型在训练过程中通过同时预测这些轨迹和动作学得最好,但在实际工作中,仅仅直接预测动作的效果也同样出色。这表明,这些轨迹在训练期间帮助机器人理解任务的底层逻辑,起到了类似于随后可以拆除的“辅助轮”的作用。此外,团队还展示了只要存在行为摘要,这些表示法甚至可以帮助机器人从不包含动作指令的数据(无动作数据)中学习。
作者谨慎地指出,虽然他们的方法在特定的模拟和现实世界测试中表现良好,但它依赖于机器人在任务和摄像头设置方面具有一定程度的相似性。他们并没有证明这适用于每一种可能的机器人差异,但他们的实验强烈表明,赋予机器人一种共享的“行为词汇表”是让它们变得更具适应性的一个充满前景的方法。通过专注于动作的“什么”和“如何”,而不是特定的“谁”(机器人型号),他们找到了让庞大且混乱的机器人数据真正发挥作用,从而构建出更聪明、更灵活的机器的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。