AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization
本文介绍了 AnyWorld,这是一个分解式的世界模型框架,它通过将动作、相机和具身因子解耦,从单个人类第一视角视频中合成多样化的、跨具身的机器人经验,从而实现可控的数据生成,并显著提升了在模拟及真实人形机器人上的操控策略性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机器人正在学习如何不仅仅是做直线运动;它们正在学习如何操纵周围的世界,比如拿起物体、打开门以及组装零件。为了学习这些技能,机器人需要经验。它必须看到成千上万个关于手如何伸手去拿杯子、抓取器如何挤压海绵以及工具如何在桌面上滑动的情景示例。长期以来,获取这种经验的唯一方法就是让机器人一遍又一遍地亲自执行任务。这既缓慢又昂贵,并且受限于实验室能负担得起多少台机器人,以及这些机器人能在损坏前运行多少小时。
一个来自意想不到渠道的极具前景的替代方案已经出现:人类视频。每天,人们都会录制自己烹饪、清洁和建造事物的视频。这些视频充满了丰富的物理交互过程,机器人可以从中学习。然而,存在一个主要问题。一段人类烹饪的视频展示了人类的手、人类的身体和人类的视角。机器人并不拥有人类的身体,也不从人类的头部观察世界。如果机器人试图直接模仿人类视频,它可能会失败,因为人类的手臂更长,机器人的摄像头位置不同,或者机器人的抓取器工作方式不同。科学家面临的挑战是,如何提取人类视频中发生的有用“故事”,并以一种对机器人有意义的方式将其重新讲述。
一个研究团队开发了一个名为 AnyWorld 的新系统来解决这个问题。该系统并没有尝试完全复制人类视频,而是将视频分解为三个独立的成分:正在执行的动作、摄像机的移动方式,以及正在进行工作的身体和场景。可以将动作想象成正在发生的事情的“剧本”,将摄像机运动想象成镜头的“导演指令”,将身体和场景想象成“演员”和“布景”。通过分离这些元素,研究人员可以提取单个人类执行任务的视频,并将这些成分重新组合,创造出一个全新的视频。在这个新视频中,“演员”是机器人,“布景”是机器人的环境,而“摄像机”是机器人的眼睛,但动作的“剧本”保持不变。
研究人员使用大量的包含人类与物体交互的人类视频来训练他们的系统。他们教会了模型理解任务的运动与执行该任务的具体身体之间的区别。一旦模型学会了这一点,他们就通过输入一段人类视频,并要求它生成一个由机器人执行相同任务的版本来进行测试。他们不需要任何显示人类和机器人并排执行同一任务的视频。该系统只需提取人类的动作和摄像机的路径,然后换入一个机器人身体和机器人场景。结果是一个看起来像是在执行任务的机器人视频,且具备该特定机器人的正确视角和物理约束。
团队测试了这种改变身体、摄像机角度和场景的能力。他们展示了系统可以提取一段人类视频,并生成一个由名为 RoboCasa GR1 的机器人执行该任务的版本,以及另一个由名为 IRON 的不同机器人执行该任务的版本。他们还展示了他们可以保持机器人和任务不变,但改变摄像机角度,从而创建一个来自不同视角的视图。至关重要的是,系统保留了交互的逻辑。如果原视频中的人类拿起一个杯子并将其移动到架子上,生成的机器人视频会显示机器人执行完全相同的动作序列,只是根据其自身的身体形状和摄像机位置进行了适配。
为了证明这些生成的视频确实有用,研究人员使用它们来训练真实的机器人。他们采用了一个标准的机器人学习系统,并使用 AnyWorld 创建的视频对其进行了额外训练。他们在机器人手臂的模拟环境中进行了测试,也在真实的类人机器人上进行了测试。在模拟中,机器人在拿起并放置物体方面的成功率在经过训练后显著提高。在真实机器人上,提升甚至更加剧烈。原本只能在 20% 的尝试中成功抓取香蕉的机器人,在接受了人类到机器人视频训练后,成功率跃升至 55%。这表明该系统不仅仅是在制作漂亮的图像;它正在创建有效的训练数据,帮助机器人更好地学习。
研究人员还调查了为什么这能奏效。他们想知道仅仅告诉机器人要采取什么动作是否足够,或者视觉场景是否也是必要的。他们进行了一项测试,即给机器人正确的动作指令,但保留原始、未经修改的机器人视频中的视觉训练数据。这种方法未能教会机器人如何遵循特定指令,例如选择左边的香蕉而不是右边的。然而,当他们使用完整的系统同时生成新的视觉场景和正确的动作时,机器人能够可靠地遵循指令。这证明了视觉重构是必不可少的。机器人需要从自己的视角观察世界,才能理解如何应用动作。
这项研究表明,这种将交互分解为独立因素的方法,使得单次人类经验可以被多次重复利用。一段曾经受限于人类身体和人类摄像机的人类视频,可以成为许多不同类型机器人、在许多不同环境下进行训练的数据源。研究人员指出,虽然该系统功能强大,但也有其局限性。它目前还无法捕捉触觉的感觉或挤压柔软物体所需的精确力量,因为这些都需要视频生成所无法提供的物理传感器。此外,该系统依赖于能够清晰追踪人类动作;如果视频过于晃动或人被物体遮挡,系统就会遇到困难。
尽管存在这些局限性,这项工作为机器人学习提供了一条新的路径。它表明,互联网上庞大的视频库——由于身体和视角的差异,此前一直难以被机器人利用——现在可以被挖掘。通过使用一个理解如何将动作与执行者分离的模型,科学家可以将人类的经验转化为机器人的经验,而无需为每种机器人记录每一个任务。这可以让机器人更快地学习复杂的技能,利用人类日常生活中丰富的丰富数据作为其自身能力的基石。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。