WorldDiT: A Unified Diffusion Architecture for World and Action Modeling
WorldDiT 引入了一种统一的扩散 Transformer 架构,能够同时生成连续动作并预测未来的视觉帧,在不依赖大型预训练视觉语言模型的情况下,在多个机器人操控基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人不再仅仅遵循死板的指令,而是会真正“梦见”接下来会发生什么的场景。这是机器人学习的前沿领域,一个试图教会机器如何在混乱的现实世界中移动的领域。长期以来,最大的突破来自于一个特定的配方:拿一个已经掌握了所有语言和图像知识的庞大、预训练好的“大脑”(就像一个既能看又能读的超级智能百科全书),然后把它连接到一个机器人的手臂上。这确实有效,但就像是试图通过先训练一只小狗成为教授来教它捡球一样;这种方式沉重、昂贵,而且很难判断机器人究竟是在学习任务,还是仅仅在抄袭教授的笔记。科学家们提出的重大问题是:我们能否构建一个更小、更轻量,并且能够同时学习移动和预测未来的机器人大脑,而不需要那个巨大的、预加载的百科全书?
欢迎来到 WorldDiT,由 Bagel Labs 的研究人员设计的一种新型机器人大脑。请不要把 WorldDiT 看作是一个正在抄写教科书的学生,而要把它看作是一个通过观看自己未来的电影来学习绘画的年轻艺术家。WorldDiT 并不依赖于一个巨大的、预训练好的“视觉-语言模型”(一种能够描述图像和文本的庞大 AI),它使用一个统一的引擎同时完成两件事。首先,它计算出机器人手臂的下一步动作。其次,它尝试预测几秒钟后摄像机将看到什么。这就像一位棋手,不仅在规划下一步棋,还在脑海中预演未来三步的棋局,以确保计划合理。
研究人员在名为 LIBERO 的模拟世界中训练了这个系统,在这些世界里,机器人必须执行诸如堆叠积木或移动物体之类的任务。他们发现,WorldDiT 的规模竟然非常小(不到 4 亿个参数,而其他顶尖方法使用的是数十亿个参数),却能以惊人的准确度预测未来的摄像机画面和机器人的动作。事实上,在测试中,该机器人在四种不同类型的挑战中取得了约 95% 的成功率。最令人兴奋的部分是:它在没有使用大多数成功机器人所依赖的那种沉重的、预训练好的“骨干网络”的情况下,就实现了这一点。它证明了你不需要一个巨大的、预加载的大脑也能成为一个优秀的机器人;你只需要一个能在移动时学会预见未来的大脑。
“做梦”的机器人
那么,WorldDiT 究竟是如何工作的呢?想象一下你正在学习如何玩杂耍。如今大多数机器人就像是那些背诵了一千个杂耍大师视频的学员,正试图完全模仿他们。WorldDiT 则不同。它就像是一个蒙着眼睛但拥有水晶球的杂耍学生。
秘诀在于:每当 World-DiT 规划一个动作时,它也会同时尝试“梦见”摄像机在未来会看到什么。它观察机器人的当前状态、收到的指令(例如“拿起红色的积木”)以及过去几秒钟的视频。然后,它同时向自己提出两个问题:
- “机器人下一步应该做什么?”
- “如果我这样做,下一刻画面会变成什么样?”
研究人员称之为扩散 Transformer (diffusion transformer)。如果这听起来像是科幻术语,请将其理解为一个“去噪”过程。想象一张被静电噪声覆盖的照片。World-DiT 从一个关于机器人下一步动作和未来画面的完全随机、充满噪声的猜测开始。然后,通过一步步地清理这些噪声,不断精炼其猜测,直到找到一条通往目标的清晰、平滑的路径。它对机器人的动作和未来的图像都进行同样的操作。
这种神奇之处在于,这两项任务是相辅相成的。通过尝试预测未来的图像,机器人被迫理解世界的物理规律。如果它计划推一下积木,但它的未来“梦境”显示积木悬浮在空中,它就知道自己的计划错了。它必须调整动作,直到“梦境”与现实相匹配。这创造了一个反馈循环,机器人通过尝试预测接下来会发生什么,从而学习世界的规则。
结果:小大脑,大成功
研究人员在四个不同的模拟套件(可以把它们想象成四种不同的障碍赛道:空间、物体、目标和长程)中测试了 WorldDiT。他们将其与 24 种著名的机器人学习方法进行了对比。
关键点在于:WorldDiT 非常微小。它拥有大约 3.99 亿个参数(即它大脑中的“神经元”)。许多表现优异的机器人模型使用 10 亿 甚至 100 亿 个参数。通常情况下,更大的大脑意味着更好的性能,但 WorldDT 打破了这个规则。
在这些模拟实验中,WorldDiT 在所有四条赛道上的平均成功率达到了 94.9%。
- 空间 (Spatial): 98.0% 成功率
- 物体 (Object): 97.0% 成功率
- 目标 (Goal): 92.8% 成功率
- 长程 (Long): 91.8% 成功率
当你将这些结果绘制在图表上时,WorldDiT 位于“帕累托前沿 (Pareto frontier)”上。用通俗的话说,这意味着它是该房间里效率最高的机器人。如果你想要一个像 WorldDiT 一样聪明但使用更小大脑的机器人,你是找不到的。如果你想要一个像 WorldDT 一样小但比它更聪明的机器人,你也找不到。每一个表现优于 94.9% 的机器人,其规模都明显更大、更重。
为什么这很重要
论文明确反对了“必须使用大规模预训练视觉-语言模型 (VLA) 才能获得良好机器人控制”的观点。一段时间以来,该领域一直认为:“我们需要一个巨大的大脑来理解世界。”而 WorldDiT 说:“不一定。”
研究人员展示了通过将动作生成(移动)与世界建模(预测未来)相结合,单一的统一架构可以非常有效地学习控制机器人。他们不仅仅是提出了这个建议,还在数千个模拟回合中进行了测量。机器人不仅仅是“运气好”,它持续地超越了规模大得多的模型。
然而,这里有一个前提条件。这些结果来自于模拟环境(机器人生活的计算机游戏)。论文指出,虽然表现强劲,但这只是未来研究的一个基准。我们尚不知道这种“做梦”的机器人在一个真实的、混乱的厨房里——面对真实的重力和真实的湿滑地板时——是否能完美运作。但模拟实验的结果是一个强烈的暗示:我们未来或许能够制造出更小、更便宜、更高效的机器人——这些机器人通过想象未来,而非仅仅通过记忆过去来进行学习。
归根结底,WorldDiT 表明,一个聪明机器人的秘诀不在于拥有海量的知识库,而在于拥有一个能够在脑海中演练未来,从而在当下做出更好决策的大脑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。