DriftWorld: Fast World Modeling through Drifting
DriftWorld 引入了一种新颖的动作条件世界模型,该模型利用漂移生成模型通过单次前向传播生成未来帧,在保持机器人规划和策略评估方面达到最先进性能的同时,实现了比基于扩散的基准模型快 17 倍的推理速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人完成一项棘手的任务,比如堆叠积木或打开抽屉。你并不想让机器人在现实世界中撞坏东西成千上万次;那样既慢又危险,而且成本很高。相反,你希望机器人拥有一个“白日梦”。在机器人领域,这种白日梦被称为世界模型(world model)。它是一个数字水晶球,让机器人能够想象:“如果我这样移动手臂,世界接下来会变成什么样?”如果机器人在实际行动之前就能想象出动作的结果,它就能挑选出最好的动作并避免错误。
长期以来,这些数字水晶球就像是缓慢且深思熟虑的艺术家。它们非常擅长描绘出极其细腻的未来画面,但完成每一笔都需要很长时间。为了生成一秒钟的未来视频,它们可能需要进行数十个微小的步骤,反复对图像进行细化。这是一个问题,因为机器人需要在眨眼之间做出决策。如果机器人仅仅为了想象该做什么就花了三秒钟,那么它已经来不及去接住掉落的杯子了。核心问题在于:我们能否构建一个既能像现有模型一样出色地想象未来,又能快到跟得上机器人心跳节奏的世界模型?
这正是 DriftWorld 引入的一个巧妙解决方案,它改变了游戏规则。DriftWorld 并没有使用以往模型所依赖的(即被称为“扩散”的技术)那种缓慢、循序渐进的绘画过程,而是使用了一种被称为“漂移(drifting)”的模型。你可以这样理解:如果说扩散模型像是一个雕塑家通过一步步凿掉石块来显现雕像,那么漂移模型就像是一名冲浪者。它在训练期间学习水流的“流向”或“漂移”。一旦它知道了水的流动方向,它就可以从起点顺滑地漂移到终点,完成一次流畅的移动。
作者构建 DriftWorld 是为了使其成为一个“动作条件化(action-conditioned)”的世界模型,这意味着它将机器人的计划动作作为指令,并立即生成这些动作所导致的未来视频帧。他们在多个现实世界和模拟机器人任务中对其进行了测试,包括在桌面上移动物体(如“Push-T”任务)以及复杂的厨房家务。结果令人瞩目:DriftWorld 可以在单次前向传递中生成未来的视频帧,其速度超过了 30 帧每秒。也就是说,平均而言,它比现有的最佳基于扩散的世界模型快了 17 倍。
然而,速度并不是唯一的衡量标准;“梦境”也必须足够准确。研究人员发现,DriftWorld 不仅运行迅速,而且看得清晰。在测试中,它生成的视频与那些更慢的模型一样清晰、逼真,在标准质量评分上与之持平甚至超越了后者。由于它如此之快,机器人现在可以在以往只能想象几个场景的时间内,想象出数百个不同的未来场景。当研究人员让机器人使用 DriftWorld 在行动前进行“思考”时,机器人在任务中的表现变得更好了。例如,在 Push-T 任务中,当使用 DriftWorld 来规划动作时,机器人的成功率从交并比(IoU)得分 0.635 跃升至 0.781。
该论文还表明,DriftWorld 是测试机器人策略的绝佳工具。想象一下,你有十种不同的机器人策略,并想在不进行实际实验室测试的情况下知道哪一种最好。DriftWorld 可以作为一个模拟器,运行每种策略的结果并对其进行排名。研究人员发现,DriftWorld 对这些策略给出的评分与现实世界的结果高度相关,在 Robomimic Lift 任务上的皮尔逊相关系数高达 0.9916。这意味着这个数字白日梦与现实几乎完全一致。
不过,作者也谨慎地指出,这并不是解决一切问题的万能药。该模型依赖于预训练的“特征提取器”(具体为 DINOv2/v3)来保持图像锐利,尤其是在复杂的场景中。此外,它在训练期间需要更多的计算内存,因为它需要同时生成许多“负面”示例(错误的猜测)来学习正确的漂移方向。虽然论文证明了“漂移”是机器人世界建模的一个强大基础,但也暗示未来的工作需要解决这些内存限制问题,以使模型能够处理更长且更连贯的内容。
简而言之,DriftWorld 表明我们不必在“缓慢但完美的想象”与“快速但模糊的想象”之间做选择。通过学习“漂移”而非“去噪”,机器人终于可以拥有在现实世界中进行规划和行动所需的快速、高质量的白日梦了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。