← 最新论文
💻 computer science

GlanceWAM: Sparse Test-Time Imagination for World-Action Models

GlanceWAM 通过在单个视频 DiT 中将异步后台视觉想象与实时控制解耦,解决了机器人学习中的延迟与成功率权衡问题,在执行速度比同步基准快 24 倍的同时,在 RoboCasa 和 LIBERO 基准测试上实现了最先进的性能。

原作者: Linhan Wang, Zijian An, Mingyuan Zhang, Chen Dai, Yi Xu, Can Cui, Zichong Yang, Yinlin Chen, Lifeng Zhou, Chang-Tien Lu

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Linhan Wang, Zijian An, Mingyuan Zhang, Chen Dai, Yi Xu, Can Cui, Zichong Yang, Yinlin Chen, Lifeng Zhou, Chang-Tien Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现实世界中移动的机器人需要的不仅仅是一份指令清单;它们需要理解自己的动作将如何改变周围的场景。如果机器人伸手去拿一个杯子,它必须预见到杯子会移动,桌子可能会晃动,以及通往架子的路径会发生变化。多年来,科学家们一直试图通过教机器如何想象未来,来赋予机器这种预见能力。他们使用强大的计算机模型来生成视频,本质上是让机器人能够在实际移动之前,“梦见”接下来会发生什么。人们希望通过看到未来的预览,机器人可以更好地规划并避免错误。然而,一个主要问题阻碍了这一构想的发展:生成这些视频预览需要耗费太长时间。当机器人试图接住一个掉落的物体或倾倒液体时,它需要在毫秒内做出决策。如果计算机花费数秒钟来构思未来的场景,机器人就已经太迟无法行动了。这给工程师们带来了一个艰难的选择:要么让机器人具备预见能力但反应过慢,要么让它能瞬间做出反应,但却剥夺了它预见未来的能力,使其只能盲目地进行猜测。

一组研究人员发现了一种打破这一僵局的方法。他们开发了一个名为 GlanceWAM 的新系统,该系统允许机器人在保持实时移动速度的同时,保留对未来的视觉。其核心洞察在于,机器人并不需要一个持续的、每秒都在变化的未来视频流来完成工作。相反,它只需要在几秒钟后的路径上有一个清晰的图像。研究人员设计了一个系统,让“做梦”的部分和“行动”的部分以不同的速度和不同的路径运行。当机器人的控制系统每 48 毫秒进行一次快速决策以保持动作流畅时,一个独立的、较慢的过程会在后台运行。这个后台过程每三秒钟进行一次安静的“瞥视”,想象一帧未来世界将会呈现出的样子。这个想象出的帧并不是一段完整的视频,而是一个关于目的地的紧凑且隐藏的表示。

这种方法的精妙之处在于这两个部分是如何进行沟通的。机器人的控制系统永远不会等待后台“梦想家”完成任务。相反,控制系统只需抓取最新的想象出的目的地,并利用它来引导接下来的几次动作。因为机器人处理的是这个隐藏且简化的未来版本,而不是完整的视频,所以它可以几乎瞬间处理这些信息。研究人员在二十四项复杂的厨房任务(如打开抽屉、转动旋钮以及在台面之间移动物体)上测试了这个系统。在这些测试中,新系统的成功率为 72.2%。这比之前试图同时生成视频和动作的方法(成功率为 67.1%)有了显著提升,并且远优于那些完全放弃想象未来的系统(成功率仅为 64.4%)。该系统在另一套标准测试套件上也表现得异常出色,达到了 99.0% 的成功率。

使这一结果尤为引人注目的是,该系统在实现如此高水平成功率的同时,并未牺牲速度。研究人员测量了机器人决定下一步动作所需的时间,新系统每次决策仅需 48 毫秒。这比之前尝试同时进行思考与行动的最佳方法快了 24 倍。该系统之所以运作良好,是因为它经过了训练,能够处理其对未来的“瞥视”在被使用时可能已经略微过时这一事实。正如驾驶员使用一分钟前绘制的地图一样,机器人学会了根据自上次瞥见未来以来经过的时间来调整其动作。研究人员证实,机器人确实是在利用这些未来的瞥视来进行决策;当他们人为地移除未来信息时,机器人的性能显著下降,这证明了这种预见性不仅仅是一个被动的特征,而是其行动的关键引导。

这项工作表明,机器人智能的瓶颈不在于需要更多的计算能力,而在于如何使用这些力量。通过将缓慢、深思熟虑的想象未来过程与快速、紧急的身体控制过程分离,研究人员创造了一个既敏捷又睿智的系统。机器人不需要看到未来的每一帧画面才能知道该去哪里;它只需要一个清晰、及时的目的地快照。这种方法为构建能够在复杂多变的场景中导航,并具备与人类相同的流畅度与预见性,同时又能反应迅速以跟上现实世界步伐的机器人,提供了一条切实可行的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →