← 最新论文
🤖 machine learning

Plan First, Diffuse Later: Extrinsic Graph Guidance for Long-Horizon Diffusion Planning

本文介绍了 XDiffuser,这是一种新颖的方法,它通过利用外在基于图的搜索来生成轻量级规划以指导去噪过程,从而在无需内在搜索的计算开销的情况下,提升长视野扩散规划的全局连贯性以及在复杂任务上的性能。

原作者: Yaniv Hassidof, Adir Morgan, Yilun Du, Kiril Solovey

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaniv Hassidof, Adir Morgan, Yilun Du, Kiril Solovey

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人穿过一个巨大而复杂的迷宫。你手中只有一份视频库,记录了机器人从迷宫的一个角落摇摇晃晃地走到附近另一个角落的短途片段。你从未向机器人展示过如何一次性穿越整个迷宫。

这正是该论文要解决的问题:当你只有关于短途、局部移动的数据时,如何让机器人规划一次漫长而复杂的旅程?

旧方法:“边猜边试”(扩散模型)

研究人员使用了一种流行的 AI 工具,称为扩散模型。可以将这个模型想象成一位才华横溢的艺术家,擅长在两点之间绘制平滑、逼真的线条。如果你让它绘制从 A 点到 B 点的路径(且它曾见过类似的路径),它能完成得非常好。

然而,当你要求它通过拼接许多小段来绘制穿越巨大迷宫的路径时,它开始感到困惑。它可能为第一段画出了完美的曲线,为第二段也画出了完美的曲线,但这两条曲线实际上并没有正确连接。这就像一支艺术家团队在没有互相沟通的情况下共同绘制一幅壁画;局部细节看起来不错,但整体画面却支离破碎。

为了解决这个问题,以往的方法试图让 AI 在绘制过程中“更努力地思考”。它们让 AI 暂停,查看所有可能的下一步,并在生成图像的同时挑选最佳选项。论文认为,这就像要求一位画家每隔一秒就停下来查阅地图、检查十条不同的路线,然后继续作画。这种方法极其缓慢,且计算成本高昂。

新方法:“先规划,后绘制”(XDiffuser)

作者 Yaniv Hassidof 及其团队提出了一种更明智的分工方式。他们将这种方法称为XDiffuser

他们将工作分为两个截然不同的角色:

1. 导航员(图搜索)
首先,他们利用现有的短视频片段,构建了一个简单、轻量级的迷宫“骨架地图”。这张地图不显示平滑的曲线,只显示哪些区域与哪些区域相连。

  • 类比:想象一位徒步者看着一张地形图。他们尚未开始走完全程,只是从起点到终点画一条直线,并在沿途标记几个关键的“ waypoints”(如一棵特定的树、一块岩石或一座桥)。
  • 行动:机器人使用经典且快速的计算机算法(如 Dijkstra 算法)来找出这些 waypoints 的最佳序列。这就是外在搜索——它发生在庞大的 AI 模型之外

2. 艺术家(扩散模型)
一旦导航员获得了 waypoints 列表,它就会将此列表交给扩散模型。

  • 类比:现在,艺术家不必猜测下一步该去哪里。他们得到了一份检查清单:“从起点画一条平滑路径到树 A,然后从树 A 到岩石 B,再从岩石 B 到终点。”
  • 行动:AI 模型只需专注于使这些点之间的路径看起来平滑、逼真且符合物理规律。它不必浪费精力去猜测整体大局,因为导航员已经完成了这部分工作。

为何这是颠覆性的变革

论文声称,这种方法在以下三个方面表现更佳:

  • 速度更快:庞大的 AI 模型不再被复杂的搜索任务拖慢。它只需做自己擅长的事:绘制平滑的线条。“思考”工作则由简单、快速的图算法完成。
  • 能处理劣质数据:即使训练视频杂乱无章,或者机器人移动笨拙,导航员仍然能在迷宫中找到一条合乎逻辑的路径。随后,AI 只需“润色”这条路径。在他们的测试中,当数据质量较差时,他们的方法成功率高达98.5%,而旧方法的成功率仅为27%
  • 灵活性强(“即插即用”特性):由于“导航员”和“艺术家”是分离的,你可以为不同的任务更换导航员,而无需重新训练艺术家。
    • 多智能体协调:如果你有 4 个机器人,只需告诉导航员为所有 4 个机器人规划路径,使它们互不碰撞。艺术家仍然只需绘制平滑的线条。
    • 检查规划:如果一架无人机需要访问桥梁上的 64 个不同检查点,导航员会计算出访问这些点的最优顺序(类似于旅行商问题)。随后,艺术家绘制飞行路径。

核心结论

论文认为,对于漫长而复杂的任务,你不应该强迫单个 AI 模型包揽一切(既规划又绘制)。相反,应使用一个简单、快速的规划器来构思大局(waypoints),然后让强大的 AI 模型专注于细节(平滑的移动)。

通过将“规划”与“绘制”分离,他们创造了一个更快、更可靠且能够解决复杂难题(如协调多个机器人或检查大型结构)的系统,而这些问题正是以往方法难以应对的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →