Compositional Diffusion with Guided Search for Long-Horizon Planning
本文介绍了带有引导搜索的组合扩散(Compositional Diffusion with Guided Search, CDGS),该方法将基于种群的搜索与似然过滤直接集成到扩散去噪过程中,以解决组合生成模型中的模式平均问题,从而实现在机器人操控、全景图像合成和视频生成等多样化领域中连贯的长时程规划。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人解开一个巨大的拼图,或者要求一台计算机绘制一幅宏大的壁画,甚至是在导演一部长达数小时的电影。问题在于,这些任务规模太大,无法一次性学会。这就像试图在一个晚上背完一整本百科全书;你的大脑(或计算机的大脑)根本无法承载这么多信息。因此,科学家们使用了一个聪明的技巧:他们将大任务分解成微小的、易于处理的块。他们教机器人如何拿起一个单独的积木,或者如何涂抹墙上的一个方格,或者如何拍摄一段五秒钟的剪辑。这些就是“局部”专家。
但棘手的地方在于:仅仅知道如何完美地完成每个小部分,并不意味着你能把它们拼接成一个完美的整体。如果你在不看包装盒上的图案的情况下尝试将两个拼图块粘在一起,你可能会强行让它们契合,虽然近看似乎还可以,但会让整个画面看起来扭曲且破碎。在人工智能领域,这被称为“模式平均”(mode averaging)。这是指计算机试图表现得过于稳妥,从而取了所有选项的平均值,导致最终方案变成了一个混乱、不可能实现的折中产物——比如一个试图同时抓取杯子和锤子的机械臂,或者一段视频中,猫在句子中间突然变成了狗。
这就是佐治亚理工学院研究人员的一篇新论文所针对的问题。他们正在从事生成式 AI 领域的研究,即开发能够创造新图像、视频和计划的计算机技术。具体来说,他们正在解决“长程规划”(long-horizon planning)带来的头痛问题——即如何将许多小步骤串联起来以实现一个大目标。他们注意到,旧的将这些小型 AI 模型缝合在一起的方法往往会导致那些混乱、不可能实现的折中方案。因此,他们发明了一种名为**组合扩散引导搜索(Compositional Diffusion with Guided Search, CDGS)**的新方法。你可以把它想象成在计算机尝试组装拼图时,给它一把手电筒和一张地图,让它能够向前窥视、检查碎片是否真的契合,并在坏主意毁掉整幅画之前将其丢弃。
问题所在:“平均”是敌人
要理解作者修复了什么,我们首先需要理解他们发现的乱象。想象一下你正在规划一次从纽约到洛杉矶的公路旅行。你有一个地图应用,它擅长规划短途驾驶,比如“纽约到费城”或“芝加哥到丹佛”。如果你只是要求应用计算所有可能停靠点的平均路线,你可能会得到一条这样的路径:先向芝加哥走了一半,然后突然跳到了丹佛,接着又回到了芝加哥。它是所有路径的“数学平均值”,但却是一次糟糕透顶、完全不可能实现的公路旅行。
在 AI 世界中,当计算机尝试结合许多不同的“局部”计划时,就会发生这种情况。局部计划通常是“多模态的”(multimodal),这是一个高级说法,意思是一个步骤可以有多种不同的有效方式。例如,为了移动一个方块,机器人可以推、拉或抬起它。如果计算机只是对这些选项取平均值,它可能会尝试同时做这三件事,结果导致机器人只会原地无意义地颤动。旧方法试图通过简单地对不同可能性进行评分平均来解决这个问题,但作者发现,这种方法产生的计划在纸面上看起来很平滑,但在现实中却在物理上不可能实现或在逻辑上是破碎的。
解决方案:迷雾中的引导搜索
作者提出了一个处理此问题的新方法,称之为组合扩散引导搜索(CDGS)。要理解它的工作原理,请想象你正身处一片黑暗、浓雾弥漫的森林中,试图寻找一片特定的空地。你有一个指南针(AI 模型)告诉你大致方向,但由于雾气太厚,你看不清前方的路。
旧方法就像是走一步,看一眼指南针,然后再走一步,希望自己能保持在轨道上。但由于雾气太厚,你可能会在意识到之前就漂移进了一片沼泽。
CDGS 方法则不同。它不是只走一条路径,而是派出了一支完整的探险队(一组候选计划)。在旅程的每一步,这些探险家都会做三件事:
- 他们互相交流(迭代重采样): 队伍前方的探险家会向后方的探险家低声传递信息,反之亦然。这有助于整个群体保持一致。如果前方的探险家意识到前方的路是死胡同,他们可以在整个群体迷失之前告诉后方的探险家转身。这确保了计划从头到尾保持连贯,而不是开头和结尾相互矛盾。
- 他们查看地图(剪枝): 团队有一条特殊规则:如果一条路径看起来会导致坠入悬崖(即不可能的过渡),他们会立即将其切断。他们利用 AI 对“好路径”的自身“记忆”来巧妙地识别这些死胡同,从而及早发现。他们不会等到旅程结束才意识到自己迷路了;他们在坏的分支生长时就将其剪掉。
- 他们选择最佳路径(选择): 在检查完路径后,他们只保留那些最好、最有希望的探险者,并让他们进入下一步。这就像是公路旅行中的“适者生存”。
通过这样做,CDGS 避开了“模式平均”的陷阱。它不再创建一个模糊、不可能实现的平均值,而是寻找一条从头到尾都切实可行的、连贯的特定路径。
研究发现:机器人、全景图与电影
作者在三个非常不同的领域测试了他们的新方法,结果非常令人期待。
1. 机器人游乐场
首先,他们将 CDGS 用于机器人。他们给机器人布置了任务,比如将立方体从一个位置移动到另一个位置,但带有一个转折:机器人必须使用一个钩子去拉动立方体,或者先移开其他物体。这些是“长程”任务,因为它们需要一系列复杂的步骤。
- 结果: 在这些测试中,CDDS 的表现与现有的最佳方法一样出色,在某些情况下甚至更优。它能够解决复杂的谜题,即使机器人被要求在没有被明确告知步骤的情况下,也要想出正确的移动顺序。论文指出,CDGS 可以处理这些任务而不需要大量的全新训练数据,这在收集机器人数据既慢又昂贵的背景下是一个巨大的胜利。
2. 全景艺术家
接下来,他们尝试使用 CDGS 来创建巨大的全景图像。想象一下你在拍摄一段山脉,但你一次只能拍到一个山峰的小照片。你必须将它们缝合在一起才能看到全景。
- 结果: 当他们使用 CDGS 缝合这些图像时,最终的全景图看起来天衣无缝。山脉完美衔接,天空也没有奇怪的瑕疵。他们将其与其他仅仅通过“平均”边缘的方法进行对比,CDGS 产生了更加自然、且在整个图像中风格保持一致的结果。
3. 电影导演
最后,他们在视频生成上测试了它。他们提取了短视频片段(约 50 帧),并尝试将它们缝合起来以制作长视频(长达 350 帧)。
- 结果: 这里的挑战在于保持角色的一致性。如果第一段视频中有一只熊猫在弹吉他,那么在第二段视频中它不应该变成一只熊。CDGS 成功地让主体在长视频中看起来始终如一,且动作流畅。虽然视频质量比短片段略低(作者指出这是长视频中常见的权衡),但它比那些让角色发生变形和变化的传统方法要一致得多。
总结
作者谨慎地表示,这并不是一个能瞬间解决所有问题的魔杖。他们指出,该方法依赖于一个明确的目标(例如“将立方体移动到绿色区域”),并且在“局部”专家(小型 AI 模型)已经能很好完成其特定工作时效果最佳。他们也承认,由于需要同时检查多条路径,该方法运行起来需要更多的计算能力。
然而,论文强烈表明,CDGS 是让 AI 在长期规划方面变得更聪明的强大新工具。通过将“搜索”过程直接嵌入到 AI 生成计划的方式中,它避免了困扰以往方法的混乱折中。无论是机器人手臂在思考如何整理凌乱的书桌,还是摄像机扫过广阔的景观,亦或是电影导演将长篇故事缝合在一起,CDGS 都提供了一种让“整体大于部分之和”的方法,确保最终结果不仅是一个数学上的平均值,而是一个连贯的、真实的现实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。