← 最新论文
🤖 machine learning

Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning

本文提出了由粗到精的组合扩散模型(Coarse-to-Fine Compositional Diffusion, CoFi),这是一种在推理阶段使用的采样器,它通过首先建立一个用于对齐局部规划的全局结构支架,进而对其进行细化,从而增强了长时程规划能力,并以比现有方法显著更少的计算评估次数,实现了卓越的全局连贯性与局部质量。

原作者: Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图绘制一幅长达100英尺的巨型森林壁画。你有一位非常有才华的艺术家(AI模型),但他们一次只能高质量地绘制一个5英尺见方的正方形区域。如果你要求他们一次性画完整个作品,他们会感到混乱,或者质量大幅下降。于是,你决定让他们分别画出九个独立的5英尺正方形,然后将它们粘贴在一起。

问题:“拼凑”缺陷 (The "Patchwork" Glitch)
旧的方法(称为“组合生成”,Compositional Generation)是这样告诉艺术家的:“确保你的正方形边缘与邻居的正方形边缘相匹配。”

  • 结果: 边缘完美契合。左侧正方形上的树木与右侧正方形上的树木平滑连接。
  • 缺陷: 尽管边缘匹配,但整个画面看起来可能很奇怪。也许第一个正方形是阳光明媚的森林,中间是雪山,而结尾变成了沙漠。这些艺术家并没有就“大局观”进行沟通。他们只是确保彼此的相邻部分看起来没问题。最终的壁画缺乏逻辑性的故事或一致的风格。

解决方案:CoFi (粗到细组合扩散,Coarse-to-Fine)
论文介绍了一种名为 CoFi 的新方法。你可以把它想象成一个有两个步骤的“项目经理”流程。

第一步:“草图阶段”(粗糙阶段/Coarse Stage)

与其仅仅告诉艺术家去匹配边缘,CoFi 首先要求他们退后一步,共同商定一张整个 100 英尺壁画的粗略、模糊的草图

  • 想象一下,所有的艺术家都眯起眼睛,达成共识:“好吧,这是一片森林,太阳在左边,小路从左下向右上延伸。”
  • 他们创建了一个“脚手架”(骨架)。这确保了每一个正方形都清楚自己在宏观蓝图中处于什么位置。
  • 权衡: 这个粗略的草图可能有点模糊,缺乏细节(比如树皮的纹理),但其结构是完美的。

第二步:“细节处理”(精细阶段/Fine Stage)

现在,既然艺术家们已经有了完美的骨架,CoFi 说:“好了,暂时忘掉那张粗略的草图。让我们把噪声重新加回去,再次进行细节绘画,但这一次,我们将利用你们原有的天赋来填充树木和叶子。”

  • 他们利用那个完美的骨架,加入一些“静电噪声”(noise),然后让艺术家们在上面重新绘画。
  • 因为有了骨架的存在,艺术家们可以专注于让树木看起来真实、让水面看起来闪亮,而不用担心偏离航线。
  • 最终的壁画既拥有粗略草图的逻辑结构,又具备原始艺术家的高水平细节质量

为什么这种方法更好?

论文声称这种方法是一个“双赢”,原因有二:

  1. 视觉效果更好: 最终生成的图像(或机器人规划、或视频)从头到尾都具有逻辑性。机器人不会走圈;视频中的角色不会突然变成另一个人;全景照片也不会从白天切换到黑夜。
  2. 速度更快: 旧方法试图通过让艺术家在每一次落笔时都反复进行沟通来解决“大局观”问题,这非常耗时。CoFi 则先完成一次“大局观”规划,然后再填充细节。论文指出,这使得过程快了 2 到 8 倍(减少了大量的计算量),同时获得了更好的结果。

他们在哪里测试了这个方法?

作者在三个特定领域测试了这种“项目经理”式的方法:

  • 机器人规划 (Robot Planning): 通过拼接短距离移动来引导机器人在巨大的迷宫中穿行。CoFi 帮助机器人找到通往目标的路径而不会迷路。
  • 全景图像 (Panoramic Images): 将 9 张小图拼接成一张巨大的宽幅照片。CoFi 确保天空和树木在整个宽度上保持一致。
  • 长视频 (Long Videos): 通过拼接短片段来创作一段长视频。CoFi 让主角在整个视频过程中保持形象一致,防止其发生“变形”。

简而言之,CoFi 通过强制要求 AI 先达成大局共识,然后再放手进行细节创作,从而避免了 AI 在细节中迷失方向,同时还节省了大量的计算资源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →