想象一下,你正试图绘制一幅长达100英尺的巨型森林壁画。你有一位非常有才华的艺术家(AI模型),但他们一次只能高质量地绘制一个5英尺见方的正方形区域。如果你要求他们一次性画完整个作品,他们会感到混乱,或者质量大幅下降。于是,你决定让他们分别画出九个独立的5英尺正方形,然后将它们粘贴在一起。
问题:“拼凑”缺陷 (The "Patchwork" Glitch)
旧的方法(称为“组合生成”,Compositional Generation)是这样告诉艺术家的:“确保你的正方形边缘与邻居的正方形边缘相匹配。”
- 结果: 边缘完美契合。左侧正方形上的树木与右侧正方形上的树木平滑连接。
- 缺陷: 尽管边缘匹配,但整个画面看起来可能很奇怪。也许第一个正方形是阳光明媚的森林,中间是雪山,而结尾变成了沙漠。这些艺术家并没有就“大局观”进行沟通。他们只是确保彼此的相邻部分看起来没问题。最终的壁画缺乏逻辑性的故事或一致的风格。
解决方案:CoFi (粗到细组合扩散,Coarse-to-Fine)
论文介绍了一种名为 CoFi 的新方法。你可以把它想象成一个有两个步骤的“项目经理”流程。
第一步:“草图阶段”(粗糙阶段/Coarse Stage)
与其仅仅告诉艺术家去匹配边缘,CoFi 首先要求他们退后一步,共同商定一张整个 100 英尺壁画的粗略、模糊的草图。
- 想象一下,所有的艺术家都眯起眼睛,达成共识:“好吧,这是一片森林,太阳在左边,小路从左下向右上延伸。”
- 他们创建了一个“脚手架”(骨架)。这确保了每一个正方形都清楚自己在宏观蓝图中处于什么位置。
- 权衡: 这个粗略的草图可能有点模糊,缺乏细节(比如树皮的纹理),但其结构是完美的。
第二步:“细节处理”(精细阶段/Fine Stage)
现在,既然艺术家们已经有了完美的骨架,CoFi 说:“好了,暂时忘掉那张粗略的草图。让我们把噪声重新加回去,再次进行细节绘画,但这一次,我们将利用你们原有的天赋来填充树木和叶子。”
- 他们利用那个完美的骨架,加入一些“静电噪声”(noise),然后让艺术家们在上面重新绘画。
- 因为有了骨架的存在,艺术家们可以专注于让树木看起来真实、让水面看起来闪亮,而不用担心偏离航线。
- 最终的壁画既拥有粗略草图的逻辑结构,又具备原始艺术家的高水平细节质量。
为什么这种方法更好?
论文声称这种方法是一个“双赢”,原因有二:
- 视觉效果更好: 最终生成的图像(或机器人规划、或视频)从头到尾都具有逻辑性。机器人不会走圈;视频中的角色不会突然变成另一个人;全景照片也不会从白天切换到黑夜。
- 速度更快: 旧方法试图通过让艺术家在每一次落笔时都反复进行沟通来解决“大局观”问题,这非常耗时。CoFi 则先完成一次“大局观”规划,然后再填充细节。论文指出,这使得过程快了 2 到 8 倍(减少了大量的计算量),同时获得了更好的结果。
他们在哪里测试了这个方法?
作者在三个特定领域测试了这种“项目经理”式的方法:
- 机器人规划 (Robot Planning): 通过拼接短距离移动来引导机器人在巨大的迷宫中穿行。CoFi 帮助机器人找到通往目标的路径而不会迷路。
- 全景图像 (Panoramic Images): 将 9 张小图拼接成一张巨大的宽幅照片。CoFi 确保天空和树木在整个宽度上保持一致。
- 长视频 (Long Videos): 通过拼接短片段来创作一段长视频。CoFi 让主角在整个视频过程中保持形象一致,防止其发生“变形”。
简而言之,CoFi 通过强制要求 AI 先达成大局共识,然后再放手进行细节创作,从而避免了 AI 在细节中迷失方向,同时还节省了大量的计算资源。
技术摘要:用于长程规划的由粗到精组合扩散模型 (CoFi)
问题陈述
扩散模型擅长生成结构化数据,但通常是在短程尺度上进行训练的。许多现实世界的任务,例如长距离机器人导航、全景图像合成或长视频生成,其输出需求超出了这些模型的训练规模。直接为这种长程输出训练模型通常是不切实际的,因为由于数据稀缺以及建模成本随序列长度或空间范围快速增长所导致的限制。
组合式生成(Compositional generation)提供了一种解决方案,即通过将预训练的短程先验中的重叠局部计划组装成单个长程输出。然而,标准的组合方法主要强制执行局部一致性(相邻局部计划在重叠区域的一致性),而没有明确指定全局结构。因此,局部兼容的计划可能无法形成合理的全局路径、任务序列或时间演变。现有方法试图通过重复传播局部一致性信号或添加推理时优化(例如迭代搜索或基于种群的剪枝)来提高全局连贯性。虽然有效,但随着局部计划的数量或其维度增加,这些过程会变得计算成本极高。
方法论:由粗到精的组合扩散 (Co-Fi)
作者提出了 CoFi,一种将全局结构形成与局部细节细化解耦的推理时采样器。与依赖于重复消息传递或昂贵内循环优化的方法不同,CoFi 在两个不同的阶段运行:
1. 粗糙全局骨架构建 (Coarse Global Scaffold Construction)
第一阶段旨在围绕共享的粗糙结构对齐局部去噪估计,以建立全局连贯性。
- 骨架对齐 (Scaffold Alignment): 对于每个去噪步骤 t,该方法为每个局部计划计算一个“Tweedie 估计值” X^0∣ti。为了强制执行全局对齐,它求解一个简化的优化目标,平衡局部保真度与共享的全局组件。这产生了一个闭式解,其中每个局部估计值都会向共享的骨架均值 Xˉ0∣t 收缩:
Xˉ0∣ti=(1−λt)Xˉ0∣t+λtX^0∣ti
这里,λt 是一个取决于调度表的系数,用于控制权衡。在扩散过程早期,λt 较小,迫使局部计划强烈地向全局骨架对齐。随着 t 减小,λt 增大,允许局部细节显现。
- 引导更新 (Guided Update): 反向扩散步骤使用这种对齐后的估计值进行更新,使其偏向于全局连贯但局部粗糙的骨架:
Xt−1i=DDIMθ(Xˉ0∣ti,t)+σt∇r^t(Xti,Xti+1)
第一项强制执行全局对齐,而第二项(局部引导)则确保相邻片段之间的边界一致性。
2. 结构保持细化 (Structure-Preserving Refinement)
第二阶段旨在恢复在粗糙阶段被抑制的精细局部细节,同时保留已建立的全局结构。
- 再加噪 (Re-noising): 粗糙全局计划 Y0c 使用共享噪声实现被向前扩散到中间噪声水平 t∗。这一点至关重要;对局部计划应用独立的噪声会破坏第一阶段实现的对齐。
Yt∗r=αˉt∗Y0c+1−αˉt∗ϵ
- 细化 (Refinement): 从 t∗ 开始,采样器使用相同的预训练局部先验和局部引导执行第二次反向扩散过程。这一阶段恢复了高频局部细节和纹理,同时全局骨架锚定了整体结构。
核心贡献
- 解耦设计: CoFi 将全局结构形成与局部细节细化分离,避免了使用昂贵的迭代消息传递或基于搜索的优化等以往组合方法的开销。
- 共享骨架机制: 通过引入一个将局部估计投影到共享骨架上的粗糙对齐阶段,该方法确保了长程连贯性,而无需设计复杂的奖励函数(这些函数在处理高维空间时难以设计)。
- 结构保持细化: 在再加噪步骤中使用共享噪声实现,确保了细化后的局部计划仍然是同一个全局对象的兼容视图,防止了长程生成中常见的“漂移”现象。
- 高效性: 与依赖于内迭代或种群搜索的基线相比,该方法所需的去噪器评估次数 (NFE) 显著减少。
实验结果
作者在三个领域评估了 CoFi:长程机器人规划、全景图像生成和长视频生成。
- 机器人规划 (OGBelt): 在具有挑战性的 "Giant" 和 "Scene-Play" 任务中,CoFi 实现了 96% (PointMaze-Giant) 和 63% (Scene-Play) 的成功率,优于之前的最先进方法 CDGS (分别为 82% 和 51%)。研究发现,骨架阶段对于解决迷宫式轨迹中的长程不一致性至关重要。
- 全景图像生成: 与 Multi-Diffusion、SyncDiffusion 和 CDGS 等基线相比,CoFi 在所有指标(Intra-LPIPS、Intra-Style loss 和 CLIP score)上都取得了最佳得分。它生成的全景图具有更稳定的全局风格,且在补丁边界处产生的突变更少。
- 长视频生成: 在从 50 帧先验生成 273 帧视频的过程中,CoFi 提高了主体一致性(94.11 对比 CDGS 的 91.67)和审美质量,接近原生短程生成的质量。它有效地防止了长时程下的主体漂移。
- 计算效率: 与 CDGS 相比,CoFi 在保持或提高样本质量的同时,实现了 2–8 倍 的函数评估次数 (NFE) 减少。这归功于用单次由粗到精的传递取代了迭代搜索。
重要性与主张
论文声称 CoFi 提供了一种简单且有效的推理时采样器,它在不增加现有方法计算开销的情况下,同时满足了局部一致性和全局连贯性。通过将全局骨架构建与局部细化分离,CoFi 解决了“仅靠局部一致性无法保证合理的全局结构”这一局限性。作者将其定位为将短程先验扩展到机器人、视觉和视频生成等长程任务中的一种实用的替代方案,提供了性能与计算成本之间良好的权衡。
作者也谦虚地指出了局限性:输出质量受限于预训练局部先验的表达能力,且超参数(骨架调度表 λt 和细化深度 t∗)需要针对特定领域进行选择。此外,目前的共识机制对所有局部计划应用统一权重,如果各片段在结构重要性上存在差异,这可能不是最优的。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。