CAB: Accelerating Flow and Diffusion Sampling via Rectification and Corrected Adams-Bashforth
本文介绍了 CAB(校正的亚当斯 - 巴什福斯),这是一种无需训练的采样器,它通过将采样动力学转换为整流坐标系并应用带有校正项的多步预测器,从而加速流模型和扩散模型,进而在无需额外函数评估的情况下显著提升了低步数情形下的质量与效率权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图画出一只完美的猫,但你被蒙上了眼睛。你有一位魔法向导(即 AI 模型),它在你耳边低语指令:“手往左移一点”、“往上走一点”、“停”。
在 AI 图像生成领域,这种“低语”被称为采样。AI 从一个充满静态噪声(如同电视雪花)的画布开始,通过遵循一条数学路径,将其缓慢转化为清晰的图像。
问题:缓慢的行走
通常,为了获得完美的图像,AI 必须迈出许多微小的步伐(通常 50 步或更多),才能从噪声过渡到最终图像。每一步都需要 AI“思考”(运行复杂的计算)。如果你只让它走几步(比如 6 到 10 步),生成的图像往往模糊、扭曲,或充满奇怪的伪影,例如长着三只耳朵的猫,或者融化了的脸。
现有的加速方法类似于两种不同类型的捷径:
- “训练”捷径:你教会 AI 一种新的、更快的行走方式。这很有效,但学习过程耗时漫长,且并非适用于所有 AI。
- “智能行者”捷径:你给 AI 一张更聪明的地图,使其能迈出更大的步伐而不跌倒。但如果地图过于复杂,AI 会感到困惑,若步数不足,生成的图像就会变得糟糕。
解决方案:CAB(“修正的亚当斯 - 巴什福斯”方法)
本文的作者提出了一种名为CAB的新方法。你可以将 CAB 想象为一个带有“修正”功能的GPS,它适用于任何现有的 AI,而无需重新训练。
以下是 CAB 的工作原理,使用一个简单的类比:
1. 拉直道路(整流)
想象 AI 需要走过的路径是一条蜿蜒曲折的山路。在弯曲的道路上迈大步是危险的;你可能会冲过弯道而跌落。
- CAB 的作用:它神奇地将道路拉直。它将蜿蜒的小径转化为笔直的高速公路。
- 为何有帮助:在笔直的路上,你可以迈出自信的大步,而无需担心错过转弯。这使数学计算对 AI 来说变得容易得多。
2. “向后看”步骤(亚当斯 - 巴什福斯)
既然道路已经变直,CAB 便使用一种称为亚当斯 - 巴什福斯的技术。
- 类比:想象你正走在一条笔直的小径上。与其只盯着你此刻所在的位置,不如看看你 2 或 3 步之前的位置。你利用这段历史来预测下一步该往哪里走。
- 好处:这使得 AI 能够仅用几步就能非常准确地预测未来的路径。
3. “安全网”(修正)
这是秘诀所在。有时,即使在笔直的路上,地形也会发生意外变化(也许是风吹,也许是地面移动)。简单的“向后看”猜测可能仍然略有偏差。
- CAB 的作用:它添加了一个微小的修正项。它会检查:“我的猜测与上一步的实际情况匹配吗?”如果 AI 的预测略有偏差,CAB 会根据猜测与实际移动之间的差异,施加一个微小的即时修正。
- 神奇之处:它这样做无需要求 AI 进行任何额外的工作。它利用了 AI 在前几步中已经计算出的信息。这就像副驾驶在司机无需停车的情况下,低声提示一个微小的方向盘调整。
结果:更清晰的图像,更快的速度
该论文在各种 AI 模型(包括图像和视频模型)上测试了这种新方法,发现:
- 低步数(6–20 步):这是 CAB 大放异彩的地方。当其他方法被迫快速移动时会产生模糊或充满噪声的图像,而 CAB 则能生成更清晰、更锐利、细节更丰富的图像。
- 示例:在论文的测试中,当被要求在仅 6 步内画出一辆公交车或一名网球运动员时,其他方法会让公交车看起来像一团模糊的色块,或者让运动员的脸部扭曲。而 CAB 保持了细节的锐利和结构的正确。
- 高步数:当给予更多步数时,CAB 的表现与现有最佳方法一样出色,证明它不会破坏任何效果。
- 无额外成本:它不需要重新训练 AI,也不会减慢处理速度。相反,由于你能用更少的步数获得更好的结果,它实际上提高了效率。
总结
CAB 就像是给现有的 AI 提供了一条更直的道路和一个聪明的副驾驶,后者能对方向盘进行微小且免费的调整。这使得 AI 能够在通常所需时间的一小部分内生成高质量的图像和视频,而无需学习任何新内容。它通过让旅程变得更聪明(而不仅仅是更快),解决了“匆忙时图像模糊”的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。