ChebBooster: A Training-Free Approach for Efficient Diffusion Transformer Inference via Chebyshev-Inspired Extrapolation
该论文介绍了 ChebBooster,这是一个通过重心公式实现数值稳定的切比雪夫多项式外推,从而显著加速 Diffusion Transformer 推理的免训练框架,在保持多种模型高视觉质量的同时,实现了高达 3.68 倍的延迟加速和 5.12 倍的 FLOPs 降低。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,一种特定类型的计算机程序最近成为了从零开始创建图像的金标准。这些被称为扩散模型(diffusion models)的程序,其工作原理是从充满随机静态噪声的屏幕开始,通过逐步清理噪声,直到一张清晰的图像显现出来。为了让这一过程更快、更强大,研究人员开始使用一种名为 Transformer 的强大架构风格,它非常擅长理解数据中的长程连接。然而,这种力量伴随着沉重的代价:为了生成单张高质量图像,计算机必须执行海量的计算,通常需要连续运行整个复杂的模型数十次。这使得图像生成变得缓慢且耗能,为那些希望快速使用这些工具或在标准硬件上使用的人们制造了瓶颈。
核心挑战在于过程的重复性。随着图像从噪声演变为清晰,计算机在某一时刻进行的内部计算往往与稍后时刻进行的计算非常相似。多年来,科学家们一直试图通过记住并重用这些先前的计算来加速进程,希望能跳过繁重的体力活。然而,这种方法一直是一场赌博。简单地重用旧数据往往会导致图像模糊或失真,因为细节会随着时间的推移而偏离真相太远。其他尝试基于数学曲线预测下一步的方法则遭遇了另一个问题:它们变得不稳定,导致预测的图像产生剧烈的波动或振荡,就像在风中摇晃的桥梁一样。结果就是,节省时间意味着牺牲艺术质量之间的权衡。
一组研究人员现在推出了一种名为 ChebBooster 的新方法,旨在不要求模型重新训练或重新学习的情况下打破这种权衡。该系统并非通过简单的曲线来猜测下一步,也不是盲目地复制旧数据,而是使用一种复杂的数学策略来观察一系列过去的步骤并高精度地预测未来。研究人员意识到,虽然某些预测方法在远距离前瞻时容易出现剧烈波动和误差,但一种特定类型的数学平滑技术可以保持稳定。通过仔细选择如何测量过去步骤之间的距离并应用稳定的权重系统,他们创造了一种方法,可以在许多中间步骤中完全跳过沉重的计算。
该过程分为两个截然不同的阶段。首先,在图像生成开始之前,系统会根据检查工作的频率计划准备一套指令。它会计算一组特定的权重,这些权重决定了在预测下一步时,应给予过去最后几个已知步骤多少重要性。这种准备工作只进行一次,并且可以保存以备后用。然后,在实际创建图像的过程中,计算机仅在特定的、间隔的时间点运行完整的、沉重的计算。在所有间隔步骤中,它只需使用预存的权重将最后几次完整计算的结果结合起来。这不是一种猜测,而是对计算机如果执行了繁重工作本应计算出的结果进行的一种精确重建,从而使其能够在保持正确路径的同时,跳过繁重的体力活。
研究人员在目前最先进的三种图像生成模型上测试了这种方法,涵盖了从根据简单的文本描述创建图像到生成各种分辨率下的高度详细图像的任务。他们发现,该方法始终如一地提供与标准、较慢的方法同样清晰准确的图像,但显著减少了时间和能量的消耗。在某些测试中,新方法使过程快了近四倍,并将计算量减少了五倍以上。至关重要的是,与以往试图通过跳过步骤来加速过程的方法不同,这种方法不会引入通常困扰加速生成的奇怪扭曲或细节丢失。即使计算机跳过了大部分常规计算,图像依然保持连贯,保留了细腻的纹理和正确的结构。
这项发现之所以特别值得关注,是因为它在不需要教导模型任何新知识的情况下实现了这些结果。该系统作为一个插件层位于现有的、预训练的模型之上,使其成为一个可以立即采用的实用工具。研究人员证明,通过使用这种稳定的预测技术,可以在极短的时间内生成高保真图像。这表明,未来强大的图像生成技术可以在更广泛的设备上实现,从而消除巨大计算成本带来的障碍,同时保持用户所期望的高质量。这项工作证实,通过更深入地理解这些模型的数学行为,寻找既安全又高效的捷径是可能的,从而将一个缓慢、艰苦的过程转变为一个迅速且可靠的过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。