BRACE: Taming Sharp Irregularities via Barycentric Rational Forecasting for Fast Diffusion Transformers Inference
本文介绍了 BRACE,这是一种针对 Diffusion Transformer 的新型推理加速方法,它利用基于切比雪夫权重的重心有理预测法取代了不稳定的基于导数的多项式外推法,从而在有效处理特征剧烈不规则性的同时,保持了极高的生成质量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图创作一幅杰作,但你不是在使用画笔,而是在使用一个必须通过成千上万个微小、谨慎的步骤来完成画作的机器人。这个机器人是一个“扩散 Transformer”(Diffusion Transformer),一种通过将随机的静态噪声缓慢转化为清晰图像来创造惊艳图像和视频的 AI 类型。问题在于,这个机器人运行得极其缓慢;它需要很长时间才能完成所有步骤,这使得它很难用于像与 AI 聊天或即时生成视频这类需要实时互动的场景。为了提高速度,科学家们尝试告诉机器人:“嘿,你不需要计算每一个步骤;只需根据刚才的操作来预测接下来的几个步骤即可。”这被称为“特征缓存”(feature caching)。然而,旧的预测方法就像是通过观察几个点来绘制一条直线,以此来预测过山车的路径。如果轨道突然扭转或出现环形,这条直线预测就会脱离轨道,导致画面模糊或看起来很奇怪。
这篇论文介绍了一种新的方法,可以在不破坏图像质量的前提下让这个机器人变得更快。作者团队来自四川大学,他们注意到虽然机器人的路径通常是平滑的,但偶尔会遇到突然的、剧烈的颠簸或扭转。旧的方法依赖于计算“导数”(一种衡量变化快慢的高级数学方式),当遇到这些剧烈转弯时,它们会感到困惑。研究团队提出了一个名为 BRACE(基于重心比例的切比雪夫增强理性预测)的新方法。BRACE 不再试图测量变化的速率,而是观察机器人步骤的实际历史轨迹,并使用一种特殊的数学“有理函数”(一种基于分式的公式)来预测未来。你可以把它想象成一个 GPS,它不仅仅是在你的目的地之间画一条直线,而是使用一根灵活且具有弹性的橡皮筋,完美地贴合在蜿蜒的道路上,即使道路突然弯曲也是如此。通过使用这种灵活的方法,BRACE 可以让 AI 一次性跳过许多步骤,从而显著提高速度,同时保持图像清晰且视频流畅。
问题所在: “直线”陷阱
要理解为什么需要这种新方法,请想象你正在一条大部分是直路但偶尔有几个突然、尖锐的发夹弯的路上开车。如果你开得很快,并试图通过从当前位置画一条直线来预测十秒钟后的路况,你很可能会撞上树或飞下悬崖。这正是之前 AI 加速方法所发生的情况。
以前加速扩散 Transformer 的方法类似于使用“泰勒展开”(Taylor expansion),这是一种试图通过观察汽车当前的移动速度以及速度的变化率(加速度)来预测未来的数学工具。对于平缓、温柔的曲线,这种方法效果很好。但研究人员发现,AI 行进的“道路”并不总是平滑的。它存在“剧烈的异常”——即突然、剧烈的方向变化。当 AI 试图使用旧有的“直线”或“平滑曲线”数学来预测这些剧烈转弯时,预测会变得极其错误。结果呢?AI 虽然跳过了步骤,但生成的图像会出现扭曲、模糊或产生奇怪的伪影,比如一张脸长了太多眼睛,或者一辆车长了额外的轮子。
解决方案:BRACE 的弹性橡皮筋
作者意识到,与其尝试测量转弯的速度(在转弯突然发生时很难准确测量),不如直接观察汽车最近行驶过的实际路径,并使用一种更聪明的方式来连接这些点。他们将这种新方法称为 BRACE。
以下是 BRACE 的工作原理,使用一个简单的类比:
想象你正试图通过观察蛇的几段身体来猜测蛇的形状。
- 旧方法(多项式): 你试图画一根单一的、僵硬的木棒(多项式),使其触碰到你能看到的所有片段。如果蛇突然扭动,你的僵硬木棒就会折断或完全错过蛇。
- BRACE 方法(有理预测): 你不再使用僵硬的木棒,而是使用一根灵活、有弹性的橡皮筋(有理函数)。你将橡皮筋连接到你已经看到的那些片段上。因为橡皮筋是灵活的,它可以弯曲和扭转,完美地跟随蛇的剧烈转弯,即使转弯发生得非常突然。
从技术层面来说,BRACE 使用的是“重心比例函数”。这是一种高级的数学公式,充当了那根灵活的橡皮筋。它获取实际的数据点(AI 已经计算出的“特征”),并以一种能够自然处理剧烈变化且不会产生困惑的方式将它们结合起来。
它的特别之处:“切比雪夫”秘方
为了让这根橡皮筋效果更好,作者加入了被称为“自适应切比雪夫权重”(Adapted Chebyshev weights)的东西。你可以把这看作是橡皮筋上的一个特殊张力设置。如果你在两端拉得太紧,它可能会断裂或拉伸不均。切比雪夫权重是一种数学技巧,确保无论预测未来时需要多大的拉伸,橡皮筋都能保持平衡和稳定。
论文显示该方法具有极高的稳定性。即使 AI 被要求跳过大量的步骤(例如从第 1 步直接跳到第 20 步),这根“橡皮筋”也不会断裂。它始终保持在路径上,确保最终生成的图像与 AI 缓慢走完每一步所产生的图像一样高质量。
实验结果显示
研究人员在三种不同类型的 AI 任务上测试了 BRACE:
- 根据文本创建图像: 他们使用了一个名为 FLUX.1-dev 的模型。当他们要求 AI 生成复杂的图像(如沙漠中的鲨鱼或带有特定文字的店面)时,旧方法经常会弄错文字或使细节模糊。然而,BRACE 即使在将处理速度提升 5 倍以上时,仍能保持文字清晰和细节明确。
- 创建视频: 他们在一个视频模型 HunanVideo 上进行了测试。在视频生成中,物体是在运动的,如果预测错误,动作看起来会很生硬,或者物体会消失。BRACE 成功保持了运动的平滑感,使物体(如奔跑的马或游泳的人)看起来自然。
- 标准图像生成: 在一项经典的测试 ImageNet 上,与其他快速方法相比,BRACE 产生了最高的质量评分(通过 FID 衡量,FID 分数越低越好)。
在测试中,BRACE 使 AI 加速了 3.5 倍到 5.5 倍。例如,在 FLUX.1 模型上,它实现了 5.55 倍的加速,同时生成的图像看起来与低速、高质量版本几乎完全相同。研究人员指出,当达到这些高速度时,其他方法开始失效并产生“重影”或“扭曲”,而 BRACE 依然保持稳定。
核心结论
这篇论文并不声称解决了 AI 的所有问题,但它确实提出了一个非常强有力的全新方向。作者认为,过去那种通过僵硬的、基于导数的数学来加速 AI 的思维方式,在处理 AI 学习路径中的“剧烈转弯”时存在根本性的缺陷。通过转向灵活的有理方法(BRACE),他们找到了一种方法,可以在不牺牲艺术品质的前提下,让这些强大的图像和视频生成器运行得更快。
这有点像是意识到,要驾驭一条蜿蜒的山路,你需要的不是一条更直的路,而是一个更好的悬挂系统。BRACE 提供了这种悬挂系统,让 AI 在快速跨越步骤的同时,依然稳稳地行驶在通往美丽画卷的路径上。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。