LESA: Learnable Stage-Aware Predictors for Diffusion Model Acceleration
本文提出了基于两阶段训练和 Kolmogorov-Arnold 网络(KAN)的 LESA 框架,通过多阶段多专家架构实现了对扩散模型特征的精准学习,在 FLUX.1-dev、Qwen-Image 和 HunyuanVideo 等多个模型上实现了显著加速(最高 6.25 倍)的同时保持了高保真生成质量,甚至超越了现有最先进方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一种名为 LESA 的新方法,它的核心目标是让 AI 画图和视频的速度变得飞快,同时还能保持画得好看。
为了让你轻松理解,我们可以把 AI 生成图像的过程想象成一位画家在画一幅复杂的油画。
1. 现在的痛点:画家太累了
目前的 AI 模型(比如 Diffusion Models)画一幅画,需要走很多步(比如 50 步)。
- 传统做法:画家每一步都要重新思考、重新调色、重新下笔。这就像画家每画一笔,都要把整张画重新看一遍,非常慢,电脑也很累。
- 现有的加速方法:为了快一点,以前的方法有两种:
- 直接复用(Cache-Then-Reuse):就像画家偷懒,觉得“刚才那笔和现在差不多”,直接拿刚才的笔触盖上去。但这在画细节时容易出错,画面会糊掉。
- 简单预测(TaylorSeer 等):就像画家根据前几笔的走势,用简单的数学公式猜下一笔。但这有个问题:画画的节奏不是均匀的! 刚开始画大轮廓时变化剧烈,最后画细节时变化很细微。简单的公式猜不准这种“忽快忽慢”的节奏,导致画出来的东西变形或失真。
2. LESA 的解决方案:请了一位“懂节奏的超级助手”
LESA 的核心思想是:不要用一个死板的公式去猜,而是请一个聪明的助手,根据画画的不同阶段,用不同的策略来预测。
核心比喻:分阶段的“智能导航”
想象你在开车去一个陌生的地方,路程分为三个阶段:
- 起步阶段(高噪声期):车子刚发动,方向乱晃,变化剧烈。这时候你需要反应极快、频繁调整的导航。
- 巡航阶段(中噪声期):车子上了高速,路况平稳。这时候导航可以稍微放松,预测未来几公里。
- 进站阶段(低噪声期):车子要进小区停车了,需要极其精准地微调方向,不能乱猜。
LESA 就是这样一个“分阶段导航系统”:
- 它把画画的过程切分成三个阶段(起步、巡航、进站)。
- 每个阶段都配了一个专门的专家(Expert)。
- 起步专家:专门处理剧烈变化,猜得准。
- 巡航专家:专门处理平稳变化,效率高。
- 进站专家:专门处理细节微调,保质量。
核心技术:KAN(柯尔莫哥洛夫 - 阿诺德网络)
这个“专家”的大脑里装了一种叫 KAN 的新技术。
- 以前的 AI(MLP):像是一个只会用固定公式算数的计算器,不管情况多复杂,都硬套同一个公式。
- LESA 的 KAN:像是一个会变形的橡皮泥。它不仅能算数,还能根据数据的样子,自动调整自己的“形状”和“逻辑”。它能更灵活、更精准地学会“画画时特征是如何随时间变化的”,而且用的参数很少,计算很快。
3. 它是如何训练的?(两步走战略)
为了让这个助手真正学会,作者设计了两个训练阶段:
- 看老师示范(Ground-Truth Training):先让助手看着画家(AI 模型)一步步画,老师手把手教它:“这一步应该变成什么样”。这时候助手学的是标准答案。
- 自己开车(Closed-Loop Training):然后让助手自己开车。如果它猜错了,它会根据自己猜错的结果,继续猜下一步。这就像在模拟真实驾驶中遇到的“误差累积”,让助手学会即使前面有点小偏差,后面也能把路修回来,变得非常稳健。
4. 效果有多好?(成绩单)
论文在几个最火的 AI 模型(FLUX, Qwen-Image, HunyuanVideo)上做了测试,效果惊人:
- 速度提升:
- 在 FLUX 模型上,速度提升了 5 倍,画质几乎没掉(只掉了 1%)。
- 在 Qwen-Image 上,速度提升了 6.25 倍,而且画质比之前的“最强加速法”(TaylorSeer)还要好 20% 以上!
- 在视频生成上,速度也提升了 5 倍,画面更清晰,没有乱跳。
- 简单说:以前画一张图要等 10 秒,现在用 LESA 可能只要 1-2 秒,而且画出来的东西依然清晰、漂亮,不会像以前那样糊成一团或长歪了。
总结
LESA 就像给 AI 画家配了一位“懂节奏、会变形、能纠错”的超级副驾驶。
它不再用“一刀切”的笨办法去加速,而是根据画画的不同阶段,灵活切换策略。这让 AI 既能跑得飞快,又能画得漂亮,真正解决了 AI 生成内容“太慢”和“太贵”的难题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。