← 最新论文
💻 computer science

DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity

DiffSparse 提出了一种基于可微分层稀疏度优化的端到端框架,通过结合令牌缓存与两阶段训练策略,在无需完整前向计算的情况下显著降低了扩散 Transformer 模型的推理成本并提升了生成质量。

原作者: Haowei Zhu, Ji Liu, Ziqiong Liu, Dong Li, Junhai Yong, Bin Wang, Emad Barsoum

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Haowei Zhu, Ji Liu, Ziqiong Liu, Dong Li, Junhai Yong, Bin Wang, Emad Barsoum

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 DiffSparse 的新方法,旨在让现在的 AI 绘画和生成视频模型(比如 Midjourney、Stable Diffusion 的升级版)画得更快,而且画得更好。

为了让你轻松理解,我们可以把 AI 生成图像的过程想象成一位画家在画一幅复杂的油画

1. 核心问题:画家太累了,画得太慢

现在的 AI 模型(特别是基于 Transformer 架构的 Diffusion 模型)画一幅画,不是一笔就成的。它需要像“去噪”一样,经过很多个步骤(比如 20 步、50 步),一步步把模糊的噪点变成清晰的图像。

  • 现状:每一步,画家都要重新审视画布上的每一个像素点(Token),计算它们该怎么变。这就像画家在画 1000 个像素时,哪怕其中 800 个像素跟上一秒几乎没变,他也要重新算一遍。这非常浪费时间和精力(计算成本极高)。
  • 以前的尝试:以前的加速方法有点像“偷懒”。比如,画家决定:“前 5 步我全画,中间 5 步我直接照搬上一张图,最后 5 步我再全画。”
    • 缺点:这种“偷懒”太死板了。有时候该偷懒的时候没偷,有时候该画的时候却偷懒了,导致画出来的东西要么模糊,要么细节丢失。而且,这种“照搬”通常只能用在特定的几步,不能灵活调整。

2. DiffSparse 的解决方案:聪明的“智能助手”

DiffSparse 就像给这位画家配了一个超级聪明的智能助手。这个助手不直接画画,但它负责决定哪些地方需要画家亲自动手,哪些地方可以直接“复制粘贴”上一秒的结果

核心功能一:动态的“偷懒”策略(可学习的稀疏性)

  • 以前的做法:助手是死板的,它说:“不管画什么,第 3 层和第 5 层必须全画,第 4 层可以偷懒。”这是人工设定的,不够灵活。
  • DiffSparse 的做法:助手是会学习的。它通过观察,发现:
    • 在画画的早期,大部分细节还没出来,所以很多像素点变化不大,可以大胆地“复制粘贴”(节省算力)。
    • 在画画的后期,或者在画关键细节(比如眼睛、文字)时,助手会告诉画家:“这里必须亲自动手,不能偷懒!”
    • 比喻:这就像你写文章。写大纲时,你可以快速跳过很多词;但写结尾的高潮部分时,你必须字斟句酌。DiffSparse 能自动识别哪里该“快进”,哪里该“精修”。

核心功能二:动态规划(全局最优解)

  • 助手不仅看局部,还看全局。它使用一种叫“动态规划”的数学方法,就像下棋一样,计算每一步怎么分配精力,才能让总耗时最少,同时画出来的画最完美
  • 它不是随机决定哪里偷懒,而是经过精密计算,确保在节省 50% 工作量的情况下,画出来的画甚至比原来全画还要好。

核心功能三:两阶段训练法(先学后精)

  • 第一阶段:助手先观察画家在“全速运转”(不偷懒)时的表现,学习哪些步骤是必须全画的(比如起稿和收尾),哪些步骤可以完全跳过。
  • 第二阶段:助手把学到的经验整合起来,开始指导画家在“半速”状态下工作。它不再依赖死板的规则,而是根据画作的实时状态,动态调整哪里该快、哪里该慢。
  • 比喻:就像学开车。先跟着教练开(全画),教练告诉你哪里该踩刹车、哪里该加速;然后你自己开(两阶段训练),你学会了根据路况自动调整,既省油又安全。

3. 效果如何?

论文在多种模型(如 PixArt-α, FLUX, Wan2.1)上做了测试,效果非常惊人:

  • 速度提升:在 PixArt-α 模型上,他们把计算量减少了 54%(相当于画一幅画的时间缩短了一半多),速度提升了 1.91 倍
  • 质量提升:最不可思议的是,画得更快,画得更好了! 以前加速往往会导致画质下降(比如模糊、变形),但 DiffSparse 因为更聪明地分配了精力,反而让生成的图片质量比原来的全速模型还要高(FID 分数更低,代表更逼真)。
  • 通用性:这个方法不仅适用于画 256x256 的小图,甚至直接套用到 512x512 的大图上,不需要重新训练,依然有效。

总结

DiffSparse 就像是给 AI 画家装上了一个拥有“上帝视角”的导航系统

  • 以前:画家不管路多堵,都按固定路线开,或者盲目地抄近道,容易迷路或撞车(画质差)。
  • 现在:导航系统(DiffSparse)实时分析路况,告诉画家:“前面这段路车少,我们可以开快点(复用特征);前面那个路口很复杂,必须慢慢开(重新计算)。”

结果是:路走得更顺了(速度更快),而且准时甚至提前到达了目的地(画质更好)。 这让 AI 绘画和生成视频变得更加高效,未来在手机上运行大型 AI 模型也将成为可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →