← 最新论文
🤖 machine learning

FastCache: Fast Caching for Diffusion Transformer Through Learnable Linear Approximation

本文提出了 FastCache,一种通过结合基于隐藏状态显著性的自适应令牌选择、跨时间步的潜在激活缓存以及基于 k-NN 密度的令牌合并机制,利用可学习线性近似来显著加速扩散 Transformer(DiT)推理并降低显存占用的框架。

原作者: Dong Liu, Yanxuan Yu, Jiayi Zhang, Yifan Li, Ben Lengerich, Ying Nian Wu

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Dong Liu, Yanxuan Yu, Jiayi Zhang, Yifan Li, Ben Lengerich, Ying Nian Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 FastCache 的新技术,它的目标是让现在的顶级 AI 绘画和视频生成模型(叫做 Diffusion Transformer,简称 DiT)跑得更快、更省电,同时还能保证画出来的东西一样好看。

为了让你轻松理解,我们可以把 AI 生成图像或视频的过程想象成一位极其勤奋但有点“死脑筋”的画家在画一幅长卷画

1. 痛点:画家的“死脑筋”

现在的 AI 画家(DiT)非常强大,能画出电影级的画面。但是,它有一个大毛病:太累了,而且有点重复劳动

  • 场景:假设画家要画一段视频,比如“一个人在公园里散步,背景是静止的树木和天空”。
  • 现状:AI 画家非常负责,哪怕背景里的树和天空在每一帧里几乎一模一样,它也会每一帧都重新拿笔,把树和天空从头到尾、一笔一划地重新画一遍
  • 后果:这就像你为了看一部电影,每秒钟都要重新把整个电影院重新装修一遍一样。这导致生成速度很慢,电脑(GPU)发热严重,内存也爆满。

2. 解决方案:FastCache(智能缓存与“偷懒”策略)

FastCache 就像给这位勤奋的画家配了一位聪明的“副手”或“管家”。这位副手的工作不是帮画家画画,而是帮画家判断哪些地方可以“偷懒”,哪些地方必须“亲力亲为”

FastCache 主要用了两招:

第一招:动静分离(空间感知)

  • 比喻:副手拿着放大镜看画布。
    • 如果看到背景里的树、天空(静态部分),副手会说:“嘿,这部分上一秒和这一秒完全没变,不用重画了!直接复制粘贴上一帧的画就行。”
    • 如果看到走路的人、飘动的云(动态部分),副手会说:“这部分在动,必须让画家亲自重新画,不能偷懒。”
  • 效果:画家只需要把精力集中在“动”的地方,静止的地方直接复用,省下了大量体力。

第二招:智能预测(线性近似)

  • 比喻:有时候,虽然树没动,但光线有一点点微妙的变化(比如云飘过遮了一点光)。
    • 以前的方法可能会直接忽略,导致画面卡顿或模糊。
    • FastCache 的副手很聪明,它会说:“虽然树没动,但光线变了。我不需要画家重新画整棵树,只需要拿一支简单的笔,在原来的画上轻轻涂一层淡淡的颜色(这就是论文里说的“可学习的线性近似”)。”
  • 效果:既不用重画整棵树,又能捕捉到细微的光影变化,保证了画面的质量。

3. 核心黑科技:什么时候该“偷懒”?

副手不是瞎指挥,它有一套数学上的“体检规则”(统计假设检验):

  • 它会计算:“这一帧和上一帧的变化,是不是小到可以忽略不计?”
  • 如果变化很小(比如背景),它就跳过复杂的计算步骤,直接调用缓存。
  • 如果变化很大(比如动作剧烈),它就立刻叫停,让画家全速运转。
  • 理论保障:论文里还证明了,只要变化在可控范围内,这种“偷懒”不会让画变丑,误差是严格受控的。

4. 额外大招:合并同类项(Token Merging)

除了“偷懒”,FastCache 还有一个绝活:合并同类项

  • 比喻:如果画布上有一大片完全一样的草地,副手会把这一大片草地里的几百个小草点,合并成一个大草点来处理。
  • 效果:画家要处理的“点”变少了,速度自然更快。等画完了,再把大草点还原成细节,观众根本看不出区别。

5. 最终成果:快、省、好

经过实验,FastCache 带来了显著的效果:

  • 速度快:生成视频的时间减少了约 37%(就像原本要 10 分钟画完,现在只要 6 分钟)。
  • 省内存:电脑内存占用减少了约 32%,让普通电脑也能跑大模型。
  • 画质好:这是最厉害的,它在加速的同时,画质比现有的其他加速方法都要好(FID 分数更低,意味着画面更逼真、更自然)。

总结

FastCache 就是给 AI 画家装上了一个智能的“记忆库”和“过滤器”。它教会 AI 识别哪些是“死”的(可以缓存),哪些是“活”的(需要重算),并用聪明的“微调”代替笨重的“重画”。

这就好比我们看视频时,如果背景不动,我们的大脑会自动忽略背景的细节,只关注主角的动作。FastCache 让 AI 也学会了这种人类般的“抓重点”能力,从而实现了极速、高效的生成。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →