← 最新论文
💻 computer science

SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer

该论文提出了 SALAD 方法,通过引入轻量级线性注意力分支并采用多级静态 - 动态缩放策略,在仅需极少训练资源的情况下实现了高达 90% 的稀疏度和 1.52-2.03 倍的推理加速,同时保持了与全注意力基线相当的生成质量。

原作者: Tongcheng Fang, Hanling Zhang, Ruiqi Xie, Zhuo Han, Xin Tao, Tianchen Zhao, Pengfei Wan, Wenbo Ding, Wanli Ouyang, Xuefei Ning, Yu Wang

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Tongcheng Fang, Hanling Zhang, Ruiqi Xie, Zhuo Han, Xin Tao, Tianchen Zhao, Pengfei Wan, Wenbo Ding, Wanli Ouyang, Xuefei Ning, Yu Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 SALAD(听起来像“沙拉”)的新方法,旨在解决视频生成 AI 模型(特别是 Diffusion Transformer)在生成长视频高清视频时遇到的“算不动、太慢”的问题。

为了让你轻松理解,我们可以把生成视频的过程想象成指挥一个庞大的交响乐团演奏一首复杂的交响曲

1. 核心难题:乐团太大了,指挥累垮了

  • 背景:现在的视频生成 AI 非常强大,能画出很逼真的视频。但是,视频是由成千上万个“画面帧”组成的,每一个画面又由很多“像素点”组成。在 AI 眼里,这就变成了超长的序列(比如 3 万个音符)。
  • 问题:传统的 AI 模型(Full Attention)在生成视频时,要求每一个音符都要和所有其他音符“打招呼”并互相交流,才能决定下一个音符怎么响。
    • 比喻:想象一个 1 万人的合唱团,每个人都要和另外 9999 个人同时对话。这不仅累死人,而且计算量是平方级增长的(N2N^2)。随着视频变长,这种“全员交流”会让电脑瞬间卡死,生成速度极慢。

2. 现有的笨办法:只让邻居说话(稀疏注意力)

为了解决这个问题,以前的方法(Sparse Attention)想出了一个招:“只让邻居说话”

  • 比喻:指挥告诉乐手:“你只需要和你左右两边的 10 个人交流,不用管全团。”
  • 效果:速度确实快了,因为交流的人少了。
  • 副作用:视频质量下降了。因为有些重要的信息(比如视频开头出现的“一只金毛犬”,在视频结尾时还需要记得它)距离太远,邻居之间传话传不到,导致 AI 忘了上下文。结果就是:视频里狗突然变成了两只,或者背景乱变,文字描述和画面对不上。

3. 之前的尝试:给乐团加个“低配版”指挥(LoRA 微调)

有人尝试用一种叫 LoRA 的技术,试图在“只让邻居说话”的基础上,通过微调让 AI 自己学会怎么补全丢失的信息。

  • 比喻:这就像给乐团加了一个“低配版”的副指挥,试图通过微调来弥补信息缺失。
  • 结果:效果一般。虽然比不微调好,但视频里还是会出现“两只狗”或者“画面崩坏”的怪事。因为光靠微调,很难在极度简化的交流规则下,完美找回那些丢失的“全局信息”。

4. SALAD 的绝招:主副双轨制 + 智能音量调节

SALAD 提出了一套全新的方案,它的核心思想是:“既要快,又要记得住”。它做了两件事:

A. 引入“全局广播”通道(线性注意力分支)

SALAD 在“只让邻居说话”的主通道旁边,并联了一个轻量级的“全局广播”通道

  • 比喻
    • 主通道(稀疏注意力):乐手们依然只和邻居小声交流,保证速度极快(省算力)。
    • 副通道(线性注意力):有一个低成本的扩音器,负责把全团的关键信息(比如“那是只狗”)简单、快速地广播给所有人。
    • 关键点:这个副通道计算量很小(线性复杂度),不会拖慢整体速度。

B. 智能音量调节器(多级静态 - 动态缩放策略)

这是 SALAD 最聪明的地方。作者发现,如果那个“全局广播”声音太大,会盖过“邻居交流”的声音,导致视频乱套;如果声音太小,又起不到作用。

  • 比喻:SALAD 设计了一个智能调音台
    • 静态调节:在不同的乐器组(模型的不同层),预先设定好广播的音量大小。
    • 动态调节:根据当前演奏到了哪个小节(视频生成的哪个时间点),实时调整音量。
    • 效果:在需要记住全局信息的时候(比如画面刚开始),广播声音大一点;在只需要细节的时候,广播声音小一点。它确保副通道永远只是“辅助”,不会喧宾夺主。

5. 最终成果:既快又美

  • 速度:SALAD 能让视频生成速度提升 1.5 到 2 倍,同时减少了 90% 的计算量(就像把 1 万人的对话减少到只和邻居聊,但关键信息没丢)。
  • 质量:生成的视频质量几乎和“全员交流”的慢速模型一样好,没有“两只狗”或“画面崩坏”的问题。
  • 省钱:训练这个模型非常高效,只需要 2000 个视频样本不到 30 小时的 GPU 时间(相比之下,其他方法可能需要几十万视频和几百小时)。

总结

SALAD 就像是一个聪明的乐团指挥
它让乐手们主要只和邻居交流(为了快),但同时安排了一个聪明的扩音器(线性分支)在关键时刻广播全局信息(为了准)。而且,它有一个智能调音台,确保扩音器的声音恰到好处,既不会盖过乐手,也不会被忽略。

最终,它用极低的成本,实现了**“又快又好”**的视频生成,让 AI 画长视频不再卡顿。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →