← 最新论文
🤖 machine learning

Sparse Forcing: Native Trainable Sparse Attention for Real-time Autoregressive Diffusion Video Generation

该论文提出了名为"Sparse Forcing"的自回归视频扩散模型训练与推理新范式,通过引入可学习的原生稀疏机制及高效的 GPU 内核(PBSA),在显著降低显存占用和推理延迟的同时,有效提升了长时序视频生成的视觉质量。

原作者: Boxun Xu, Yuming Du, Zichang Liu, Siyu Yang, Ziyang Jiang, Siqi Yan, Rajasi Saha, Albert Pumarola, Wenchen Wang, Peng Li

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Boxun Xu, Yuming Du, Zichang Liu, Siyu Yang, Ziyang Jiang, Siqi Yan, Rajasi Saha, Albert Pumarola, Wenchen Wang, Peng Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为**“稀疏强制”(Sparse Forcing)的新技术,旨在让 AI 生成视频变得更快、更清晰、更稳定**,尤其是当我们要生成很长的视频(比如 1 分钟甚至更久)时。

为了让你轻松理解,我们可以把 AI 生成视频的过程想象成一位正在写长篇小说的作家,而“稀疏强制”就是这位作家新学会的**“高效记忆与写作技巧”**。

1. 以前的痛点:记性太好,反而写不动

在传统的 AI 视频生成(特别是“自回归”模式,即一帧一帧往后画)中,AI 就像一位强迫症作家

  • 全量记忆(全注意力机制): 每写一个新的句子(生成新的一帧),他都要把之前写过的每一个字都重新读一遍,仔细回忆每一个细节。
  • 后果:
    • 太慢: 随着故事变长(视频变长),要读的内容呈爆炸式增长,写得很慢。
    • 容易跑题(误差累积): 因为要处理的信息太多,作家容易看花眼,导致后面的故事和前面的人设、场景对不上(比如主角突然换了衣服,或者背景里的树变成了花)。

2. 核心发现:人类其实只记得“高光时刻”

作者观察发现,其实 AI 在生成视频时,大脑(注意力机制)并不是真的在平等地关注每一帧。

  • 现象: AI 会自然地死死盯住几个关键的“高光时刻”(比如主角的脸、场景的大致布局),而对中间那些过渡的、重复的帧,其实看得很模糊,甚至可以直接忽略。
  • 比喻: 就像你回忆昨天的一天,你记得住“早上喝咖啡”和“下午开会”这两个关键节点,但中间“走路去公司”、“等电梯”这些琐碎过程,你其实记不住,也不需要记。

3. 解决方案:稀疏强制(Sparse Forcing)

基于这个发现,作者给 AI 装上了一个**“智能记忆管家”**,这就是“稀疏强制”。它做了两件事:

A. 建立“永久记忆库”(Persistent Memory)

  • 做法: AI 不再死记硬背每一帧,而是把那些最关键的、能代表故事核心的帧(比如主角的脸、场景的基调)提取出来,存进一个**“永久记忆胶囊”**里。
  • 比喻: 就像作家在笔记本的首页贴了一张**“角色设定卡”“场景地图”**。写后面的章节时,他只需要看一眼这张卡片,就能保证主角没变、场景没乱,而不需要把前面几千页书都翻一遍。
  • 效果: 无论故事写多长,这个“记忆胶囊”的大小是固定的,所以内存占用不会爆炸

B. 开启“局部聚焦模式”(Local Block-Sparse Attention)

  • 做法: 对于刚刚写过的几页(最近的几帧),AI 不需要全看,它只挑选最相关的几个片段来参考。
  • 比喻: 作家在写下一段时,只回头看最近几行,并且只关注其中最关键的几个词,忽略那些废话。
  • 效果: 大大减少了计算量,速度飞快。

4. 为什么叫“强制”(Forcing)?

因为这种“只记重点、忽略细节”的模式,如果让 AI 自己瞎猜,它可能会把重要的东西也忘了。所以,作者在训练 AI 时,强制它学会这种“抓重点”的能力,并专门设计了一套训练方法,让 AI 在“只记重点”的情况下,依然能写出高质量的故事。

5. 成果如何?(用数据说话)

这项技术带来了立竿见影的效果:

  • 画质更好(更稳): 在生成 1 分钟的长视频时,画面不再像以前那样“漂移”或“崩坏”,人物和场景的一致性大幅提升(就像作家写长篇小说,前后逻辑依然严密)。
  • 速度更快: 生成速度提升了 1.1 到 1.27 倍
  • 更省内存: 显存占用降低了 42%。这意味着以前需要昂贵的大显卡才能跑的视频,现在普通一点的显卡也能跑了。

总结

“稀疏强制”就像是给 AI 视频生成装上了一个“聪明的索引系统”
它不再试图记住视频里的每一粒灰尘,而是聪明地记住**“谁在什么场景下做了什么”(关键记忆),并只关注当下最相关的细节**(局部聚焦)。

这让 AI 既能写长篇小说(生成长视频),又能保持逻辑连贯(画质稳定),还能写得飞快(低延迟)。对于未来我们想要用 AI 生成电影、长动画或实时互动视频来说,这是一个非常重要的进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →