← 最新论文
💻 computer science

Veda: Scalable Video Diffusion via Distilled Sparse Attention

Veda 是一种提炼的稀疏注意力框架,它通过统计感知评分和头感知分块将图块选择与全注意力几何结构对齐,从而在加速可扩展视频扩散的同时,在不牺牲生成质量的前提下实现了显著的速度提升。

原作者: Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试绘制一幅持续 10 秒的超高清巨型壁画。为此,你拥有一支由 120 亿名微小艺术家(即“令牌”)组成的团队,他们需要彼此交流,以确保色彩完美融合、动作流畅自然。

在当前的技术状态下,每一位艺术家都必须停下来,向每一位其他艺术家耳语一个秘密,以决定下一步该画什么。这被称为“全注意力机制”。虽然它能产生精美的效果,但速度极慢且成本高昂。如果你将壁画规模扩大一倍,协调所需的时间并非仅仅翻倍,而是会变为四倍。这就像试图组织一场派对,要求所有人在音乐开始前必须与彼此一一握手。

“走捷径”的问题
研究人员曾尝试通过让艺术家只与少数邻居交流(稀疏注意力)来加速这一过程。然而,以往的方法就像一位笨拙的经理,只是告诉艺术家们:“只和你同一排的邻居交谈。”这导致壁画看起来怪异:画中的水波会泛起奇异的涟漪,人脸会发生扭曲,视频会出现闪烁。艺术家们错过了维持画面连贯性所必需的重要对话。

解决方案:Veda(智能工头)
该论文介绍了Veda,这是一个新系统,它像一位敏锐、观察入微的工头。Veda 并非猜测谁需要与谁交谈,而是利用一种“蒸馏”技巧。

以下是其工作原理,使用一个简单的类比:

  1. “神谕”地图:想象一下,缓慢而完美的“全注意力”方法就像一位总建筑师,他绘制了一张包含所有应该发生的对话的完整地图。这张地图完美无缺,但绘制起来耗时极长。
  2. 聪明的学生:Veda 训练一个轻量级的“学生”(一个小型、快速的 AI),让它查看总建筑师的地图,并学习谁与谁交谈的模式
  3. “三池”技巧:以往的学生试图通过取对话的“平均值”来总结地图。但在视频中,最重要的往往是一个单一的、响亮的呼喊(峰值信号),而不是平均的嘈杂声。Veda 的学生更聪明:它会查看对话的最大值最小值平均值。这确保了它不会遗漏那些保持视频稳定性的关键“响亮”时刻。
  4. 头感知分块:视频包含许多不同的“头”(专门团队)。有些团队关注事物随时间的变化(时间维度),而另一些则关注事物在空间中的外观(空间维度)。Veda 意识到“一刀切”的规则行不通。它为每个团队提供定制大小的拼图块(分块),以契合其特定任务,确保它们不会遗漏重要细节。

结果:速度提升且无模糊
一旦 Veda 学会了这张地图,它就会告诉艺术家们:“你们只需要与这特定的 5% 的人交谈。忽略其余的人。”

因为 Veda 确切知道可以忽略而不丢失重要连接,视频生成变得极其迅速:

  • 速度:它将生成高清 10 秒视频的速度提高了5.1 倍
  • 质量:与以往导致视频出现故障或扭曲的方法不同,Veda 生成的视频看起来与缓慢的完美版本一样好。
  • 可扩展性:视频越长、细节越丰富,Veda 的优势就越明显。它几乎以线性方式处理额外工作,而旧方法则会陷入交通堵塞。

总结
Veda 就像雇佣了一位超级聪明的工头,他研究完美计划,学习哪些对话至关重要,然后指挥团队跳过无聊的寒暄。这使得他们能够在极短的时间内绘制出一幅巨大的高质量壁画,而不会让画面支离破碎。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →