← 最新论文
💻 computer science

NABLA: Neighborhood Adaptive Block-Level Attention

本文介绍了 NABLA,一种用于视频扩散 Transformer 的新型邻域自适应块级注意力机制,它通过动态稀疏性自适应,在无需设计自定义算子的情况下,在保持高生成质量的同时,将训练和推理速度显著提升了高达 2.7 倍。

原作者: Dmitrii Mikhailov, Aleksey Letunovskiy, Maria Kovaleva, Vladimir Arkhipkin, Vladimir Korviakov, Vladimir Polovnikov, Viacheslav Vasilev, Evelina Sidorova, Denis Dimitrov

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Dmitrii Mikhailov, Aleksey Letunovskiy, Maria Kovaleva, Vladimir Arkhipkin, Vladimir Korviakov, Vladimir Polovnikov, Viacheslav Vasilev, Evelina Sidorova, Denis Dimitrov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:那个“过度关注”的大厨

想象一下,你正在为一个盛大的宴会准备一道复杂的、多道菜式的餐点(高质量视频)。在目前的视频生成技术中,“大厨”(AI 模型)有一个非常严格的规则:为了烹饪任何一道菜,他们必须在决定添加什么之前,把厨房里所有的食材一个接一个地尝一遍。

如果厨房里有 1,000 种食材,大厨就必须检查 1,000 × 1,000 种组合。这被称为“全注意力机制”(Full Attention)。

  • 结果: 厨房变得拥挤不堪,大厨精疲力竭,而且上菜速度极慢。制作高清视频就像是在准备一场百道菜的盛宴;大厨把太多的时间都花在了品尝食材上,以至于几乎没法真正开始烹饪。

旧有的解决方案:“网格”规则(滑动平铺注意力机制)

为了提高速度,工程师们尝试了一种更简单的规则,叫做滑动平铺注意力机制(Sliding Tile Attention, STA)

  • 类比: 大厨不再品尝所有食材,而是将厨房划分为一个个小方块组成的网格。他们只品尝自己所在的方块以及相邻方块里的食材。
  • 问题: 这种方法虽然快,但过于僵化。有时候,最重要的食材可能在另一个房间里(长距离连接),但网格规则却说:“不行,你只能看你所在的房间。”这会导致奇怪的错误,比如大厨因为盐罐在另一个方块里,而忘了往汤里放盐。

新的解决方案:NABLA(“聪明的侦察兵”)

作者引入了 NABLA(邻域自适应块级注意力机制)。不要把 NABLA 想成一个僵硬的网格,而要把它想象成一个在厨房上空飞行的聪明的侦察兵

以下是 NABLA 如何通过三个简单的步骤工作的:

  1. 俯瞰视角(池化/Pooling): 侦察兵不再逐一观察每一种食材,而是以大块区域(就像观察地图上的街区一样)来观察厨房。他们会询问:“现在哪个街区拥有最重要的食材?”
  2. 智能过滤器(CDF 阈值): 侦察兵会创建这些街区的列表,并按重要性进行排名。他们使用一条“截断线”(数学阈值)来决定:“我们只关注最重要的前 20% 的街区。”
    • 为什么这很酷: 如果视频是一个平静的风景,侦察兵会专注于天空;如果是一个混乱的动作场景,侦察兵会专注于移动的汽车。它能自动适应内容。
  3. 安全网(与 STA 的并集): 为了确保侦察兵不会错过街区边缘的重要细节(这会导致线条模糊),NABLA 将其智能列表与旧有的“网格”规则结合起来。它会说:“我们会观察侦察兵发现的顶级街区,加上 紧邻的邻近区域,以确保万无一失。”

为什么这很重要(研究结果)

论文声称,这种“聪明侦察兵”的方法通过两个方面改变了游戏规则:

  • 它更快:

    • 推理阶段(观看视频): 在生成高质量 720p 视频时,NABLA 比旧方法快 2.7 倍。这就像大厨在不降低食物味道的前提下,用一半的时间就完成了宴会的供应。
    • 训练阶段(学习食谱): 当从头开始教一个新的 AI 模型时,NABLA 让学习过程快了 1.46 倍。大厨学习新食谱的速度变快了。
  • 它不会牺牲质量:

    • 通常情况下,当你提高速度时,质量会下降(汤的味道会变得平淡)。但作者使用严格的评判标准(如 CLIP、VBench 和 FVD 等指标)将 NABLA 与缓慢但完美的原始方法进行了对比。
    • 结论: 使用 NABLA 制作的视频与那些缓慢、完美的视频几乎完全一致。“聪明侦察兵”并没有错过任何关键食材。
    • 人类测试: 真人并排观看视频,无法分辨出“快速版 NABLA”视频与“慢速完美版”视频之间的区别。

总结

NABLA 是一种让 AI 视频生成既快速又不变笨的方法。它阻止了 AI 在无关部分浪费时间,并将其精力集中在真正重要的地方,同时保留了一个安全网,以确保最终画面清晰且连贯。

核心要点: 你不再需要在速度和质量之间做选择。NABLA 通过让 AI 成为一个聪明、自适应的观察者,而不是一个僵化、过度劳累的观察者,从而让你同时拥有两者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →