← 最新论文
🤖 AI

Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models

SparsePR 是一种用于视频生成和世界模型的无需训练的稀疏注意力方法,它结合了响应耦合分区与探针拟合残差重构技术,通过最小化注意力重构误差来显著加速推理,同时保持生成质量。

原作者: Pardis Taghavi, Reza Langari, Gaurav Pandey

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Pardis Taghavi, Reza Langari, Gaurav Pandey

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一台计算机正试图逐帧地构思一段新的视频,或者预测一个物理物体在空间中的运动轨迹。为了实现这一点,该软件使用了一个庞大的数字大脑,这个大脑必须不断回溯其目前生成的所有信息,以决定下一步该做什么。这个过程就像是在读一本书的同时,还要同时记住你曾经读过的每一页上的每一个词;故事越长,想要追踪所有内容就变得越困难。这种“回溯”是现代视频生成的引擎,但也是它最沉重的负担。随着视频变得越来越长、图像变得越来越清晰,计算机必须将场景的每一个新部分与每一个旧部分进行对比,这项任务规模庞大到足以让机器运行缓慢。科学家们长期以来一直寻求一种方法,通过忽略那些无关紧要的过去信息来使这一过程变得更快,但仅仅是切除明显的干扰项已被证明很难做到而不破坏最终图像的质量。

德克萨斯 A&M 大学的一个研究小组开发出了一种新方法来解决这个问题,而无需重新训练计算机的大脑。他们将这种方法称为 SparsePR,这是一种类似于计算机记忆的“智能编辑”的技术。该方法并非盲目地删除信息或猜测保留哪些部分,而是根据计算机对信息的实际反应来仔细地对信息进行分组。当计算机考虑一个新帧时,它会观察前序帧的不同部分是如何对其做出反应的。研究人员发现,仅仅将外观相似的像素组合在一起是不够的;有时,视频中两个看起来截然不同的部分需要被视为一个整体,因为计算机的大脑以相同的方式处理它们。通过基于这些实际反应而非仅仅基于视觉相似性来组织数据,该系统可以安全地忽略大量信息,同时仍能准确知道自己遗漏了什么。

研究人员发现,以往试图加速视频生成的尝试通常犯了一个关键错误:它们假设如果计算机对视频的特定部分保持了大部分重要的“注意力”,那么结果就会很好。他们发现事实并非如此。即使计算机高度聚焦于正确的区域,被它忽略的部分仍可能导致最终输出出现显著误差。这就像一位摄影师完美地聚焦于主体,却忘记了背景光线正在发生变化;主体很清晰,但整张照片却错了。这种新方法通过对它正在忽略的视频部分进行微小而精确的观察,来计算如何精确地修正最终图像。它使用少量的“探测”检查——就像对少量样本进行快速质量控制测试一样——来构建一个数学地图,从而预测视频其余部分的误差并立即进行修正。

在测试中,研究人员将这种技术应用于四种不同的先进视频模型,包括用于生成新电影的模型以及其他用于预测现实世界物理运动的模型。他们发现,通过使用这种新的数据分组和误差修正方法,计算机的运行速度比以前快了 1.48 到 2.61 倍。尽管有了如此巨大的提速,视频的质量仍与缓慢的原版几乎完全一致。该系统实现这些结果的方法是,仅执行了通常需要完成的总计算量的 22% 到 26%。研究人员表明,成功的关键不仅在于减少工作量,还在于理解所遗留误差的具体形态,并用定制的修正方案来解决它们。这项工作证明了我们不需要为了速度而牺牲质量;通过理解计算机的注意力是如何运作的,我们可以使其变得更加高效,同时又不失去创造复杂、真实世界的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →