← 最新论文
💻 computer science

SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces

本文提出将双向结构化状态空间模型(SSMs)作为高效的时间特征提取器集成到视频扩散模型中,以克服注意力机制的二次方计算限制,从而在显著降低显存消耗的同时,实现高质量的长时视频生成。

原作者: Yuta Oshima, Shohei Taniguchi, Masahiro Suzuki, Yutaka Matsuo

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuta Oshima, Shohei Taniguchi, Masahiro Suzuki, Yutaka Matsuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:视频 AI 中的“交通堵塞”

想象一下,你正在试图教一个机器人一帧一帧地画出一部电影。为了让电影看起来流畅且符合逻辑,机器人需要记住之前发生了什么,并预测接下来会发生什么。

目前的 AI 模型(称为扩散模型,Diffusion Models)在这方面表现出色,但在制作长视频时面临一个巨大的瓶颈。它们使用一种叫做注意力机制(Attention)的机制。把“注意力机制”想象成一位图书管理员,他必须读完图书馆里的每一本书,才能找到你需要的那一本。

  • 短视频(16 帧): 图书馆很小。管理员很快就能找到那本书。
  • 长视频(256 帧): 图书馆规模巨大。管理员必须将每一本书与每一本其他的书进行对比阅读,以寻找其中的联系。工作量并不仅仅是翻倍,而是呈几何级数增长。这会在计算机的内存和处理能力中造成“交通堵塞”,使得生成长视频变得非常昂贵且缓慢。

解决方案:“状态空间”快车道

该论文的作者提出了一种处理 AI “记忆”部分的新方法,用一种被称为 状态空间模型(SSM) 的技术——具体来说是一种名为 Mamba 的类型——取代了原来的“注意力机制”。

把 SSM 想象成一列高速列车,而不是一位图书管理员。

  • SSM 不再每次都重新阅读整个历史记录,而是携带一份关于它所经过之处的“摘要”。
  • 当它移动到下一个站点(下一帧视频)时,它只需根据新站点来更新它的摘要即可。
  • 结果: 无论列车行驶 16 英里还是 256 英里,它所花费的时间和燃料(计算成本)都是呈线性、可预测的增长。它不会像“图书管理员方法”那样导致成本爆炸式增长。

他们实际做了什么

研究人员构建了一个视频生成器,并将原本的“注意力”引擎更换成了这个新的“SSM”引擎。他们在三个不同的视频数据集上进行了测试:

  1. MineRL Navigate: 一个机器人在类似《我的世界》(Minecraft)的世界中导航。
  2. GQN-Mazes: 一个机器人在 3D 迷宫中解决问题。
  3. CARLA-Town01: 一个自动驾驶汽车模拟系统。

他们测试了从短片段(16 帧)到长序列(256 帧)不等的视频。

核心发现

1. 长视频的胜出者
在生成短视频(16 帧)时,新的 SSM 方法和旧的注意力机制方法不相上下。然而,一旦尝试生成**长视频(256 帧)**时,SSM 方法显著脱颖而出。

  • 类比: 这就像是在短车道上比较自行车和跑车(两者都行)。但在 200 英里的高速公路上,跑车(SSM)能让你更快到达且更省油,而自行车(注意力机制)则会精疲力竭并减速。
  • 证据: 与注意力模型相比,SSM 模型在消耗更少内存更少时间的同时,生成了更高质量的视频(通过一个称为 FVD 的评分来衡量)。

2. 秘诀:双向交通与智能过滤
研究人员发现,仅仅更换引擎是不够的;他们必须通过两种特定的方式进行微调,才能获得最佳效果:

  • 双向性(双向交通): 标准的 SSM 只能向前看(从过去到未来)。研究人员让模型能够双向观察(既看过去也看未来)。
    • 类比: 想象你在开车。如果你只看挡风玻璃,你可能会错过从侧面驶入的车辆。通过同时观察后视镜(未来语境),AI 能更好地理解整个场景。
  • 选择性扫描(智能过滤): 模型学会了忽略枯燥、重复的帧,转而关注重要的变化。
    • 类比: 想象你在读一本小说。如果连续 10 页都在描述同一个空荡荡的走廊,你会快速略读;但如果有一个角色进入房间,你会仔细阅读。SSM 会自动完成这种操作,保持其“记忆”对重要时刻的敏感度。

总结

这篇论文证明了,在制作长视频时,使用状态空间模型(SSM)是比传统的注意力机制更聪明、更高效的选择。它允许计算机生成更长、更流畅的视频,而无需依赖极其昂贵的硬件,这本质上为研究人员提供了一个绕过长期以来限制视频 AI 发展的内存限制的“作弊码”。

注:本文严格关注技术架构及其在特定数据集上的表现。它并不声称这些模型目前已准备好用于医疗诊断、实时安防或商业电影制作,而是强调它们是处理长时视频生成的更优架构选择。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →