VideoSEMA: a scalable and efficient Mamba-like attention for video understanding
该论文介绍了 VideoSEMA,这是一种可扩展且高效的视频分类模型,它结合了类 Mamba 的分层时空注意力机制与 Softmax 时间注意力机制,在 K400 和 SSv2 基准测试中,证明了其相比现有 Vision Transformer 和 Mamba 模型具有更优越的准确率和分辨率鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人理解一部电影。你不能只给它看一张照片;你必须向它展示一整串随时间变化的图像流。这就是**视频理解(video understanding)**的世界,它是计算机科学的一个分支,旨在让机器学会识别动作,比如有人在削土豆或汽车在转弯。长期以来,实现这一目标的最佳方法是使用一个庞大且“饥肠辘辘”的大脑,叫做 Transformer。你可以把 Transformer 想象成一位超级组织有序的图书管理员,他会同时阅读图书馆里每一本书的每一页,以寻找其中的联系。它非常聪明,但当图书馆(视频)变得太大或书籍(帧)变得过于详细时,它就会感到不堪重负并变得缓慢。
为了解决这个问题,科学家们最近发明了一种新型大脑,叫做 Mamba。如果说 Transformer 是一个同时阅读所有内容的图书管理员,那么 Mamba 就是一名在走廊里穿行、边走边记住线索的侦探,这要快得多。然而,即使是 Mamba,在面对高清晰度或超长视频时也会感到吃力。研究人员面临的一个大问题是:我们能否构建出一个既拥有像沉重的 Transformer 那样聪明,又像新的 Mamba 侦探那样快速高效的视频大脑?这正是论文《VideoSEMA》试图解决的谜题。
本文的作者们与高通 AI 研究院(Qualcomm AI Research)以及加州大学欧文分校(University of California, Irvine)的研究人员合作,构建了一个名为 VideoSEMA 的新模型。他们不仅仅是在锅里加入了一种新食材,而是创造了一个聪明的拆分系统。想象一下你在看一部电影,你有两种不同的注意力观察方式。首先,你观察单个帧(静态图片),并使用一种特殊的、类似于 Mamba 的眼睛,叫做 SEMA。这只眼睛足够聪明,既能观察一小块细节窗口(比如土豆皮的纹理),又能对整个场景进行快速的全局平均,而且不会感到疲劳。然后,为了理解故事是如何移动的,该模型使用一种标准的“软”注意力机制,来观察事物在帧与帧之间是如何变化的。
论文表明,这种拆分方法不仅仅是一个幸运的直觉;他们实际上从数学上证明了,在特定条件下,这种拆分方法与同时观察整个视频的效果是一样好的。当他们在著名的视频数据集上测试 VideoSEMA 时——包括包含 400 种人类动作的 K400 和专注于复杂精细动作的 SSv2——结果令人印象深刻。在 K400 数据集上,VideoSEMA 打败了许多更大、更重的模型,包括其他基于 Mamba 的模型和大型 Transformer,同时使用的计算资源更少。例如,在分辨率为 16 × 224² 时,VideoSEMA 达到了 82.4% 的准确率,超过了之前的 Mamba 模型(VideoMamba,得分为 80.8%),尽管 VideoSEMA 的参数量更少。
最令人兴奋的发现之一是 VideoSEMA 处理高清晰度视频的方式。研究人员测试了在不重新训练模型的情况下,将输入的视频分辨率从 224² 提升到 1024²(这是一个巨大的细节跨越)时会发生什么。旧的 Mamba 模型(VideoMamba)出现了严重的崩溃,准确率从 80.8% 大幅下降到了 40.8%。相比之下,VideoSEMA 表现得稳健得多,仅下降到了 54.6%。这表明 VideoSEMA 在视觉细节变得复杂时具有更强的鲁棒性。他们还发现,在 SSv2 数据集上,VideoSEMA 仅用 8 帧 视频就能达到比其他模型使用 16 帧 才能达到的效果,这证明了它在快速抓取正确信息方面的极高效率。
论文还排除了一些想法。他们测试了使用简单的 3D 卷积(一种观察视频的标准方式)以及一个纯 Mamba 模块来处理视频的时间维度,但发现两者在处理时间维度时都不如使用标准注意力机制的效果好。他们表明,虽然 Mamba 在空间处理方面表现出色,但在处理该特定设置下的时间维度时并不是最佳选择。作者谨慎地指出,虽然他们的模型非常有前景,但仍处于开发阶段。他们建议,对于更长的视频,未来可能需要加入“稀疏”或“空洞”注意力,以在不减慢速度的情况下处理额外的时间维度。但就目前而言,VideoSEMA 为计算机理解周围运动的世界提供了一种强大、高效且可扩展的新途径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。