← 最新论文
💻 computer science

Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding

本文提出了 CausalMem,这是一种无需训练的方法,它通过在线语义基底更新构建了一个动态的、固定预算的记忆库,用以高效地压缩并保留流式视频信息,在流式和离线视频理解任务中均显著优于现有方法,同时实现了超过 20 倍的 Token 压缩。

原作者: Baiyang Song, Yuli Lin, Qiong Wu, Tao Chen, Jun Peng, Xiao Chen, Yiyi Zhou, Rongrong Ji

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Baiyang Song, Yuli Lin, Qiong Wu, Tao Chen, Jun Peng, Xiao Chen, Yiyi Zhou, Rongrong Ji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图用手机观看一段 24 小时直播的新闻节目,但你的手机内存非常小。每当出现一个新场景时,你的手机都会尝试保存一张照片。如果你持续保存每一个帧,你的手机会在几秒钟内耗尽空间,并且会变得非常缓慢,甚至无法回答你关于正在发生什么的问题。

这就是 CausalMem 为观看视频的 AI 模型所解决的问题。

以下是论文通过简单的比喻对它的解释:

问题:“无限滚动” vs. “小背包”

目前的 AI 模型(称为 MLLM)非常擅长理解视频,但在处理流媒体(即随着视频播放,逐帧观看视频)时存在重大缺陷。

  • 问题所在: 随着视频的播放,AI 会试图记住所有事情。这就像是在背着一个背包,每走一步,背包都会变得越来越重。最终,背包太重了(数据量太大),导致 AI 崩溃(内存耗尽)或者移动得太慢,无法回答问题。
  • 难点: 你不能先看完整个视频再决定哪些部分是重要的(不像人类看电影时,看完后再挑选精彩片段)。在直播过程中,你不知道接下来会出现什么。你必须在处理过程中实时做出决策。

解决方案:“聪明的图书管理员”

作者创建了一种名为 CausalMem 的新方法。你可以把它想象成一位管理着一个固定大小书架(“记忆库”)的聪明的图书管理员

  1. 固定的书架: 无论视频有多长(1 分钟还是 10 小时),这个书架只存放特定数量的书(固定预算的“Token”)。它永远不会变大。
  2. “语义基底”(图书管理员的脑中地图): 当新帧到达时,AI 不仅仅是盲目地保存它们。它会构建一个关于它目前为止所见到的主要主题和形状的“脑中地图”。这被称为在线语义基底 (Online Semantic Basis)
    • 类比: 想象图书管理员已经了解了目前故事的大致“氛围”。如果一个新场景只是重复的背景(冗余信息),图书管理员知道:“我已经把这个记在脑子里了,我不需要把它写下来。”
  3. “残差”检查(什么是新的?): 系统会计算“残差”或“剩余”的信息。
    • 类比: 如果新场景只是蓝天,而图书管理员脑中已经有了蓝天的图片,那么“残差”就很小。这个场景是冗余的,会被丢弃。
    • 如果新场景显示了一场突发的爆炸或一个新角色,那么“残差”就会很大。这个场景是具有信息量的,它会在书架上获得一个位置。
  4. “近期性”规则: 系统还记得近期发生的事件非常重要。即使一个场景不是特别独特,但如果它刚刚发生,它会在书架上停留一段时间,这样 AI 就不会忘记现在正在发生的事情。

结果:超高效的记忆

论文声称,通过使用这种“聪明的图书管理员”方法,他们可以:

  • 压缩数据: 他们可以观看 1 小时的视频,并仅使用 12,000 个“Token”(极小的数据量)来存储。与保存所有内容相比,这实现了 20 倍的压缩
  • 节省空间: 使用的内存仅为 82 MB 左右(大约是几张高质量照片的大小),对于一小时的视频来说非常小。
  • 运行更快: 因为 AI 不需要处理数百万帧,所以它回答问题的速度更快,且消耗更少的计算资源。
  • 保持准确: 即使拥有如此微小的记忆,AI 对视频的理解也比其他方法更好。它在直播和预录视频的测试中都获得了更高的分数。

总结

CausalMem 就像是一个正在观看直播的人类大脑。它不会记住每一秒、每一帧的所有细节,而是记住关键时刻新信息以及近期事件,同时忘掉那些无聊、重复的背景。它无需重新训练即可实现这一点,这意味着它可以被插入现有的 AI 模型中,让它们在观看长篇直播视频时表现得更加出色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →