← 最新论文
💻 computer science

Linear Scaling Video VLMs for Long Video Understanding

该论文介绍了 StateKV,这是一种推理时方法,使预训练的视频视觉语言模型能够通过固定容量的循环状态实现线性时间视频预填充,在无需架构更改或微调的情况下,显著提升了现有流式近似方法的扩展性和准确性。

原作者: Cristobal Eyzaguirre, Jiajun Wu, Juan Carlos Niebles

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Cristobal Eyzaguirre, Jiajun Wu, Juan Carlos Niebles

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

问题所在:“记忆过载”的 AI

想象一下,你正和一位朋友一起看电影,这位朋友拥有过目不忘的摄影式记忆,但其记忆方式非常特殊。每当一个新场景(帧)播放时,你的朋友不仅是在看新的场景,他们还会同时重新观看从电影开始以来的每一个场景,以观察新场景如何与旧场景相连。

  • 电影: 一段长视频(比如 1 小时的行车记录或一场完整的体育赛事)。
  • 朋友: 视频视觉语言模型(VLM),一种能够观看视频并回答相关问题的 AI。
  • 问题: 如果电影长 10 分钟,你的朋友在每一秒钟都要重看 10 分钟的素材;如果电影长 1 小时,他们每秒钟都要重看 1 小时的素材。

这就是所谓的二次方缩放(Quadratic Scaling)。随着视频变长,你朋友需要做的工作量呈爆炸式增长。这就像是在读一本书,为了理解第 100 页的内容,你每次翻页都必须把第 1 页到第 99 页全部重读一遍。最终,这项任务将变得无法实时完成。

旧有的解决方案:“摘要书”

为了解决这个问题,之前的方法试图通过让“朋友”变得更聪明来通过总结电影。

  • 方法: “我们只记住最近的 5 分钟,”或者“我们扔掉 90% 的帧,只保留最重要的那些。”
  • 缺陷: 这就像要求你的朋友写一份电影摘要,但只保留最近的几句话。他们可能会错过 20 分钟前的一个关键情节,而那个情节恰好解释了现在的状况。或者,如果他们扔掉了太多帧,就会丢失回答复杂问题所需的细节。这是一个权衡:你节省了时间,但失去了准确性。

新的解决方案:StateKV(“智能助手”)

作者引入了一种名为 StateKV 的新方法。与其强迫 AI 重看所有内容或丢弃信息,不如给它一个拥有特殊双层记忆系统的智能助手

把 AI 想象成一名正在观看 1 小时监控录像并试图破解谜团的侦探。

1. “详细笔记本”(红缓存/Red Cache)

AI 保留着目前为止看到的每一帧的完整、详细的笔记本。它不会丢弃任何东西。当侦探(AI)需要撰写最终报告(回答问题)时,它可以翻阅整本笔记本来寻找所需的精确细节。这确保了最终答案的准确性。

2. “口袋小抄”(蓝状态/Blue State)

这是神奇的魔术所在。当 AI 正在观看 视频(处理流媒体)时,它无法在脑海中携带整本笔记本。因此,它使用了一张小巧的口袋小抄

  • 运作方式: 在视频播放时,AI 会观察新场景,并询问自己:“过去的哪些部分对于理解这个新场景实际上是重要的?”
  • 筛选: 它会从过去挑选出极少数“超级重要”的时刻(称为时间汇点/temporal sinks),并将它们写在小抄上。这可能是一个 10 分钟前出现的特定人物面部,或者是一个特定的音效。
  • 更新: 当下一个场景到来时,AI 会更新小抄。它保留那些仍然相关的关键信息,并替换掉不再需要的内容,从而为新的重要细节腾出空间。

结果: 在观看过程中,AI 只需要针对这张小巧的小抄来对比新场景。这使得无论视频多长,其处理工作量都保持恒定。这就像侦探在观看时只需要瞥一眼一张 3 英寸的索引卡片就能紧跟剧情,而不需要重读整本书。

为什么这意义重大

论文声称 StateKV 取得了三大胜利:

  1. 快速且线性: 因为 AI 在观看时只需检查这张小巧的小抄,所以处理视频所需的时间呈线性增长(1 小时的处理时间是 30 分钟的两倍,而不是爆炸式增长)。它不会像旧方法那样失控。
  2. 准确: 与那些丢弃数据的旧有“摘要”方法不同,StateKV 在给出最终答案时保留了完整的笔记本。它只是简化了观看的过程,而不是简化了结果
  3. 比“近期性”更聪明: 旧方法通常只是说,“记住最近的 5 分钟。”StateKV 则更聪明;它会说,“记住最重要的时刻,即使它们发生在 40 分钟前。”论文表明,AI 会自然地聚焦于这些特定的“锚点”时刻,而 StateKV 完美地捕捉到了它们。

“预算”类比

想象你有一笔固定的资金(计算能力)用来买车。

  • 旧方法: 你买了一辆小型的、廉价的汽车(小型 AI 模型),它跑得快,但不能装载太多行李(低准确度)。
  • StateKV 方法: 由于 StateKV 非常高效,你节省了足够的钱来购买一辆巨大的豪华 SUV(更大型、更聪明的 AI 模型),它能携带大量的行李(高准确度),而花费却与那辆小车一样。

总结

StateKV 是一种让 AI 能够实时观看长达一小时的视频而不产生“脑雾”的方法。它通过使用一个动态的小型摘要在观看时紧跟剧情,同时保留一份详细的完整记录以便稍后回答问题。它比旧方法更快,也比“只记住最近几分钟”的方法更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →