问题所在:“记忆过载”的 AI
想象一下,你正和一位朋友一起看电影,这位朋友拥有过目不忘的摄影式记忆,但其记忆方式非常特殊。每当一个新场景(帧)播放时,你的朋友不仅是在看新的场景,他们还会同时重新观看从电影开始以来的每一个场景,以观察新场景如何与旧场景相连。
- 电影: 一段长视频(比如 1 小时的行车记录或一场完整的体育赛事)。
- 朋友: 视频视觉语言模型(VLM),一种能够观看视频并回答相关问题的 AI。
- 问题: 如果电影长 10 分钟,你的朋友在每一秒钟都要重看 10 分钟的素材;如果电影长 1 小时,他们每秒钟都要重看 1 小时的素材。
这就是所谓的二次方缩放(Quadratic Scaling)。随着视频变长,你朋友需要做的工作量呈爆炸式增长。这就像是在读一本书,为了理解第 100 页的内容,你每次翻页都必须把第 1 页到第 99 页全部重读一遍。最终,这项任务将变得无法实时完成。
旧有的解决方案:“摘要书”
为了解决这个问题,之前的方法试图通过让“朋友”变得更聪明来通过总结电影。
- 方法: “我们只记住最近的 5 分钟,”或者“我们扔掉 90% 的帧,只保留最重要的那些。”
- 缺陷: 这就像要求你的朋友写一份电影摘要,但只保留最近的几句话。他们可能会错过 20 分钟前的一个关键情节,而那个情节恰好解释了现在的状况。或者,如果他们扔掉了太多帧,就会丢失回答复杂问题所需的细节。这是一个权衡:你节省了时间,但失去了准确性。
新的解决方案:StateKV(“智能助手”)
作者引入了一种名为 StateKV 的新方法。与其强迫 AI 重看所有内容或丢弃信息,不如给它一个拥有特殊双层记忆系统的智能助手。
把 AI 想象成一名正在观看 1 小时监控录像并试图破解谜团的侦探。
1. “详细笔记本”(红缓存/Red Cache)
AI 保留着目前为止看到的每一帧的完整、详细的笔记本。它不会丢弃任何东西。当侦探(AI)需要撰写最终报告(回答问题)时,它可以翻阅整本笔记本来寻找所需的精确细节。这确保了最终答案的准确性。
2. “口袋小抄”(蓝状态/Blue State)
这是神奇的魔术所在。当 AI 正在观看 视频(处理流媒体)时,它无法在脑海中携带整本笔记本。因此,它使用了一张小巧的口袋小抄。
- 运作方式: 在视频播放时,AI 会观察新场景,并询问自己:“过去的哪些部分对于理解这个新场景实际上是重要的?”
- 筛选: 它会从过去挑选出极少数“超级重要”的时刻(称为时间汇点/temporal sinks),并将它们写在小抄上。这可能是一个 10 分钟前出现的特定人物面部,或者是一个特定的音效。
- 更新: 当下一个场景到来时,AI 会更新小抄。它保留那些仍然相关的关键信息,并替换掉不再需要的内容,从而为新的重要细节腾出空间。
结果: 在观看过程中,AI 只需要针对这张小巧的小抄来对比新场景。这使得无论视频多长,其处理工作量都保持恒定。这就像侦探在观看时只需要瞥一眼一张 3 英寸的索引卡片就能紧跟剧情,而不需要重读整本书。
为什么这意义重大
论文声称 StateKV 取得了三大胜利:
- 快速且线性: 因为 AI 在观看时只需检查这张小巧的小抄,所以处理视频所需的时间呈线性增长(1 小时的处理时间是 30 分钟的两倍,而不是爆炸式增长)。它不会像旧方法那样失控。
- 准确: 与那些丢弃数据的旧有“摘要”方法不同,StateKV 在给出最终答案时保留了完整的笔记本。它只是简化了观看的过程,而不是简化了结果。
- 比“近期性”更聪明: 旧方法通常只是说,“记住最近的 5 分钟。”StateKV 则更聪明;它会说,“记住最重要的时刻,即使它们发生在 40 分钟前。”论文表明,AI 会自然地聚焦于这些特定的“锚点”时刻,而 StateKV 完美地捕捉到了它们。
“预算”类比
想象你有一笔固定的资金(计算能力)用来买车。
- 旧方法: 你买了一辆小型的、廉价的汽车(小型 AI 模型),它跑得快,但不能装载太多行李(低准确度)。
- StateKV 方法: 由于 StateKV 非常高效,你节省了足够的钱来购买一辆巨大的豪华 SUV(更大型、更聪明的 AI 模型),它能携带大量的行李(高准确度),而花费却与那辆小车一样。
总结
StateKV 是一种让 AI 能够实时观看长达一小时的视频而不产生“脑雾”的方法。它通过使用一个动态的小型摘要在观看时紧跟剧情,同时保留一份详细的完整记录以便稍后回答问题。它比旧方法更快,也比“只记住最近几分钟”的方法更聪明。
技术摘要:面向长视频理解的线性缩放视频视觉语言模型 (StateKV)
1. 问题陈述
视频视觉语言模型(VLMs)对于长时程和流式应用(如自动驾驶和具身智能机器人)正变得日益重要,这些应用需要整合长达数分钟甚至数小时的证据。然而,存在一个根本性的瓶颈:标准 VLM 处理长视频的计算成本随帧数(N)呈二次方(O(N2))增长。这是因为主流架构依赖于时空自注意力机制,其中每一帧都会关注之前所有的视频 Token。
现有的效率策略试图缓解这一问题,但效果各异:
- 对帧或 Token 进行采样: 减少输入规模通常会导致性能显著下降,除非保留很大比例的 Token(例如约 60%)。
- 压缩 KV 缓存: 激进的压缩可能会丢失进行推理所需的时空线索。
- 滑动窗口/基于近时性的启发式方法: 例如 ReKV 方法,通过使用固定窗口的近期帧来顺序处理帧。虽然这些方法将预填充(prefill)复杂度降低到了线性(O(N)),但它们依赖于一种权宜性的假设,即最相关的信息总是最近的,这往往无法捕捉复杂推理所需的长程依赖关系。
挑战在于如何在不牺牲全自注意力精度、且不需要改变架构或进行微调的前提下,实现线性时间视频预填充(即每帧成本恒定)。
2. 方法论:StateKV
作者引入了 StateKV,这是一种推理时方法,旨在使冻结的预训练长视频 VLM 能够实现线性时间的视频预填充。其核心洞察在于,预训练 VLM 中的长视频注意力具有高度的结构性:虽然大多数交互发生在帧内,但长程时间交互集中在极少数“时间汇点”(temporal sink)Token 上,这些 Token 随时间演变缓慢。
核心假设
StateKV 基于关于预训练 VLM 注意力的两个经验性假设:
- 帧间注意力的集中性: 对于任何给定的帧,大部分有用的跨帧注意力质量都集中在极少数历史 Token(K≪N)上,无论视频总长度如何。
- 时间状态的缓慢演变: 这些“汇点”Token 的集合演变缓慢。第 n+1 帧的有效状态可以用第 n 帧的状态结合第 n+1 帧的 Token 来很好地近似。
架构与机制
StateKV 通过每个 Transformer 层中的双缓存结构运行,同时保持主干网络冻结:
- 详细状态 (Dn): 一个全长缓存,存储处理过的每一帧的所有视觉 Token。该缓存在预填充阶段从不被查询,但在最终的文本解码阶段会被保留,以确保在生成过程中不会丢失信息。
- 压缩状态 (Cn): 一个固定容量的循环状态(例如 1024 个 Token),仅在视频预填充阶段用于近似跨帧交互。
处理流程:
- 流式预填充: 随着帧的到达,模型增量处理它们。第 n 帧会关注当前帧的 Token 与来自第 n−1 帧的压缩状态的拼接结果。
- 基于重要性的选择: 处理完第 n 帧后,更新压缩状态。模型计算所有候选 Token(前一压缩状态 + 当前帧 Token)的注意力得分(仅限视频部分)。模型选择前 B 个 Token(其中 B 是固定预算)来构成新的压缩状态 Cn,并剔除低重要性的条目。
- 解码: 所有帧处理完毕后,开始标准的自回归文本生成。至关重要的是,解码过程以详细状态 (DN) 为条件,该状态包含了所有原始视频 Token,从而确保生成阶段能够获取完整的上下文。
这种设计将视频编码的复杂度(线性,O(N))与最终生成的保真度(全上下文)解耦。
3. 核心贡献
- 无需微调的线性时间预填充: StateKV 使冻结的预训练 VLM 能够以线性计算复杂度(O(N))和恒定的单帧成本处理长视频,且无需修改架构或重新训练。
- 全注意力的原则性近似: 不同于依赖近期性的滑动窗口方法,StateKV 使用基于重要性的机制来传递“时间汇点”。这提供了一种更具原则性的全自注意力近似,能够捕捉到滑动窗口方法所忽略的长程依赖。
- 计算与精度的权衡: 通过大幅减少视频预填充所需的 FLOPs,StateKV 允许从业者在相同的计算预算内运行更大的模型。论文证明,使用 StateKV 的更大模型可以在相似或更低的计算成本下,表现优于使用全自注意力的较小模型。
- 经验验证: 该方法在三个长视频基准测试(VideoMME, MLVU, OVOBench)以及涵盖三个系列(InternVL3, Qwen-VL, Eagle2.5)和多种规模(1B 到 8B 参数)的七个模型上得到了验证。
4. 结果
- 准确率 vs. 全自注意力: 在所有基准测试和模型规模下,StateKV 的表现均接近全自注意力(Full SA)性能。平均而言,其精度保持在 Full SA 的 1% 左右,显著优于像 ReKV 这样基于滑动窗口的基准方法(后者通常落后约 10 个百分点)。
- 优于基于近期性的方法: StateKV 在 VideoMME、MLVU 和 OVOBench 上始终优于 ReKV(一种主流的滑动窗口方法)。作者将其归因于 VLM 的长程注意力模式并非纯粹基于近期性,而是依赖于来自远处帧的持久“锚点”,而滑动窗口会丢弃这些锚点。
- 缩放行为: 随着压缩状态容量 (B) 的增加,性能呈单调提升。较大的模型表现出更强的随缓存大小缩放的能力,在较高的预算下往往能达到与 Full SA 相当的准确率。
一旦完成所有帧的处理,标准自回归文本生成便开始。至关重要的是,解码过程以详细状态 (DN) 为条件,该状态包含了所有原始视频 Token,从而确保生成阶段能够获取完整的上下文。
5. 意义与主张
本文将 StateKV 定位为迈向可扩展长视频理解的务实步骤。其意义在于:
- 赋能实时流式处理: 通过实现恒定的单帧成本,StateKV 消除了目前制约长视频实时流式应用(例如:汽车行驶一小时后的查询难度会比刚开始行驶时大得多)的二次方瓶颈。
- 重新定义计算前沿: 该方法将范式从“为了适应而压缩”转变为“为了近似而压缩”。它证明了基于重要性的记忆保留是比严格的近期性更强的全注意力近似,从而在固定的计算预算下实现更高的准确率。
- 泛化性: 该方法在不需要模型特定微调的情况下,能够一致地迁移到不同的模型家族和参数规模,表明其底层的注意力结构(时间汇点)是当前预训练 VLM 的一种鲁棒属性。
作者承认了局限性,指出目前的机械验证主要限于现有模型和测试输入。他们建议未来的工作应探索这些注意力模式是否在更广泛的骨干网络和视频领域中同样成立。然而,在已测试的范围内,StateKV 为长视频缩放问题提供了一个稳健且无需训练的解决方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。