StreamingVLM: Real-Time Understanding for Infinite Video Streams
StreamingVLM 是一个统一的视觉语言模型框架,它通过一种新颖的 KV 缓存复用策略以及在重叠分块上的监督微调,使训练与流式推理保持一致,从而实现了对无限视频流的实时、稳定的理解,在保持低延迟的同时,在长时视频基准测试中达到了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在电话里向朋友描述一场正在进行的体育比赛。你想告诉他此时此刻正在发生的一切——进球、犯规、庆祝动作——而且要做到不遗漏任何细节,并且想在接下来的几个小时里持续这样做,既不会感到大脑疲劳,也不会忘记第一个进球是谁踢进的。
这就是 StreamingVLM 为计算机解决的问题。
问题所在:计算机会被信息淹没
目前的视频理解 AI 模型(称为视觉语言模型,Vision-Language Models)就像是在试图阅读一本书的学生:
- “全神贯注型”学生: 这个学生每当想说一句话时,都会试图从第 1 页读到第 1,000 页。随着书的内容变长,阅读速度会变得极慢,最终学生会因为“桌面空间”(内存)不足而崩溃。
- “滑动窗口型”学生: 这个学生只看最近的几页。如果他需要回忆第 10 页的内容,他就必须一遍又一遍地翻回去重读那些页面。这不仅速度慢,还会让他丢失故事的连贯性。
当面对“无限长”的视频(比如永不停止的直播)时,这两种方法都会失效。
解决方案:StreamingVLM
作者创造了一种新的 AI,叫做 StreamingVLM。你可以把它想象成一位极其高效的体育解说员,他拥有一套特殊的笔记整理方法。
以下是它的工作原理,我们使用简单的类比来解释:
1. “笔记本”技巧 (KV Cache)
StreamingVLM 并没有试图记住整场比赛或仅仅是过去 5 秒的内容,而是使用了一套聪明的笔记本系统:
- “锚点” (Attention Sks): 它保留了一些来自开场阶段的关键笔记(比如球队名称和开球时的比分),这样它就永远不会忘记“谁”在比赛。
- “近期历史” (Text Window): 它保留了它刚刚说过的一长串话,以便记住对话的流向。
- “实时动作” (Vision Window): 它只保留过去几秒钟内的视觉细节(比如球员的奔跑、球的移动),因为这些才是“当下”最重要的信息。
较旧的视觉细节(比如 10 分钟前的某个回合)会被温和地丢弃以腾出空间给新的细节,但“锚点”和“近期历史”会始终安全保留。这使得无论视频多长,计算机的内存占用都能保持在低水平且稳定。
2. “训练”技巧
如果你在训练期间只给 AI 看 1 分钟的短片,你无法教会它观看一场 10 小时的比赛。作者用一个巧妙的方法解决了这个问题:
- 他们向 AI 展示了短小的、相互重叠的体育比赛片段(例如时长 24 秒、重叠部分为 12 秒的片段)。
- 他们教会了 AI 去关注这个短小片段内的“一切”。
- 因为这些片段是重叠的,AI 学会了如何将一个片段的结尾与下一个片段的开头连接起来,从而有效地学会了如何在没有看过完整 10 小时视频的情况下,处理连续不断的视频流。
3. “编号”技巧 (Contiguous RoPE)
通常情况下,当你从笔记本中删除旧页面时,页码会变得混乱(比如:第 1, 2, 3 页……然后突然跳到了第 100 页)。这会让 AI 感到困惑。StreamingVLM 使用了一种特殊的“重新编号”系统。当它删除旧的视觉数据时,它会立即对剩余的页面进行重新标记,使它们依然按照 1, 2, 3, 4……这样的顺序排列。这让 AI 不会因为删减数据而对事情发生的“时间点”产生混淆,即使是在观看数小时的视频后也是如此。
结果:马拉松选手
团队在一个名为 Inf-Streams-Eval 的新基准测试上测试了这款新 AI,该测试包含平均时长超过 2 小时 的体育比赛。
- 速度: 它能以实时速度(约每秒 8 帧)在单个强大的计算机芯片上观看并讲解比赛。它不会出现延迟。
- 内存: 它可以持续解说超过 3 小时,既不会忘记比赛开场时的内容,也不会崩溃。
- 质量: 在与顶尖模型(如 GPT-4o mini)的正面交锋中,StreamingVLM 的胜率达到了 66%。它的表达更自然,对比赛的记忆也更深刻。
- 加分项: 尽管它们仅针对体育解说进行了训练,但该模型在回答通用视频问题方面也表现得更好,这证明了该方法是对视频理解能力的全面升级。
总结
StreamingVLM 就像是一位拥有神奇记忆力的、不知疲倦的体育解说员。它记得比赛的开始,专注于当下发生的激烈动作,并能为了节省空间而适时忘掉 10 分钟前那些无聊的部分。这使得它能够实时观看并描述无限长的视频流,而这在以前是计算机无法做到的,否则会被信息量压垮。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。