想象一下,你正试图用手机观看一段 24 小时直播的新闻节目,但你的手机内存非常小。每当出现一个新场景时,你的手机都会尝试保存一张照片。如果你持续保存每一个帧,你的手机会在几秒钟内耗尽空间,并且会变得非常缓慢,甚至无法回答你关于正在发生什么的问题。
这就是 CausalMem 为观看视频的 AI 模型所解决的问题。
以下是论文通过简单的比喻对它的解释:
问题:“无限滚动” vs. “小背包”
目前的 AI 模型(称为 MLLM)非常擅长理解视频,但在处理流媒体(即随着视频播放,逐帧观看视频)时存在重大缺陷。
- 问题所在: 随着视频的播放,AI 会试图记住所有事情。这就像是在背着一个背包,每走一步,背包都会变得越来越重。最终,背包太重了(数据量太大),导致 AI 崩溃(内存耗尽)或者移动得太慢,无法回答问题。
- 难点: 你不能先看完整个视频再决定哪些部分是重要的(不像人类看电影时,看完后再挑选精彩片段)。在直播过程中,你不知道接下来会出现什么。你必须在处理过程中实时做出决策。
解决方案:“聪明的图书管理员”
作者创建了一种名为 CausalMem 的新方法。你可以把它想象成一位管理着一个固定大小书架(“记忆库”)的聪明的图书管理员。
- 固定的书架: 无论视频有多长(1 分钟还是 10 小时),这个书架只存放特定数量的书(固定预算的“Token”)。它永远不会变大。
- “语义基底”(图书管理员的脑中地图): 当新帧到达时,AI 不仅仅是盲目地保存它们。它会构建一个关于它目前为止所见到的主要主题和形状的“脑中地图”。这被称为在线语义基底 (Online Semantic Basis)。
- 类比: 想象图书管理员已经了解了目前故事的大致“氛围”。如果一个新场景只是重复的背景(冗余信息),图书管理员知道:“我已经把这个记在脑子里了,我不需要把它写下来。”
- “残差”检查(什么是新的?): 系统会计算“残差”或“剩余”的信息。
- 类比: 如果新场景只是蓝天,而图书管理员脑中已经有了蓝天的图片,那么“残差”就很小。这个场景是冗余的,会被丢弃。
- 如果新场景显示了一场突发的爆炸或一个新角色,那么“残差”就会很大。这个场景是具有信息量的,它会在书架上获得一个位置。
- “近期性”规则: 系统还记得近期发生的事件非常重要。即使一个场景不是特别独特,但如果它刚刚发生,它会在书架上停留一段时间,这样 AI 就不会忘记现在正在发生的事情。
结果:超高效的记忆
论文声称,通过使用这种“聪明的图书管理员”方法,他们可以:
- 压缩数据: 他们可以观看 1 小时的视频,并仅使用 12,000 个“Token”(极小的数据量)来存储。与保存所有内容相比,这实现了 20 倍的压缩。
- 节省空间: 使用的内存仅为 82 MB 左右(大约是几张高质量照片的大小),对于一小时的视频来说非常小。
- 运行更快: 因为 AI 不需要处理数百万帧,所以它回答问题的速度更快,且消耗更少的计算资源。
- 保持准确: 即使拥有如此微小的记忆,AI 对视频的理解也比其他方法更好。它在直播和预录视频的测试中都获得了更高的分数。
总结
CausalMem 就像是一个正在观看直播的人类大脑。它不会记住每一秒、每一帧的所有细节,而是记住关键时刻、新信息以及近期事件,同时忘掉那些无聊、重复的背景。它无需重新训练即可实现这一点,这意味着它可以被插入现有的 AI 模型中,让它们在观看长篇直播视频时表现得更加出色。
技术摘要:用于高效流式视频理解的 CausalMem
问题陈述
当前的视觉语言大模型(MLLMs)在流式视频理解方面面临着显著挑战。这些困难主要源于两个因素:
- 无界限的 Token 增长: 流式场景涉及潜在无限长的视频,这会导致视觉 Token 的线性累积,从而超过现有 MLLM(例如,以 1 FPS 处理两小时视频会生成超过 70 万个 Token)的上下文限制和内存预算。
- 不可预测性: 与离线处理不同,流式视频无法预先获取未来的帧或用户查询。这使得基于全局冗余度的压缩方法和文本引导的估计策略失效,因为这些方法需要非因果性的信息。
现有的解决方案(如 KV 缓存压缩或 Token 修剪)通常依赖于全局视频访问或特定的查询引导,无法提供一种在严格因果律下运行的动态、固定预算的记忆机制。
方法论:CausalMem
本文提出了 CausalMem,这是一种创新的、无需训练的方法,旨在构建一个动态但固定预算的视觉记忆库。该方法在严格的因果律下运行,这意味着它按顺序处理帧,而无需预知未来的内容。其核心机制由两个主要部分组成:
1. 在线语义基底 (Online Semantic Basis)
为了在没有未来知识的情况下估计传入视觉 Token 的冗余度,CausalMem 维护了一个在线语义基底 (B),用于动态建模观察到的视频流的主要语义。
- 初始化: 基底通过对第一帧视觉 Token 进行紧凑的奇异值分解(SVD)来初始化,以提取主要的语义向量。
- 动态更新: 随着新帧的到达,视觉 Token 被投影到当前基底上。残差(原始 Token 与其重构之间的差异)代表了新颖的信息。
- 具有较大残差(低冗余度)的 Token 被选为候选对象。
- 这些候选对象经过 QR 分解以提取新的正交基向量。
- 基底通过保留前 q 个最活跃的向量进行更新,其中活跃度是通过瞬时激活得分的指数移动平均来追踪的。这确保了基底能够适应不断演变的语义,同时保持紧凑性。
2. 动态视觉记忆库 (Dynamic Visual Memory Bank)
CausalMem 维护一个具有预定义 Token 预算 (b) 的固定大小记忆库 (M)。
- 插入: 当前帧的新视觉 Token 会被临时添加到记忆库中。
- 压缩与选择: 如果记忆库超过预算,Token 将根据两个因素进行保留评分:
- 冗余度得分: 基于 Token 相对于在线语义基底的残差范数进行计算。具有更高残差(更有信息量)的 Token 更受青睐。
- 时间近期性: 基于 Token 时间戳的得分,以确保记忆能平滑地适应演变的流。
- 更新: 保留得分最高的 Token 以形成更新后的记忆库,而将其余 Token 丢弃。这确保了记忆库始终包含在固定预算内最具信息量且在时间上最相关的 Token。
核心贡献
- 新颖视角: 本研究通过严格因果律下的动态、固定预算记忆库这一视角,来探讨高效的流式视频理解,解决了现有离线或依赖查询方法的局限性。
- 无需训练的机制: CausalMem 是一种即插即用的方法,无需重新训练底层 MLLM。它利用在线语义基底来估计冗余度并动态更新记忆库。
- 效率与保留: 该方法实现了极高的视觉 Token 压缩率(例如,对于长达一小时的视频,压缩率 >20×),同时保留了主要语义,并在固定的存储占用(例如,1.2 万个 Token 约为 82 MB)内运行。
实验结果
作者在两个具有代表性的 MLLM(LLaVA-OneVision 和 Qwen2.5-VL)上验证了 CausalMem 在流式和离线基准测试中的表现。
- 流式基准测试: 在 OVO-Bench 和 StreamingBench 上,CausalMem 的平均准确率分别比基线提升了 +3.2% 和 +3.0%,表现优于现有的流式方法,如 StreamingTOM、LiveVLM 和 ReKV。
- 离线基准测试: 即使在严格因果律条件下应用于离线任务(模拟流式条件),CausalMem 也展示了卓越的性能,在 Video-MME、MLVU、LongVideoBench 和 LVBench 上优于专门的离线压缩方法。
- 效率: 与允许 Token 数量线性增长的基线相比,该方法显著降低了 GPU 显存开销和推理时间。它能更好地随帧数增加而扩展,保持稳定的推理时间。
- 与 SOTA 对比: 当应用于 Qwen2.5-VL 时,该方法在特定流式基准测试上的表现达到了与先进的商业模型(如 Gemini 1.5 Pro 和 GPT-4o)相当甚至更高的水平。
重要性与主张
论文声称 CausalMem 成功解决了现有 MLLM 在高效流式视频理解方面的“棘手问题”。其重要性在于:
- 计算有界: 它使得处理任意长度的视频流成为可能,且具有有界的计算和存储开销,这是现实世界流式应用的关键要求。
- 语义保留: 通过利用在线语义基底,该方法在有限的记忆空间内最大化了信息增益,有效地模仿了人类大脑过滤冗余并保留显著信息的能力。
- 泛化性: 作为一种无需训练的方法,它可以轻松集成到各种 MLLM 中,以增强其流式处理能力,而无需进行大规模微调或架构更改。
作者总结道,CausalMem 提供了一种稳健的解决方案,用于维持一个紧凑且富有信息量的视觉记忆,使 MLLM 能够有效地应对流式视频内容的动态特性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。