OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs
OmniMem 是一个面向音视频大语言模型的内存高效流式框架,它通过采用模态感知分配策略和扰动感知内存选择,克服了长视频推理的局限性,并在严格的内存预算下显著提高了准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图用一部存储空间非常有限的小型智能手机观看一部 3 小时的电影。随着电影的播放,你的手机试图记住每一帧画面和每一句对话。最终,手机会耗尽内存,导致死机,或者不得不随机删除某些内容以腾出空间。这正是现代“音视频大语言模型”(能够观看视频并聆听音频的 AI)在尝试理解长视频时面临的问题。
这篇论文介绍了一个名为 OmniMem 的新系统来解决这个问题。你可以把 OmniMem 想象成一个为 AI 的记忆提供服务的、超级聪明且组织有序的图书管理员。
以下是它的工作原理,通过简单的概念进行拆解:
1. 问题所在:“一刀切”的错误
目前的 AI 系统在将视频(你看到的)和音频(你听到的)保存到记忆中时,对待它们的方式完全一样。
- 失衡: 在一段典型的视频中,存在着数以千计的视觉“标记”(token,即微小的图像数据碎片),但只有少量的音频标记(单词或声音)。
- 缺陷: 如果使用标准的记忆限制,AI 最终会囤积大量冗余的视觉细节(比如一个静止的背景),却不小心丢弃了至关重要的音频线索(比如角色说:“看你身后!”)。这就像是你的背包里装了 100 颗一模一样的石子,却唯独没地方放一张重要的地图。
2. 解决方案:OmniMem 的两路策略
OmniMem 通过使用两个主要技巧来修复这个问题:独立口袋和智能选择。
技巧 A:独立口袋(音视频预算分配)
OmnigMem 没有使用一个巨大的记忆桶,而是给了 AI 两个独立的口袋:一个用于视觉,一个用于音频。
- 类比: 想象一位正在烹饪复杂菜肴的厨师。他们不会把所有食材都扔进一个巨大的锅里。他们会将香料放在一个小巧珍贵的罐子里,而将蔬菜放在一个大的储物箱里。
- 工作原理: OmniMem 意识到音频虽然稀少但价值极高,而视觉信息虽然丰富但往往具有重复性。它为音频“口袋”分配了特定且公平的内存量,以确保重要的 spoken words(说话内容)不会因为图片太多而被删除。
技巧 B:智能选择(扰动感知记忆)
一旦 AI 拥有了这些记忆口袋,它就需要决定在视频播放过程中保留什么、丢弃什么。旧的方法仅仅观察两个事物之间的相似程度(例如,“这两个帧看起来一样,所以删掉一个”)。
- 旧方法的缺陷: 仅仅因为两个帧看起来相似,并不意味着它们不重要。也许那个“无聊”的帧包含了一个 AI 稍后会需要的微妙线索。
- OmniMem 的方法: OmniMem 会问一个“如果……会怎样?”的问题。它模拟删除一部分记忆,并询问:“如果我删除了这个,AI 的答案会改变吗?”
- 如果删除一个标记会导致 AI 感到困惑或改变主意,OmniMem 就会保留它。
- 如果删除一个标记没有任何影响,OmniMem 就会把它丢弃。
- 类比: 这就像是在剪辑电影。一个糟糕的剪辑师根据镜头长短来剪辑。OmniMem 则是一位聪明的剪辑师,他根据场景是否对故事完整性有贡献来进行剪辑。他保留那些“剧情转折”的场景,并删除那些“漫长走廊”的场景,即便那条走廊看起来很漂亮。
3. “训练”红利
论文还提到,如果你专门教 AI 如何使用这些新的记忆规则(这个过程称为“微调”),它会变得更加出色。
- 类比: 给 AI 一套新的规则就像是给学生一份新的学习指南。如果你随后使用这些规则给他们一份模拟测试,他们就能学会如何更高效地整理笔记,从而在有限的空间内榨取更多的价值。
结果
研究人员在几个长视频基准测试(如 VideoMME 和 LVBench)上测试了 OmniMem。
- 结果: 在没有任何额外训练的情况下,OmniMem 的准确率比之前的顶尖方法高出 2–4%。
- 配合训练: 在 AI 学习了这些新的记忆规则后,它又获得了 1–2% 的准确率提升。
- 效率: 它在实现这一切的同时,并没有减慢 AI 的速度,也没有消耗显著更多的计算资源。
总结
OmniMem 是一种让 AI 在观看长视频时不再耗尽“脑力”的新方法。它不再将音频和视频视为同类事物,而是为它们各自提供了记忆空间,并且只删除那些它确定不会错过的信息。其结果是,相比以往,这种 AI 能够更准确地理解长达数小时的视频内容。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。