Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval
本文提出了视觉代理记忆(VAM),这是一个无需训练的框架,通过选择性索引、分层记忆组织和代理检索来增强在线长视频理解能力,通过将视觉记忆视为一种显式、可检查和可查询的基底,在 OVO-Bench 和 MM-Lifelong 等基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你试图记住一次为期 50 天的假期中发生的所有事情。如果你试图在脑海中同时保留每一秒的视频画面,你的大脑就会崩溃。如果你只记住“大意”(例如,“我们去了海滩”),你可能会忘记你掉落冰淇淋的具体时刻,从而无法证明它究竟发生在何时。
本文介绍了视觉代理记忆(Visual Agentic Memory, VAM),这是一种让计算机处理长视频而不至于不堪重负或丢失真相的新方法。请将 VAM 想象成不是一个存储一切的大硬盘,而是一位智能、主动的图书管理员,它实时观看视频流,并为你构建一个可搜索的图书馆。
以下是其工作原理,分为三个简单部分:
1. “智能过滤器”(在线索引)
想象一位站在博物馆入口的保安。大多数人只是做着同样的事情走过(比如静止站立或缓慢行走)。保安不需要给每个人拍一张照片。
- VAM 的做法:随着视频播放,VAM 就像这位保安。它忽略模糊的帧或没有任何变化的时刻(冗余)。只有当发生新事物或重要事件时,它才“拍照”(存储一帧)。
- 结果:它不再存储数百万帧,而是只保留最有趣的帧,就像一个精选集,但仍包含原始的高质量证据。
2. “有序的档案柜”(分层记忆)
既然图书管理员有了照片,他们如何整理它们?你不能只是把它们扔成一堆。
- VAM 的做法:它将这些照片分组为“事件”(就像书中的章节)。
- 摘要:对于每个章节,它会写一段简短的文字摘要(例如,“团队在下午 2 点开了会”)。这有助于你快速找到正确的章节。
- 证据:关键在于,它还将来自该章节的实际照片保存在单独的文件夹中。
- 类比:这就像拥有一个目录(摘要),指引你找到确切的页面(原始照片),以便你自己核实细节。这防止了计算机仅基于压缩摘要进行猜测。
3. “侦探代理”(代理检索)
当你提出一个问题(例如,“车祸发生时那辆车是什么颜色的?”)时,普通的人工智能可能会仅凭记忆猜测。VAM 使用一位侦探。
- VAM 的做法:侦探不会立即回答。它遵循一个严格的流程:
- 搜索:它查看“目录”以找到正确的章节。
- 检查:它从该章节中取出实际照片,仔细查看那辆车。
- 核实:它双重检查证据,确保自己没有产生幻觉。
- 回答:只有在看到证据后,它才给你答案,并明确指出它看到了哪张照片。
- 好处:这阻止了人工智能编造内容。如果证据不存在,侦探会承认,而不是编造故事。
为什么这很重要(结果)
作者在两个非常困难的挑战上测试了该系统:
- 实时流媒体(OVO-Bench):他们测试了系统是否能在视频正在播放时回答关于视频的问题,而无需预知未来。VAM 在这方面表现最佳,甚至击败了最强大的“一体化”人工智能模型。
- 长达一个月的视频(MM-Lifelong):他们在一段长达105 小时、跨越51 天录制的视频上进行了测试。这就像观看一个人一个半月的生活视频。
- 神奇之处:当其他系统试图记忆全部内容而失败,或者压缩得太多以至于丢失细节时,VAM 仅保留了原始视频的0.06%(1100 万帧中约 6800 张图片)。
- 得分:尽管存储的数据如此之少,VAM 在该测试中获得了第二高的分数,证明拥有几张好照片比拥有一切模糊的记忆更好。
结论
本文认为,要理解长视频,我们不应仅仅试图让人工智能“更聪明”或给它更大的记忆。相反,我们需要给它一种系统化地存储、组织和检查自身证据的方法。
VAM 将视觉记忆视为一个可搜索、可检查的档案,而不是一个压缩摘要。它允许人工智能说:“我知道答案,因为我查看了这一特定帧”,而不仅仅是猜测。
注:该论文明确指出,该系统目前仅针对视觉(尚未处理音频),并且存储原始视频会引发隐私问题,作者指出在实际应用中必须谨慎管理这些问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。