← 最新论文
💬 NLP

Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding

该论文提出了 MERIT,这是一个简单且有效的超长视频理解框架,它优先通过多键表示(multi-key representations)构建高召回率的情节记忆,并通过通过按需时间扩展将复杂的语义推理推迟至推理阶段,从而在无需预先建模全局关系的计算开销下,实现了最先进的性能。

原作者: Yeeun Choi, Youngbeom Yoo, Joon-Young Lee, Hyolim Kang, Seon Joo Kim

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yeeun Choi, Youngbeom Yoo, Joon-Young Lee, Hyolim Kang, Seon Joo Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图回忆起一场持续了整整三天的电影马拉松中某一段特定的对话。如果你试图为了寻找一句台词而把整场电影重新看一遍,你的大脑可能会因为处理海量信息而彻底崩溃。这正是现代“AI大脑”——即多模态大语言模型(MLLM)所面临的精确问题。这些超级聪明的计算机能够看、听、读,但它们对一次能承载多少“视频”的工作记忆有着严格的限制。当视频过长(跨越数小时甚至数天)时,这些AI模型就会变得不堪重负。为了解决这个问题,科学家们一直试图为AI构建“外部记忆”,就像一个数字图书馆,AI可以将视频存储其中,并在被提问时快速查找到正确的那一页。一个核心问题一直是:我们应该在还不知道人们会问什么问题之前,就尝试将这个图书馆组织成一张复杂的、预先构建好的地图?还是应该仅仅存储原始事实,等到知道用户在寻找什么之后再理清其中的联系?

来自延世大学和Adobe Research的一个研究团队提出,复杂的、预先构建的地图实际上是在浪费时间和计算能力。他们提出了一个名为 MERIT(具有推理时时间扩展的多键值情境检索)的新系统。你可以把MERIT想象成不是一位在第一位顾客到来之前就花数周时间将书籍整理成复杂层级化归档系统的图书管理员,而是一个超级快速、灵活的搜索引擎,它将书籍保持在简单的、未分类的堆叠中。MERIT并不试图去猜测顾客想要什么并对整个故事进行预先总结,而是为每30秒的视频片段写下四种不同的“标签”:发生了什么(事件)、说了什么(对话)、涉及了哪些物体,以及一个简短的摘要。

当用户提出问题时,MERIT并不仅仅寻找一个完美的匹配项。它利用这些多样的标签来寻找最相关的视频片段,即使问题的表达方式很奇特。但这里最巧妙的部分在于:一旦它找到了一个片段,它并不会止步于此。它会立即抓取该片段紧邻的前后片段,从而适度地扩展上下文,使故事逻辑通顺。这种“邻域过滤”仅在问题被提出时才会发生,从而节省了大量的能量。研究人员在从1小时到超过44小时不等的视频上进行了测试。他们发现,MERIT不仅比以往那些构建复杂图谱和层级结构的算法运行得更快、更便宜,而且回答问题的准确度也更高。通过将繁重的思考工作推迟到实际提问时才进行,MERIT证明了有时最简单、最灵活的方法才是最聪明的做法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →