MEval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks
本文介绍了 MEval,这是首个旨在通过专门的视频任务系统性评估多模态模型记忆能力的认知驱动基准测试,它揭示了诸如并行流中解耦能力不足以及符号记忆有限等关键缺陷,凸显了改进记忆机制的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你迎来了一位新学生,他非常擅长观察图片和阅读文本。他可以完美地描述电影中的单个场景。但现在,你想看看他是否真的能“记住”一整部电影的内容,尤其是当情况变得复杂时,比如有两个电影同时在播放,或者相似的场景交织在一起时。
这篇名为 “M 3Eval” 的论文就像是一份全新的、非常具体的成绩单,专门用来测试这种能力。研究人员意识到,虽然我们已经有了测试 AI 如何“看”和“思考”的方法,但我们缺乏测试它如何“记忆”的好方法。因此,他们建立了一个 AI 记忆训练场,其设计灵感源自人类心理学家测试我们大脑的方式。
以下是他们如何通过四个简单的游戏来测试这个 AI:
1. “分屏”测试(注意力分散)
设置: 想象一下,你同时在电视上观看两个不同的烹饪节目,它们并排显示。一个在左边,一个在右边。每隔几秒钟,电视就会交换它们的位置,让左边的移到右边,反之亦然。
问题: “在原本位于左侧的视频中,厨师放的是洋葱还是西红柿?”
结果: AI 变得非常困惑。它无法将这两个故事分开。这就像一个人试图在嘈杂的派对上同时听两场不同的对话;AI 开始混淆谁说了什么以及在哪里说。当视频交换位置时,AI 失去了追踪哪个故事属于哪个屏幕的能力。
2. “干扰”测试(记忆干扰)
设置: 想象你先看一段男人烤蛋糕的视频(视频 A)。紧接着,你又看了一段非常相似的男人烤派的视频(视频 B)。
问题: “在第一个视频(蛋糕)中,那个男人在上面放了什么?”
结果: AI 很难将这两段记忆区分开来。它经常会用视频 B(派)中的细节来回答关于视频 A(蛋糕)的问题。
转折点: 研究人员发现了一个令人惊讶的现象。如果他们在展示派的视频之前,先让 AI 看两次蛋糕的视频,AI 对蛋糕的记忆就会好得多。这就像如果你把一首歌听了两遍,那么当紧接着播放一首类似的歌时,你就不那么容易忘记第一首歌。
3. “乱序故事”测试(交错事件)
设置: 想象你把两部不同的电影各切成 10 个微小的片段,然后像洗扑克牌一样把它们混合在一起(电影 A 的第 1 片段,电影 B 的第 1 片段,电影 A 的第 2 片段,电影 B 的第 2 片段……)。
问题: “你能说出仅针对电影 A 的正确事件顺序吗?”
结果: AI 在这方面表现得很糟糕。它无法理清这两个故事。这就像试图从一堆混乱的拼图块中重新组装出两个不同的拼图。AI 在分辨“事情发生的先后顺序”(时间顺序)方面也遇到了困难,相比之下,它更擅长记得“物体所在的位置”(空间位置)。它能记住“锅在左边”,但很难记住“在放洋葱之前先放了锅”。
4. “N-Back”测试(符号记忆)
设置: 这是一个经典的脑力游戏。你观看一段由许多短视频片段组成的连续流。规则是:“如果你看到的当前片段与你在 3 个片段之前看到的那个片段看起来一样,请回答‘是’。”
结果: 人类在间隔变大时表现会变差(记住 10 步之前的场景是很困难的)。但 AI 的表现很奇怪:随着间隔变大,它的表现并没有变差,但随着视频总数的增加,它的表现变得非常糟糕。
比喻: 想象人类有一个小笔记本,只能记录最后看到的几个事物。如果给他们看太多东西,他们就会忘记旧的内容。然而,AI 拥有一个巨大的图书馆来保存所有信息,但它不知道如何忽略那些没用的信息。它不是被时间跨度难住了,而是被海量的信息给淹没了。
核心结论
论文总结道,虽然 AI 在理解视频方面正在进步,但其“记忆”方式与人类仍然大不相同。
- 人类 擅长过滤噪音并记住事件的顺序,即使我们会随着时间的推移而遗忘细节。
- AI 则难以将平行的故事分开,容易被看起来相似的视频干扰,并且难以按正确的顺序组织长列表中的事件。
研究人员希望通过使用这些特定的“游戏”,其他科学家可以构建出更优秀的 AI 系统——这些系统不仅能“看见”世界,还能像我们一样真正地“记住”世界。他们已经向所有人开放了这些测试题目和视频。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。