SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory
本文介绍了 SMMBench,这是一个旨在评估多模态代理从异构、独立来源中检索、对齐和组合分散证据能力的新基准,揭示了当前系统在这一关键的分源记忆能力上存在困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名正在为老板破解谜案的个人助理。过去,大多数针对 AI 助手的测试都是给它们一本包含所有所需线索的单一巨型笔记本,且线索被整齐地组织在一起。AI 只需通读整本书并找出答案即可。
但在现实世界中,信息并非像一本单一的笔记本。它散落在各处。一条线索可能来自上周二的短信,另一条线索来自不同项目的电子表格,第三条线索是一张航班行程的照片,第四条线索则是私人聊天中的一条备注。
问题所在:“散落线索”挑战
这篇论文的作者,即SMMBench团队认为,当前的 AI 助手擅长阅读长篇单一笔记本,但当线索分散在不同且互不相关的来源中时,它们在破解谜案方面却表现糟糕。他们将此称为“源分布记忆”。
可以这样理解:
- 旧基准测试:你给 AI 一个 100 页的故事,问它“那辆车是什么颜色的?”AI 读完整个故事后给出答案。
- SMMBench:你给 AI 一条写着“约翰要去纽约”的短信,一张写着"A 会议在 11 月 13 日”的独立日历截图,以及一份列有"A 会议在纽约”的不同文档。AI 必须意识到这三件独立的事情相互关联,才能回答:“约翰将于 11 月 13 日飞往纽约参加 A 会议。”
新基准测试:SMMBench
该团队创建了一个名为SMMBench(源分布多模态记忆基准测试)的新测试,以评估 AI 能否应对这种“散落线索”的情况。
- 设置:他们利用 264 个不同的“来源”(如群聊、私信、表格、图像和文档)构建了 1,877 个测试用例。
- 规则:要通过测试,AI必须从至少两个不同的来源中提取信息。如果答案仅存在于一个来源中,则不计入有效。
- 测试的四种技能:
- 串联线索:AI 能否在聊天记录和表格中找到线索并将其结合起来?
- 解决冲突:如果一个来源说“会议在东京”,而较早的来源说“会议在洛杉矶”,AI 能否判断哪一个是最新且正确的?
- 言外之意:AI 能否通过观察分散在不同对话中的微小提示来推测用户的偏好?
- 采取行动:AI 能否不仅回答问题,还能根据在不同文件中找到的细节实际使用工具(例如预订航班)?
研究发现
研究人员测试了当今许多最智能的 AI 记忆系统。结果并不理想。
- “黄金标准”差距:当研究人员给 AI 提供确切的线索以供查看(跳过了寻找线索的困难部分)时,AI 表现非常出色。但当 AI 必须在散乱的混乱中自行寻找这些线索时,其性能显著下降。
- “搜索”与“思考”问题:即使是最好的系统也难以找到正确的来源。这就像拥有一个书架上摆满书籍的图书馆,但 AI 却无法确定该查看哪个书架。
- “行动”差距:AI 在回答多项选择题方面尚可,但当被要求执行精确操作(例如使用正确数字调用特定函数)时,它却惨败。这就像 AI 能告诉你做什么,但当指令分散在不同地方时,它却无法正确地执行。
核心结论
该论文得出结论:我们过去对 AI 记忆的测试过于简单。我们一直要求它们阅读长篇书籍,却未曾测试它们是否能成为优秀的侦探,能够从一堆杂乱的笔记、照片和邮件中拼凑出完整的故事。
目前,AI 代理在这种“源分布”记忆方面仍然非常糟糕。当证据分散在不同地方时,它们会迷失方向。这是 AI 助手要在我们复杂、多应用、多聊天的现实世界生活中真正发挥作用之前,必须解决的主要瓶颈。
简而言之:AI 擅长阅读长篇故事,但当拼图碎片隐藏在房子的不同房间时,它仍在学习如何解开谜题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。