← 最新论文
💬 NLP

MEME: Multi-entity & Evolving Memory Evaluation

MEME 基准测试表明,尽管当前的基于大语言模型的智能体具备足够的静态检索能力,但它们在级联、缺失和删除更新等多实体依赖推理任务中根本性失效,而由于成本过高,切实可行的解决方案仍难以企及。

原作者: Seokwon Jung, Alexander Rubinstein, Arnas Uselis, Sangdoo Yun, Seong Joon Oh

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Seokwon Jung, Alexander Rubinstein, Arnas Uselis, Sangdoo Yun, Seong Joon Oh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明、乐于助人的助手,它能记住你告诉过它的每一件事。你已经和这位助手聊了几个月,分享了关于你的生活、工作和爱好的细节。

现在,想象你搬到了一个新城市。你告诉助手:“我搬到了一个新城市!”

一个真正聪明的助手不会仅仅把这句话记下来。它会意识到,它之前所知道的关于你旧通勤路线、你最喜欢的本地咖啡店以及你旧健身房的所有信息现在都了。它需要自动更新这些事实。如果你没有设定关于搬家后会发生什么的规则(例如:“如果我搬家,我的通勤时间就会改变”),助手应该承认:“我还不清楚你新的通勤时间”,而不是猜测或沿用旧的数据。

这篇名为MEME的论文,就是这些 AI 助手的“成绩单”。它测试它们能否应对变化带来的“连锁反应”。

问题所在:“卡住的唱片”综合征

作者发现,当前的 AI 记忆系统就像一台坏掉的唱片机。它们可以完美地记住单个事实(例如:“我喜欢爵士乐”)。它们甚至能记住一系列事实(例如:“我喜欢爵士乐、摇滚和蓝调”)。

但是,当你改变一件影响其他事情的事时,它们就会僵住。

  • 级联故障:如果你说“我的老板换了”,助手本应知道“谁接收周报”也变了。相反,它却继续说出旧老板的名字。
  • 缺失故障:如果你说“我搬家了”,且没有关于后续会发生什么的规则,助手本应说“我不确定你的通勤时间”。相反,它却自信地告诉你房子的通勤时间。

这篇论文将这种现象称为依赖推理。即理解事实 A 依赖于事实 B,因此如果 B 发生变化,A 也必须随之改变的能力。

测试:“记忆健身房”

研究人员建立了一个名为MEME的“健身房”,用于测试六种不同类型的 AI 记忆系统。他们创建了 100 个复杂场景(情节),在这些场景中,AI 需要记住成千上万条事实,但其中一些事实像连锁反应一样相互关联。

他们对 AI 进行了六项任务的测试,难度从易到难:

  1. 精确回忆:“我昨天告诉你的确切错误信息是什么?”(简单)
  2. 聚合:“列出我所有的爱好。”(中等)
  3. 追踪:“我拥有过哪些车,按顺序排列?”(中等)
  4. 删除:“我告诉过你我伴侣的名字是詹姆斯。请删除那条信息。”(较难)
  5. 级联(大难题):“我的团队主管换了。现在谁接收报告?”(非常难)
  6. 缺失(最难):“我搬家了。现在的通勤时间有多长?”(非常难——需要回答“我不知道”)

结果:大家在难题上全败

结果令人惊讶,也让当前 AI 的发展状况略显令人失望。

  • “简单”内容:AI 助手在记住静态事实方面表现尚可。如果你询问从未改变过的事情,它们大多数时候都能答对。
  • “连锁”内容:当涉及到级联缺失任务(即需要更新关联事实的任务)时,每一个系统都惨败
    • 平均而言,它们只答对了**3%**的级联问题。
    • 它们只答对了**1%**的缺失问题。

这就像你告诉图书管理员“我搬到了新地址”,他们却立刻忘记你的新地址,继续大声喊出你的旧地址,尽管你刚刚告诉他们你搬家了。

他们为何失败?

研究人员深入挖掘,看看记忆究竟是在哪里出错的。他们发现了两个主要原因:

  1. 搜索引擎问题:AI 将新信息(变化)和旧信息(规则)都存储在了它的“图书馆”中。但当被问及问题时,搜索引擎却调出了事实,因为它看起来与问题更相似,从而忽略了新的更新。
  2. 推理问题:即使 AI确实同时找到了旧事实和新的更新,AI 的“大脑”部分(即回答问题的那部分)也无法将线索联系起来。它看到了新的更新,却没有意识到这意味着旧答案现在已无效。

“魔法”解决方案(但不切实际)

研究人员尝试了许多修复方法:

  • 更好的提示:更清楚地告诉 AI 该做什么。(无效)
  • 更多记忆:给 AI 更多搜索空间。(无效)
  • 更聪明的 AI 模型:使用更强大的 AI 大脑来回答问题。(无效)

唯一有效的方法是在特定类型的系统(基于文件的代理)中使用一种特定的、非常昂贵且强大的 AI 模型(Claude Opus 4.7)。这个强大的模型足够聪明,能够审视变化,意识到旧事实现已失效,并重写其自身的记忆文件,写道:“好的,旧事实已消失,这是新事实。”

代价是:该解决方案的成本约为标准设置的70 倍。这就像雇佣 70 名专家编辑团队来修改文档中的单个拼写错误。虽然它有效,但目前对于现实世界的应用来说,成本太高且速度太慢。

结论

今天的 AI 助手非常擅长记住你告诉它们什么,但它们极不擅长理解这些信息如何与其他事物相关联。如果你改变生活的某一部分,AI 不会自动更新其余部分。

该论文得出结论:在我们构建出能够自然地处理这些“连锁反应”而无需依赖超昂贵的 AI 大脑进行手动修复的记忆系统之前,当情况发生变化时,我们的 AI 助手仍容易给出过时或自信的错误答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →