← 最新论文
🤖 machine learning

MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory

本文介绍了 MemLeak 以及信息溯源图(Information Provenance Graph)分类法,旨在证明多模态 AI 智能体往往无法真正“忘记”信息,因为即使在文本被删除后,事实仍可从保留的图像中被恢复,因此必须进行内容感知型的语义删除以缓解此类泄漏。

原作者: Kuan Wang, Chao Zhang

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Kuan Wang, Chao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你的数字记忆是一个巨大的、杂乱无章的阁楼,AI 代理将你告诉过它的一切都存储在那里。这里有文本笔记的箱子、相册,甚至还有一些隐藏的抽屉,里面存放着 AI 从你的照片中捕捉到的“氛围”或印象。

论文 “MEMLEAK” 研究了当你对这个 AI 说:“请忘掉我热爱潜水这件事”时,会发生什么。

삭제的幻觉

在过去,如果你要求计算机删除一个文件,它只会把文件从文件夹中撕出来扔进垃圾桶。研究发现,现代 AI 代理在处理文本时也是如此:它们删除了那条写着“我热爱潜水”的笔记,然后说:“完成了!”

但漏点就在这里: AI 并没有真正清理整个阁楼。

尽管特定的笔记不见了,但 AI 仍然拥有你的相册。而诀窍在于:AI 不仅仅是“读”照片,它还能“看”照片。 它注意到你有一张热带海滩的照片,一张潜水表的照片,以及第三张珊瑚礁的照片。即便这些照片都没有被标记为“潜水”,AI 也能把这些线索串联起来。它通过观察这一系列看似无关的照片得出结论:“啊,这个人肯定热爱潜로水。”

研究人员将这种现象称为 “记忆泄漏”(Memory Leak)。就像水龙头即使关上了,水还是会从管道里滴出来一样,即使你在要求 AI 遗忘后,信息仍然会从 AI 的记忆中“滴漏”出来。

“信息溯源图”(阁楼地图)

为了理解为什么会发生这种情况,作者创建了一张被称为 “信息溯源图”(Information Provenance Graph, IPG) 的地图。你可以把它看作是阁楼的蓝图,展示了每一处信息可能隐藏的地方:

  1. 可寻址笔记(The Addressable Note): 你可以轻松找到并删除的文本文件。
  2. 关联笔记(The Linked Note): 特别被标记到该文本的图片。如果删除文本,智能系统应该也会删除这张图片。
  3. 持久幽灵(The Persistent Ghost): 这是最可怕的部分。它们是存在于照片中的“氛围”或隐藏线索,并未与任何特定内容进行标记。它们就像漂浮在光线中的尘埃。你无法轻易指着它们说“删除这个”,但它们依然存在,等待着被 AI 用来推测你的秘密。

实验:泄漏有多严重?

研究人员构建了一个名为 MEMLEAK 的测试,用以精确测量信息泄漏的程度。他们创建了 300 个包含事实和照片的虚构用户档案,然后要求 AI 忘记特定的内容。

以下是他们的发现:

  • “盲测”: 如果你要求 AI 在不展示任何旧照片或笔记的情况下猜测一个事实,它 100% 会猜错。(它不会凭空变出你的秘密)。
  • 文本泄漏: 如果你删除了文本笔记,但保留了其他文本笔记(例如“我住在海滩附近”),AI 仅通过阅读剩余的笔记,就能有 18.3% 的概率猜中被删除的事实。
  • 照片泄漏: 如果你删除了文本笔记以及与该事实关联的照片,但保留了相册中的其余部分,AI 仍有 12.0% 的概率能猜中被删除的事实。
    • 令人震惊的部分: 在近一半的情况下,AI 能够猜中,仅仅是因为照片的原因。如果你只看文本,你会认为删除操作已经成功了。照片才是那个“隐形”的泄漏点。

我们能修复它吗?

论文测试了几种堵住泄漏的方法:

  1. 删除所有关联项: 如果 AI 同时删除文本以及每一个明确标记到该事实的照片,泄漏率会从 48%(如果保留特定照片)降至 12%。这解决了“关联”笔记的问题,但没能解决“幽灵”问题。
  2. “智能清扫员”(语义删除): 研究人员尝试了一种新方法:在删除显而易见的内容后,由第二个 AI 扫描剩余的照片,查看它们是否仍在暗示被删除的事实。如果留下的照片是一张“热带海滩”的照片,而用户刚刚要求“忘掉潜水”,那么“智能清扫员”也会把这张海滩照片一并删除。
    • 结果: 这将泄漏率降低到了 2.0%。这效果好得多,但并不完美。有些“幽灵”过于微妙,甚至连智能清扫员也无法捕捉。

核心结论

论文得出结论:仅仅删除一条文本记录是不够的。

如果你告诉一个多模态 AI(既能看又能读的 AI)去忘记某件事,它可能会删除文本,但它仍然可以从你其他照片和笔记中留下的“线索”中重建出那个秘密。作者认为,目前的系统就像是那些虽然扫了地、却把灰尘扫到地毯下面的清洁工。要实现真正的“遗忘”,系统需要审计整个阁楼,而不仅仅是你指向的那个盒子。

该论文并未声称:

  • 它并未表示这种现象发生在当今所有的 AI 系统中(它测试的是特定的系统,如 Mem0 和 Letta)。
  • 它并未提供一种能 100% 消除泄漏的“魔法修复方案”。
  • 它并未讨论将此用于医疗诊断或法律诉讼;这纯粹是对当前记忆系统如何未能彻底删除信息的测量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →