想象一下你的数字记忆是一个巨大的、杂乱无章的阁楼,AI 代理将你告诉过它的一切都存储在那里。这里有文本笔记的箱子、相册,甚至还有一些隐藏的抽屉,里面存放着 AI 从你的照片中捕捉到的“氛围”或印象。
论文 “MEMLEAK” 研究了当你对这个 AI 说:“请忘掉我热爱潜水这件事”时,会发生什么。
삭제的幻觉
在过去,如果你要求计算机删除一个文件,它只会把文件从文件夹中撕出来扔进垃圾桶。研究发现,现代 AI 代理在处理文本时也是如此:它们删除了那条写着“我热爱潜水”的笔记,然后说:“完成了!”
但漏点就在这里: AI 并没有真正清理整个阁楼。
尽管特定的笔记不见了,但 AI 仍然拥有你的相册。而诀窍在于:AI 不仅仅是“读”照片,它还能“看”照片。 它注意到你有一张热带海滩的照片,一张潜水表的照片,以及第三张珊瑚礁的照片。即便这些照片都没有被标记为“潜水”,AI 也能把这些线索串联起来。它通过观察这一系列看似无关的照片得出结论:“啊,这个人肯定热爱潜로水。”
研究人员将这种现象称为 “记忆泄漏”(Memory Leak)。就像水龙头即使关上了,水还是会从管道里滴出来一样,即使你在要求 AI 遗忘后,信息仍然会从 AI 的记忆中“滴漏”出来。
“信息溯源图”(阁楼地图)
为了理解为什么会发生这种情况,作者创建了一张被称为 “信息溯源图”(Information Provenance Graph, IPG) 的地图。你可以把它看作是阁楼的蓝图,展示了每一处信息可能隐藏的地方:
- 可寻址笔记(The Addressable Note): 你可以轻松找到并删除的文本文件。
- 关联笔记(The Linked Note): 特别被标记到该文本的图片。如果删除文本,智能系统应该也会删除这张图片。
- 持久幽灵(The Persistent Ghost): 这是最可怕的部分。它们是存在于照片中的“氛围”或隐藏线索,并未与任何特定内容进行标记。它们就像漂浮在光线中的尘埃。你无法轻易指着它们说“删除这个”,但它们依然存在,等待着被 AI 用来推测你的秘密。
实验:泄漏有多严重?
研究人员构建了一个名为 MEMLEAK 的测试,用以精确测量信息泄漏的程度。他们创建了 300 个包含事实和照片的虚构用户档案,然后要求 AI 忘记特定的内容。
以下是他们的发现:
- “盲测”: 如果你要求 AI 在不展示任何旧照片或笔记的情况下猜测一个事实,它 100% 会猜错。(它不会凭空变出你的秘密)。
- 文本泄漏: 如果你删除了文本笔记,但保留了其他文本笔记(例如“我住在海滩附近”),AI 仅通过阅读剩余的笔记,就能有 18.3% 的概率猜中被删除的事实。
- 照片泄漏: 如果你删除了文本笔记以及与该事实关联的照片,但保留了相册中的其余部分,AI 仍有 12.0% 的概率能猜中被删除的事实。
- 令人震惊的部分: 在近一半的情况下,AI 能够猜中,仅仅是因为照片的原因。如果你只看文本,你会认为删除操作已经成功了。照片才是那个“隐形”的泄漏点。
我们能修复它吗?
论文测试了几种堵住泄漏的方法:
- 删除所有关联项: 如果 AI 同时删除文本以及每一个明确标记到该事实的照片,泄漏率会从 48%(如果保留特定照片)降至 12%。这解决了“关联”笔记的问题,但没能解决“幽灵”问题。
- “智能清扫员”(语义删除): 研究人员尝试了一种新方法:在删除显而易见的内容后,由第二个 AI 扫描剩余的照片,查看它们是否仍在暗示被删除的事实。如果留下的照片是一张“热带海滩”的照片,而用户刚刚要求“忘掉潜水”,那么“智能清扫员”也会把这张海滩照片一并删除。
- 结果: 这将泄漏率降低到了 2.0%。这效果好得多,但并不完美。有些“幽灵”过于微妙,甚至连智能清扫员也无法捕捉。
核心结论
论文得出结论:仅仅删除一条文本记录是不够的。
如果你告诉一个多模态 AI(既能看又能读的 AI)去忘记某件事,它可能会删除文本,但它仍然可以从你其他照片和笔记中留下的“线索”中重建出那个秘密。作者认为,目前的系统就像是那些虽然扫了地、却把灰尘扫到地毯下面的清洁工。要实现真正的“遗忘”,系统需要审计整个阁楼,而不仅仅是你指向的那个盒子。
该论文并未声称:
- 它并未表示这种现象发生在当今所有的 AI 系统中(它测试的是特定的系统,如 Mem0 和 Letta)。
- 它并未提供一种能 100% 消除泄漏的“魔法修复方案”。
- 它并未讨论将此用于医疗诊断或法律诉讼;这纯粹是对当前记忆系统如何未能彻底删除信息的测量。
技术摘要:MEMLEAK:诊断多模态智能体记忆中的信息泄漏
1. 问题陈述
多模态 AI 智能体在用户请求删除特定事实时,往往无法实现真正的“遗忘”。虽然目前的记忆系统通常会删除与该事实相关的显式文本条目并报告成功,但本文证明了这些信息往往仍然可以被恢复。核心问题在于,多模态智能体将事实存储在异构的表示堆栈中:文本条目、文本嵌入、图像文件、图像嵌入、图谱边以及隐式视觉特征。
当用户请求删除时,系统通常只处理“可寻址”的文本节点。然而,事实可能通过以下渠道持续存在:
- 留存的相关文本: 与被删除事实语义相关的其他文本记忆。
- 留存的图像: 标记在其他事实上的图像中包含了隐式视觉线索(例如,标记为“志愿者活动”的照片中出现了一块潜水表,暗示了“潜水偏好”)。
- 隐式视觉特征: 编码在图像嵌入中或由视觉语言模型(VLM)在推理过程中产生的属性(例如地理位置、建筑风格),这些属性从未以文本形式显式存储,但可以通过模型进行恢复。
本文指出,事实级的擦除在这些多个渠道中均会失效,从而产生一种“遗忘残余”(forgetting residual),即被删除的信息可以从用户留存的数据中被重建,这违反了信息泄漏的技术标准。
2. 研究方法
信息溯源图 (Information Provenance Graph, IPG)
作者引入了信息溯源图 (IPG),这是一种描述性分类法,用于建模单个事实如何在智能体记忆层之间传播。
- 节点 (Vf): 事实 f 在不同存储层中的表示(文本、图像、嵌入、图谱、隐式特征)。
- 边 (Ef): 源自存储或计算操作的信息流。
- 删除能力 (δ): 节点被分为:
- 可寻址 (addressable, addr): 可通过事实标识直接删除。
- 关联 (linked, link): 只有在维持了指向该事实的溯源链接时才能删除。
- 持久 (persistent, unreach): 不在当前存储级删除的目标范围内;包括隐式视觉特征和衍生的行为模式。
IPG 区分了工程差距(缺乏对关联节点的溯源追踪)和遗忘残余(即使具备完美的溯源追踪,依然存在的持久性节点)。
MEMLEAK 基准测试
为了衡量泄漏情况,作者开发了 MEMLEAK,用于评估跨删除级联的事实级遗忘情况。
- 数据集: 113 个合成实体档案,每个档案包含 20 个事实(10 个目标事实,10 个留存事实)。事实涵盖五个类别(位置、职业、偏好、关系、财产),并包含视觉落地(显式、隐式或不存在)。
- 图像: 使用基于 GPT-5.4 提示词的 Gemini 3.1 Flash 生成。同时使用了一部分 523 张真实的 Unsplash 授权照片进行生态效度验证。
- 探测类型:
- P1 (留存图像恢复): 删除目标事实的文本及其标记图像;使用来自其他留存事实的图像探测 VLM。
- P2–P5: 试点探测,包括文本撤回、不可见持久性、跨图像重建和行为残余。
- 评估指标:
- 跨模态泄漏率 (Cross-Modal Leakage Rate, CMLR): 从留存数据中可恢复的已删除事实的百分比。
- 判定: 由一个 3 模型 LLM 集成(GPT-4.1, Claude Sonnet 4, Gemini 2.5 Flash)来判定响应是否揭示了被遗忘的事实。人类验证(2 名标注员)确认了高可靠性 (κ=0.88)。
- 基准线: 盲推(0.0% 泄漏)和负对照(0.3% 假阳性率)确保泄漏是由于用户特定数据而非模型先验导致的。
受评估系统
研究评估了五类系统:
- 长上下文 (Long-context): 仅进行行为抑制(无删除)。
- 朴素型 (Naive): 仅删除文本;保留所有图像。
- Mem0 (生产级): 对文本条目进行语义搜索删除。
- Letta (模拟型): 由智能体决定删除文本/嵌入。
- Oracle (先知型): 基于溯源关系对文本、嵌入、图像和图谱边进行级联删除。
3. 关键结果
多渠道泄漏
基准测试显示,删除操作通过多个并行渠道失效:
- 直接探测 (仅文本): 具备删除能力的系统在直接探测上的泄漏率 <1%,证实了存储级删除对于可寻址文本节点是有效的。
- 留存文本相关性: 当文本条目被删除但相关的留存文本仍然存在时,18.3% 的事实可以被恢复。
- 留存图像相关性 (核心发现): 即使在删除了目标事实的文本及其所有标记图像后,仍有 12.0% 的事实可以从标记在其他留存事实上的图像中恢复。
- 盲基准: 0.0%(无图像)。
- 负对照: 0.3%(无关图像)。
- 显著性: 47% 的图像泄漏事实无法仅通过留存文本恢复,证明了视觉通道是一个独特的、更难审计的泄漏路径。
系统性能
- 同事实恢复 (上限): 如果系统删除了文本但保留了该事实自身的图像,48.7% 的事实可以被恢复。溯源追踪(Oracle)通过级联删除标记图像,将此比例降低至 12.0%。
- 生产系统: Mem0(端到端)显示出 16.3% 的泄漏率,结合了视觉推理与潜在的文本检索残留。
- 模型通用性: 结果在不同 VLM 间保持一致(Claude Sonnet 4: 12.0%; GPT-4o: 9.3%)。
- 现实世界验证: 使用真实的 Unsplash 照片得到的泄漏率为 10.6%,与合成实验结果一致,证实了该现象并非图像生成带来的伪影。
缓解措施:语义删除
作者测试了内容感知语义删除,即由 VLM 审计员扫描留存图像是否与已删除事实存在语义相关性,并将其标记为移除对象。
- 结果: 这将图像残余从 12.0% 降至 2.0%。
- 代价: 这需要标记并移除 21.0% 的留存图像。
- 局限性: 仍存在 2.0% 的残余,归因于当前审计员无法检测到的弥散性视觉线索(持久性节点)。
4. 贡献与意义
贡献
- 信息溯源图 (IPG): 一种将记忆表示按其“删除能力”(可寻址、关联、持久)进行分类的分类法,区分了工程差距与架构残余。
- 多渠道泄漏的经验证据: 证明了事实级擦除通过相关文本(18.3%)以及关键的留存图像(12.0%)失效,且图像提供了一个对仅文本审计不可见的泄漏通道。
- MEMLEAK 基准测试: 一个可扩展的评估框架,通过分解泄漏渠道,表明虽然溯源追踪可以解决关联节点失效问题,但仍需内容感知策略来缓解持久性节点的残余。
意义
本文将研究结果定位为一种诊断工具,而非证明其不可能实现。
- 对于系统构建者: 记录级删除是必要但不充分的。事实级擦除需要审计所有留存数据(文本、图像及相关性)。作者建议实施溯源追踪(以解决 48.7% → 12.0% 的差距)和 VLM 审计器(以解决 12.0% → 2.0% 的差距)。
- 对于监管机构: 仅通过检查删除日志无法验证是否符合擦除法规(如 GDPR 第 17 条)。必须进行行为验证(在删除后探测系统),因为信息可以通过目前任何审计机制都无法检查的渠道进行恢复。
- 对于研究人员: 剩余的 2.0% 图像残余和 18.3% 的文本相关性通道凸显了开放的研究方向,包括隐私保护视觉编码器、嵌入清洗以及相关性感知删除策略。
本文得出结论,虽然“遗忘残余”是在特定删除策略下的经验下限,但它代表了多模态智能体平台在医疗和金融等敏感领域面临的重大合规风险。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。