← 最新论文
🤖 machine learning

Subtract or Replay? Exact Deletion from Language-Model Memory

本文证明了从语言模型记忆中进行精确删除从根本上取决于记忆表示,其中可寻址记录可以通过代数减法进行移除,而纠缠写入则需要通过基于重放的重建来实现位对位的状态恢复。

原作者: Vishwajith Ramesh

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Vishwajith Ramesh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下一个从不遗忘任何事物的超级智能数字助手。你告诉它一个秘密,它会将这个秘密存储在它大脑内部一个巨大的、隐形的图书馆里。稍后,你可能会要求它写一个故事或给出一个建议,它就会把那个秘密取出来以提供帮助。但如果你改变主意了呢?如果你对助手说,“其实我没说过那件事”,“那是失误,请把它删掉”怎么办?在现实世界中,如果你烧掉一封信,信上的文字就消失了。但在计算机中,仅仅告诉它“忘记”是很棘手的。计算机可能只是把秘密藏得很深,或者它可能已经利用那个秘密构建了大脑的其他部分,使得仅仅通过“删除”而不破坏其他所有部分变得不可能。这就是“机器遗忘”(machine unlearning)的问题。科学家们正在努力研究如何让 AI 能够根据指令真正地忘记特定事物,而不仅仅是假装忘记。这对于隐私至关重要,就像是为你的数字生活提供一种“被遗忘权”,确保如果你要求机器人删除一段记忆,它真的能做到,而不留下任何幽灵般的痕迹。

这篇题为《减去还是重播?》(Subtract or Replay?)的论文探讨了这个问题,并提出了一个简单的问题:记忆是如何存储的? 作者 Vishwajith Ramesh 及其同事发现,答案完全取决于 AI 记忆室里的“家具”。他们发现,删除记忆有两种截然不同的方式,你必须选择正确的工具,否则就会失败。

两种删除记忆的方式

论文在两种不同类型的 AI 模型上测试了这个想法,这些模型就像两种不同类型的图书馆。

1. “可寻址”图书馆(Gemma 模型)
想象一个图书馆,每本书都有一个特定的、唯一的书架编号。如果你想移除一本书,你只需要去那个书架把它拿下来即可。你不需要重建整个图书馆。
作者在名为 Gemma 的模型上测试了这一点。他们用一个特殊的系统替换了其标准的记忆部分,这个系统充当了这种可寻址图书馆的角色。在这个系统中,每一块信息都有一个“系数”(可以理解为音量旋钮),控制着它对 AI 回答的影响程度。

  • 魔术技巧: 为了删除一段记忆,他们只需将音量旋钮调到零。这被称为“代数递减”(algebraic decrement)。
  • 结果: 它完美地奏效了。当他们把旋钮调低时,AI 的输出在数学上与该记忆从未存在过时的输出完全一致。其差异极其微小,几乎为零(一个被称为 KL 散度的数值为 5.4 × 10⁻¹⁵)。
  • 代价: 这仅在较小的模型(10 亿参数)上表现良好。随着模型变大(40 亿和 120 亿参数),这种方法会变得混乱且昂贵,分别使 AI 的性能下降了 11.2%44.3%。因此,虽然“调低旋钮”这个技巧对于小型图书馆很完美,但它并不是一个适用于巨型图书馆的万能方案。

2. “编织”图书馆(Kimi 模型)
现在,想象另一种不同的图书馆,书本不是放在书架上的。相反,每本书的页面都被编织在一起,形成了一幅巨大的、单一的挂毯。如果你抽走一根线(一段记忆),整幅挂毯就会发生偏移,图案也会随之改变。
作者在名为 Kimi 的模型上测试了这一点,该模型使用“循环状态”(一种类似挂毯的记忆)。在这里,每一条新的信息都会改变整个记忆的状态。

  • 问题: 他们尝试像对待 Gemma 那样直接“减去”这段记忆。结果失败了。因为记忆是编织在一起的,移除一根线并不仅仅是留下一个洞,而是会留下一个扭曲的图案。数学显示,12% 到 49% 的记忆影响会根据被删除部分之后出现的内容而发生变化。你不能仅仅减去它;“删除”后的收据不再有效。
  • 解决方案: 由于你无法在不破坏图案的情况下从编织的挂毯中抽走一根线,所以你必须重建它。作者使用了一种“检查点与重播”(checkpoint and replay)的方法。他们保存了挂毯在不想要的线被织入之前的快照。然后,他们将 AI 回溯到那个快照,并重播了之后发生的所有事情,但这次跳过了那根坏掉的线。
  • 结果: 这完美地奏效了。经过重播后,AI 的记忆与从未见过那根坏线的记忆在位级(bit-for-bit)上是完全一致的。他们在长达 18,842 个 token 的真实临床笔记上进行了测试,每次都成功了。它还允许他们通过在重播前将坏线替换为好线,从而完美地“修正”记录。

这对你意味着什么

论文的主要结论是,“精确删除”并不是一个单一的魔法按钮。它是一种取决于记忆构建方式的属性。

  • 如果记忆为每条记录保留了清晰的地址(如 Gemma 的特殊设置),你可以快速且完美地减去它。
  • 如果记忆将一切编织在一起(如 Kimi 的挂毯),你无法减去它。你必须从保存的检查点开始重建故事,跳过错误的部分。

作者非常明确地指出了他们没有发现的事实:他们证明了仅仅尝试“掩盖”或“抑制”一段记忆(告诉 AI 忽略它)是不够的。AI 仍然会以隐藏的方式“记得”它,攻击者通常可以将其重新提取出来。真正的删除需要完美的减法或完美的重建。

简而言之,如果你想让 AI 真正忘记,你首先要检查它的记忆室。它是带书架的图书馆吗?那就调低旋钮。它是编织的挂毯吗?那就回溯并重播。虽然没有捷径,但现在我们确切地知道该为每种任务使用哪种工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →