← 最新论文
🤖 machine learning

Form and Function: Machine Unlearning as a Problem of Misaligned States

本文将在线 L-BFGS 的机器遗忘重新框架化为反事实状态对齐问题,证明有效的遗忘需要同时校正模型参数和优化器的内部记忆状态,以匹配可实现的反事实轨迹,而不仅仅是调整参数。

原作者: Kennon Stewart

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Kennon Stewart

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《形式与功能:机器遗忘作为状态失配问题》的通俗化解读,辅以生动的类比。

核心理念:不仅仅是擦除笔记,更是要遗忘课程

想象你正在用一本非常特定的笔记本教导一名学生(即 AI 模型)。这本笔记本不仅包含学生当前的答案(即参数),还包含学生为更快解决问题而发展出的一套特殊的“经验法则”或“记忆捷径”(即优化器状态曲率记忆)。

通常,当我们希望 AI“遗忘”一条不良数据(如一张隐私照片或一个错误)时,我们只是试图调整学生的答案,使其看起来仿佛从未见过那张照片。我们假设只要答案正确,学生就是“干净”的。

但这篇论文指出这是错误的。

作者认为,对于高级 AI 学习者(特别是那些使用在线 L-BFGS方法的学习者)而言,笔记本中的“经验法则”与答案同样重要。如果你修正了答案,却保留了基于不良数据的“经验法则”,那么学生仍然会暗中受到本应被遗忘内容的影晌。他们处于失配状态。

核心问题:机器中的“幽灵”

这篇论文提出了一个名为状态对齐的概念。可以这样理解:

  • 现实世界:学生从一系列事件流中学习。
  • 反事实(“假如”):想象一个平行宇宙,其中不良数据从未存在过。在这个宇宙中,学生拥有一套不同的答案,以及一套不同的“经验法则”。
  • 目标:当我们在现实世界中删除数据时,我们不仅希望答案与“假如”宇宙中的答案相匹配,我们更希望整本笔记本(答案 + 规则)完全匹配学生如果从未见过不良数据本会拥有的状态。

该论文声称,当前的方法仅修正了答案(参数),而忽略了规则(记忆)。这创造了一个“弗兰肯斯坦”式的学生:他们拥有针对一个不存在的世界的正确答案,但却是利用错误的捷径得出了这些答案。

两种类型的记忆

作者发现,AI 的记忆运作分为两层:

  1. 直接记忆(显式列表):这是 AI 当前短期记忆中持有的具体示例列表。如果你删除一张照片,它最终会从这张列表中消失。
  2. 间接记忆(涟漪效应):即使照片从列表中消失,学生从中学到的方式可能已经改变了他们解读未来照片的视角。不良数据的“涟漪”会继续影响学生未来的决策,即使原始照片已经消失。

类比:想象你在开车。

  • 直接记忆是屏幕上显示的 GPS 路线。如果你删除一个目的地,它就会从屏幕上消失。
  • 间接记忆是你在驾驶该路线时建立的肌肉记忆。即使你删除了目的地,你的手可能仍然以某种方式握着方向盘,预期在下一个路口左转,因为你昨天刚走过那条路。

论文表明,仅仅删除 GPS 目的地(数据)是不够的;你还必须重置你的肌肉记忆(优化器状态)。

实验:当你尝试“遗忘”时会发生什么?

研究人员测试了几种在删除数据后修复 AI 的方法:

  • “仅参数”修复:他们改变了答案,但保留了规则不变。
    • 结果:学生起初看起来没问题,但随着他们继续学习,开始犯奇怪的错误,因为他们的答案与规则不匹配。他们处于“失配”状态。
  • “仅记忆”修复:他们擦除了规则,但保留了答案不变。
    • 结果:学生拥有了干净的规则,但被困在了不适合新情况的错误答案中。
  • “重放”修复(获胜者):他们让学生回到过去,从历史中擦除不良数据,并让他们从头开始重新学习最后几步。
    • 结果:这是唯一能让学生的状态完美匹配“假如”宇宙的方法。答案和规则完全同步。

关键结论

该论文得出结论:机器遗忘不仅仅是一个改变数字的数学问题,更是一个对齐状态的几何问题。

如果你希望真正从使用高级记忆技术的 AI 中删除数据,你不能仅仅调整最终输出。你必须确保 AI 内部的“肌肉记忆”和“捷径”也被重置,以匹配该数据从未存在的时间线。否则,AI 在名义上只是“被遗忘”了,但它仍然在其未来的行为中携带着被删除数据的幽灵。

简而言之:你不仅要擦除笔记,还要擦除课程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →