← 最新论文
💬 NLP

Position: The Term "Machine Unlearning" Is Overused in LLMs

本文认为,“机器遗忘”(machine unlearning)一词在大型语言模型研究中被过度使用,用以描述诸如拒绝或抑制等多样化任务,并呼吁将该术词严格限定为具有重训练等效性保证的、由数据集定义的删除过程,以防止误导性的评估并确保针对不同目标使用恰当的术语。

原作者: Sangyeon Yoon, Yeachan Jun, Albert No

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Sangyeon Yoon, Yeachan Jun, Albert No

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:“遗忘”被误用了

想象你有一个学生,他通过研读一座巨大的图书馆里的书籍成为了专家。现在,想象其中一本书被偷了,或者作者要求从这个学生的记忆中将其移除。

这篇论文指出,研究人员正在过于宽泛地使用“机器遗忘”(Machine Unlearning)这个词。他们把许多不同的行为都称为“遗忘”,但实际上这些行为所承担的任务截然不同。

作者认为我们需要停止这种混淆。我们需要将严格的“机器遗忘”一词保留给一个特定的、非常困难的任务,并为其他较简单的任务使用不同的名称。


1. 严格定义:“橡皮擦”

其实际含义:
真正的“机器遗忘”就像是在一幅画上使用魔力橡皮擦。你想要完美地抹去特定的笔触(即“遗忘集”),使得这幅画看起来就像艺术家从未画过那些笔触一样。

  • 金标准: 为了证明你做得很好,你必须将你的“擦除后”的画作,与一位从未见过那本被盗书籍、仅凭剩余书籍重新创作的艺术家所画的新画进行对比。
  • 目标: 两幅画必须是无法分辨的。如果学生仍然能解出一道仅通过那本被盗书籍才学会的数学题,那么即使他拒绝回答那个具体问题,他也并没有真正实现“遗忘”。

2. 混淆之处:人们“实际”在做的事

目前,许多研究人员声称他们在进行“遗忘”,但他们实际上是在做以下其他事情之一:

  • “拒绝”(护卫犬): 模型被训练成在被问及禁忌话题时说“我不知道”或“我无法回答”。
    • 类比: 这就像一只护卫犬,它吠叫并拒绝让你进入房间。狗仍然知道房间的存在,但它不让你进去。狗并没有忘记房间,它只是被训练来阻拦你。
  • “抑制”(静音键): 对模型进行微调,使其极不可能说出与禁忌话题相关的特定词汇。
    • 类比: 这就像是在特定的词汇上按下了静音键。这个词仍在词典里,但说话者被训练去跳过它。
  • “编辑”(重写): 模型被教导用一个新事实来替换旧事实。
    • 类比: 不是抹去“巴黎是法国首都”的记忆,而是用“伦敦是首都”来覆盖它。旧的记忆可能仍然存在,只是被埋在了新的记忆之下。

问题所在: 研究人员经常声称他们已经“遗忘”了某些内容,仅仅是因为模型不再回答问题(因为护卫犬在吠叫)。但作者认为这是一种欺骗。模型可能在内心深处仍然“知道”这些信息,它只是在装傻。

3. 隐藏的危险:“衍生能力”

这是论文中最关键的部分。有时,学习特定的东西会赋予你超越该单一事实本身的超能力

  • 类比: 想象一个学生通过一本被盗的教科书学会了解特定类型的数学题。即使你让他“忘记”书中的具体答案,他可能仍然掌握了通过阅读该书获得的逻辑推理技能
  • 风险: 如果你只检查他是否能背诵答案(输出失败),他可能会通过测试。但如果你问他一个使用相同逻辑的新数学题,他可能仍然能完美解决。
  • 论文观点: 真正的“遗忘”意味着也要移除那种超能力。如果那本被盗的书给了他一项技能,而你对他进行“遗忘”,那么他也应该失去这项技能,即便这会让他的数学整体水平略有下降。如果他保留了这项技能,说明他并没有真正遗忘那本书的影响。

4. 为什么目前的测试正在失效

论文指出,目前大多数测试都像是选择题测试

  • 目前的测试: “模型能回答问题 A 吗?”如果模型说“我不知道”,测试结果就是:“太棒了!你忘掉了!”
  • 缺陷: 这仅仅测试了模型是否在隐藏答案。它并没有测试模型是否删除了知识。
  • 修正方案: 我们需要将“被遗忘后的”模型与“重新训练的”模型(即从未见过该错误数据的模型)进行对比。如果被遗忘后的模型在特定任务上仍然优于重新训练的模型,这意味着“错误数据”仍在影响它。

5. 作者的解决方案:一套新规则

作者提出了三个主要变化来修复这一混乱局面:

  1. 停止将“遗忘”作为统称。

    • 如果你只是让模型拒绝回答,请称之为**“拒绝”(Refusal)或“抑制”**(Suppression)。
    • 如果你确实消除了训练影响,使其与重新训练的模型一致,那么才称之为**“机器遗忘”**(Machine Unlearning)。
  2. 使用“参考模型”进行对比。

    • 你不能只说“模型忘记了”。你必须说:“该模型的表现与一个在没有该数据的情况下进行训练的模型完全一致。”
    • (作者承认重新训练大型模型成本高昂,但他们表示我们必须使用最好的替代方案,否则就必须承认我们并未进行真正的遗忘)。
  3. 测试“超能力”(衍生能力)。

    • 不要只问模型它曾经接受过训练的问题。要问它需要利用可能从错误数据中习得的技能才能解决的新问题。如果它仍然能完成这些新任务,则说明遗忘失败了。

总结

这篇论文是对科学诚实性的呼吁。

  • 不要把“拒绝”(说“我不知道”)称为“遗忘”(抹去记忆)。
  • 不要认为仅仅因为模型不回答问题,它就忘记了知识。它可能只是在玩躲猫猫。
  • 务必将你的结果与从未见过错误数据的模型进行对比。
  • 务必检查模型是否仍保留了从错误数据中获得的“超能力”。

如果我们不修复这个术语问题,我们可能会以为自己已经安全合规,而实际上我们只是在掩盖真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →