← 最新论文
💻 computer science

Consistency-Aware Editing for Entity-level Unlearning in Language Models

本文介绍了一致性感知编辑(Consistency-Aware Editing, CAE),这是一种新颖的框架,它通过在多样化的实体相关提示词上联合优化低秩更新,以确保全面知识移除的同时保留模型能力,从而使模型编辑技术能够适配高效且鲁棒的实体级遗忘。

原作者: Xiaoqi Han, Víctor Gutiérrez-Basulto, Ru Li, Xiaoli Li, Jiye Liang, Jeff Z. Pan

发布于 2026-01-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoqi Han, Víctor Gutiérrez-Basulto, Ru Li, Xiaoli Li, Jiye Liang, Jeff Z. Pan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《Consistency-Aware Editing for Entity-level Unlearning in Language Models》(面向实体级遗忘的一致性感知编辑)的解释,采用了通俗易懂的语言和创意类比。

核心问题:“数字失忆症”困境

想象一下,大型语言模型(LLM)就像一本超级百科全书,它几乎读过了互联网上的所有内容。有时,这本百科全书会意外地记住一些不该记的东西,比如某位名人的私人住址、受版权保护的书籍章节,或是有害的刻板印象。

我们希望教会这本百科全书忘记这些特定的内容。然而,这里有一个难点:

  1. 我们不想把整座图书馆都烧了。 我们只想删除关于“成龙”的特定页面,而不是删除关于“武术”或“电影”的一般性页面。
  2. 我们不能仅仅擦除一个句子。 如果你问:“成龙出生在哪里?”,模型应该回答:“我不知道。”但如果你问:“《尖峰时刻》里的那位演员是谁?”,它也应该回答:“我不知道。”

挑战在于: 现有的方法就像试图通过划掉清单上的某一行来抹去一个名字。如果有人以稍微不同的方式(即“改写”)提问,模型可能仍然会记得答案,因为它只忘记了那个特定的句子,而没有忘记那个概念。

解决方案:CAE(一致性感知编辑)

作者提出了一种名为 CAE 的新方法。你可以把它想象成一个与旧方法完全不同的大师级橡皮擦

1. 旧方法:“随机橡皮擦”

想象你有一个白板,上面有 100 种关于“成龙”的不同问法(例如:“他出生在哪里?”、“他的生日是什么时候?”、“《尖峰时刻》里的那个家伙是谁?”)。

  • 旧方法: 你为每个问题准备一个单独的橡皮擦。你擦除问题 #1 的答案,然后擦除问题 #2,接着擦除问题 #3。
  • 问题所在: 因为你在没有计划的情况下逐一擦除,当你试图修复问题 #2 时,可能会不小心把问题 #1 的答案也擦掉了。或者,你可能会因为手滑而漏掉问题 #5。结果很混乱:模型忘掉了一些东西,却还记得另一些东西,或者它变得混乱并开始产生幻觉。

2. 新方法 (CAE):“同步团队”

CAE 改变了策略。它不再是一个个擦除,而是将这 100 个问题视为一个整体团队

  • 策略: 它收集所有关于“成龙”的不同问法。
  • “一致性”规则: 它强制要求所有的橡皮擦都向完全相同的方向移动。这就像一支花样游泳队;每位选手挥动手臂的角度和速度都完全一致。
  • 结果: 与其进行 100 次细碎、混乱的涂抹,这个团队完成了一次巨大、干净、统一的擦拭,从而无论问题如何表述,都能将“成龙”这个概念从模型的脑海中彻底移除。

它是如何工作的(底层机制)

论文深入探讨了模型如何“思考”,以找到应用这种橡皮擦的最佳位置。

  • 寻找记忆: 研究人员发现,模型将关于特定人物(如成龙)的事实存储在被称为 MLP 层(可以理解为模型的“文件柜”)的特定部分。
  • “关键项”选择: 他们并不只是随机抓取问题。他们使用一种数学工具(SVD)来挑选出最能代表“成龙”这一概念的最重要的 70 个问题。这就像挑选出一个人最具代表性的 70 张照片,以确保你能从任何角度识别出他。
  • “低秩”更新: 他们并没有重写整本百科全书(这既耗时又昂贵),而是对文件柜进行了微小且精确的调整。这就像是只更改了架子上的一张标签,而不是重建整个仓库。

研究发现(实验结果)

团队在两个主要的基准测试(RWKU 和 ToFU)上进行了测试,并将其与其他方法进行了对比。

  1. 更好的遗忘效果: CAE 在让模型对任何关于目标实体的提问(即使是那些没有直接提到名字的棘手问题)都回答“我不知道”方面表现得更好。
  2. 更少的附带损害: 由于“橡皮擦”是同步移动的,它们不会意外擦除相关主题的知识。例如,模型仍然知道如何讨论电影或演员,它只是不再了解关于成龙的具体信息。
  3. 高效性: 它非常快速。其他方法可能需要重新训练整个模型(就像为了学习一个新学位而重新读大学),而 CAE 只需要进行快速、有针对性的编辑。它只需通过几十个示例即可完成。
  4. 稳定性: 论文表明,即使你打乱问题的顺序或使用不同的模型,CAE 依然能稳定工作。它非常鲁棒。

总结

该论文认为,要真正从 AI 中“卸载”一个特定的人或实体,你不能仅仅修补一个个漏洞。你需要一种协调一致的方法,这种方法能够理解 AI 是如何存储这些信息的。

CAE 就像一把精密激光,精准锁定模型记忆中整个“成龙”文件夹并将其干净地删除,同时让图书馆的其余部分保持完好无损。 它解决了以往方法的最大弱点——即当用户换一种方式提问时,模型仍会记得答案的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →