← 最新论文
💬 NLP

A Mechanistic Perspective and Circuit-Guided Difficulty Metric for Unlearning

本文引入了电路引导的遗忘难度(Circuit-guided Unlearning Difficulty, CUD),这是一种基于模型电路的预遗忘指标,通过揭示难以遗忘的样本相比于易于遗忘的样本依赖于更深、更长的计算路径,从而量化了特定样本的遗忘挑战。

原作者: Jiali Cheng, Ziheng Chen, Chirag Agarwal, Hadi Amiri

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiali Cheng, Ziheng Chen, Chirag Agarwal, Hadi Amiri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它几乎读遍了互联网上的所有内容。有时,你需要要求这个机器人“忘掉”某些特定的东西——也许是一段受版权保护的故事,也许是一个关于名人的私人事实,或者仅仅是过时的旧闻。这个过程被称为机器卸载(machine unlearning)。这就像是要求机器人从它的脑海中删除一个特定的文件,而不需要抹掉它的整个记忆并从头开始。但棘手的部分在于,有时机器人会立刻忘掉你让它忘记的东西,而有时即使你在尝试了同样的“遗忘”技巧后,它依然固执地记得。科学家们一直在思考为什么会发生这种情况。是因为某些事实本身就更难删除吗?还是机器人的大脑内部有什么东西让某些记忆变得更加“粘稠”?这篇论文深入探讨了这个谜团,不仅研究了机器人记住了什么,还研究了它如何记住这些内容的。

研究人员 Jiali Cheng 及其团队决定使用一种特殊的 X 光检查——机械解释性(mechanistic interpretability)——来观察机器人的大脑内部。把神经网络(机器人的大脑)不要看作一个黑匣子,而要把它看作一座由微小的道路和交叉口组成的巨大城市,电力(信息)在其中流动。这些道路被称为电路(circuits)。当机器人回答问题时,电流会沿着特定的路径旅行。该团队发现,遗忘一段信息的“难度”完全取决于电流用来记忆该信息的道路。

他们引入了一个新工具,叫做电路引导的卸载难度(Circuit-guided Unlearning Difficulty,简称 CUD)。你可以把 CUD 理解为一个“粘性测量计”,在你尝试让机器人忘记之前就可以使用它。它衡量了特定信息内部道路的复杂程度。如果信息沿着一条简短、简单的局部路径旅行(就像绕着街区快走一圈),那么它就容易被卸载。但如果信息沿着一条连接大脑深处并多次循环的长而蜿蜒的高速公路旅行,那么它就难以被卸载

该团队在关于虚假作者档案和电影推荐的数据集上对大型语言模型进行了测试。他们发现这个“粘性测量计”极其准确。他们可以精确预测哪些事实容易删除,哪些会很顽固。当他们尝试卸载那些“难”的事实(即拥有长而复杂道路的事实)时,机器人的性能显著下降,并且它会继续记得那些被禁止的信息。但当他们针对“易”的事实(即短路径)时,机器人完美地忘记了它们,且其它的技能依然保持敏锐。

其中最令人兴奋的发现之一是这些道路为何不同。那些“容易”的记忆依赖于大脑处理初期附近的浅层、直接的连接。而那些“难”的记忆则依赖于一直延伸到大脑决策过程末端的深层、复杂的路径。这就像是试图擦掉单张纸上的涂鸦(容易),对比试图擦掉一幅已经被复制到一千张不同的纸上并粘在一起的画作(难)。

该论文还排除了一些常见的猜测。研究人员表明,这与句子的长度无关(长句子并不自动意味着更难忘记),也不仅仅取决于所使用的特定词汇(这与词汇量无关)。这纯粹取决于机器人大脑的内部结构。他们还将自己的方法与其他衡量难度的方法进行了比较,发现其他方法经常出错,因为它们观察的对象不对。

简而言之,这篇论文表明,遗忘不仅仅关乎数据,更关乎记忆本身的架构。通过理解这些内部电路,我们可以构建更好的工具来帮助机器人精准地忘记我们想要它们忘记的内容,从而使它们变得更安全、更值得信赖。作者希望这能为教导机器人如何放手信息提供更聪明的方法,例如,可以先从容易的部分开始,将困难的部分留给专门的、有针对性的干预。虽然这种方法在运行过程中需要一定的计算能力,但它为理解人工智能如何学习和卸载的隐藏机制开启了一扇新的大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →