← 最新论文
💻 computer science

What to Forget in Unlearning? Forget Set Curation for Language Models

本文介绍了 CleanSlate,这是一个基准测试,它证明了遗忘集(forget sets)的策划是机器遗忘中一个关键的上游挑战,其中简单的选择方法无法抑制目标内容,而过于激进的策略则会对模型能力造成显著的附带损害。

原作者: Animesh Jha, Arpandeep Khatua, Youssef Allouah, Sanmi Koyejo

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Animesh Jha, Arpandeep Khatua, Youssef Allouah, Sanmi Koyejo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:人类知识的浩瀚图书馆被压缩进了一个单一且极其聪明的计算机程序中。这个被称为语言模型的程序,通过阅读来自书籍、网站和歌曲的数万亿个词汇来进行学习。它变得如此精通,以至于可以模仿诗人的风格,或者完成名著中的句子。但有时,这些程序的拥有者需要删除特定的信息。也许是某首歌在未经许可的情况下被使用了,或者是某个私密的故事被意外记住了。目标是让计算机“遗忘”那部分特定的内容,而不必删除其全部记忆并重新开始。这个过程被称为机器遗忘(machine unlearning)。多年来,研究人员一直专注于一旦确定了要针对哪些词汇时,如何进行删除的技术细节。他们将需要遗忘的词汇列表视为一个简单的起点,假设如果你告诉计算机忘记一个特定的句子,它就会照做。

然而,斯坦福大学的一项新研究表明,这种假设忽略了一个至关重要且困难的步骤。研究人员意识到,在现实世界中,一个遗忘请求很少会附带一份精确的词汇表。用户可能会要求模型停止演唱一首特定的歌,但那首歌在计算机的记忆中是以多种不同的形式存在的。它可能出现在官方歌词中,但也可能出现在引用了一行歌词的新闻文章中、讨论该旋律的粉丝论坛中、存储该文本的代码文件中,或是提到副歌部分的评论中。计算机并不只是通过一个完美的副本了解这首歌;它是通过这些各种提及构成的零散云团来了解它的。这项新研究提出了一个根本性的问题:如何在海量的文本库中找到那首歌或那本书的所有这些零散碎片,以便你可以告诉计算机去遗忘它们?研究团队将这个缺失的步骤称为“遗忘集策展”(forget set curation),他们发现,如果这一步做错了,会导致计算机失去远不止那首不想要的歌曲之多的东西。

为了调查这个问题,研究人员建立了一个名为 CLEANSLATE 的测试场。他们收集了从 1970 年到 2025 年的数千首公告牌百强单曲(Billboard Hot 100)以及五十本书籍。然后,他们测试了不同方法识别需要移除的特定文本片段的效果。他们比较了两种主要方法。第一种方法依赖于标准的搜索工具,类似于一个人使用搜索引擎来查找一本书。这些工具寻找的是单词或短语的精确匹配。第二种方法更为激进:它直接观察计算机最有可能用来生成内容的特定文本部分,并选择这些部分进行移除,本质上是绕过了搜索步骤,直接针对问题的核心区域。

结果揭示了一种令人惊讶的复杂性。当研究人员使用标准搜索工具来寻找文本时,结果往往很微弱。即使搜索工具已经删除了那些明显的副本,计算机仍然会继续演唱那首歌或背诵那本书。这是因为计算机是从许多细小且分散的来源中学习这首歌的,而搜索工具错过了这些来源。一首歌的“足迹”不仅仅是官方歌词;它是分布在互联网上的引用、参考和片段构成的弥散网络。当研究人员试图更加彻底地定位计算机用于生成该歌曲的精确文本窗口时,他们遇到了另一种问题。他们成功地阻止了计算机演唱那首歌,但这样做却损害了计算机记忆其他事物的能力。模型在回答有关该歌曲的事实问题时表现变差,并且也失去了一些通用技能,例如其推理或解决数学问题的能力。

这项研究表明,选择要移除哪些文本不仅仅是一个技术细节,它本身就是解决方案的重要组成部分。研究人员发现,同样的待遗忘文本列表,根据所使用的删除算法不同,会导致截然不同的结果。在某些情况下,对一个计算机模型非常有效的方法,会对另一个模型造成重大破坏。这意味着你不能仅仅挑选一个词汇表,然后假设删除过程是干净利落的。选择数据的过程与删除数据的过程是深度关联的。如果你选择得太少,不想要的现象依然存在;如果你选择得太多,或者选择了错误的文本类型,你就有可能抹除有价值的知识并损害计算机的通用智能。

最终,这项研究表明,认为存在一个简单、完美的遗忘清单的想法是一种幻觉。在这些模型学习的混乱现实中,一首歌或一本书是由一个庞大且无形的文本网络支撑着的。为了在不伤害模型其余部分的前提下真正遗忘一段内容,必须极其谨慎地进行数据选择,并考虑到特定计算机模型究竟是如何学习该内容的。研究结论是,实际的遗忘问题不能仅靠改进删除工具来解决;它需要一种看待我们如何寻找和选择数据的新方式。未来的路径在于设计一个系统,使选择遗忘的内容与遗忘的方法能够协同规划,从而确保计算机在放下特定请求的同时,不会失去理解世界的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →