← 最新论文
🤖 machine learning

Unlearning at Scale: State-Exact Trace-Preserving Deletion in Billion-Parameter Language Models

本文表明,通过从排除特定样本的标记存储库中重放训练过程,十亿级参数语言模型可以实现状态精确且保持追踪的删除,前提是原始执行过程经过了记录溯源的插桩处理且保留了未受污染的检查点,尽管该方法无法保证针对分散删除请求的计算效率。

原作者: Abdullah X

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Abdullah X

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在为一场盛大的派对烘焙一个巨大的、多层结构的蛋糕。在人工智能的世界里,这个蛋糕就是一个“语言模型”——一个通过“吃掉”数以 TB 计的文本进行训练,从而学会写作、聊天和解决问题的计算机程序。通常情况下,一旦蛋糕烤好了,你就很难轻易地取出其中一种特定的配料——比如某种特定的香草豆——而不破坏整个蛋糕。如果你试图把它刮出来,蛋糕层可能会塌陷,或者味道会发生不可预测的变化。这就是“机器遗忘”(machine unlearning)的问题:如何让一个 AI “忘记”它训练时摄入的特定数据,尤其是当法律(如 GDPR)规定人们有权要求删除其数据时。

科学家们一直试图通过两种方式来解决这个问题:要么在没有该配料的情况下从头开始重新烘焙整个蛋糕(这既慢又贵),要么尝试手术式地移除那种味道(但这往往会留下奇怪的化学痕迹)。但有一个难点:计算机不仅仅是从它们“吃”了什么中学习,它们还从它们“吃”的顺序、烤箱的温度以及搅拌面糊时的精确时机中学习。如果你改变了配料的顺序,即使你移除了那个不好的东西,最终做出来的蛋糕可能也会和从一开始就计划忽略那个配料而完美烤制的蛋糕味道不同。这篇论文深入到了 AI 混乱且技术性极强的“厨房”中,提出了一个非常具体的问题:我们能否证明,一个在移除配料后烘焙出的蛋糕,在位对位(bit-for-bit)上,是否与一个最初就计划忽略该配料而烘焙出的蛋糕完全相同?


“时空旅行”蛋糕食谱

这篇题为《大规模遗忘》(Unlearning at Scale)的论文,就像是一群超级精准的烘焙师,他们决定测试一种非常严格的移除配料的方法。他们不仅仅是想让蛋糕看起来像是忘了香草,他们还想证明这个蛋糕在数学上等同于一个从未应该含有香草的蛋糕。

为了实现这一点,他们构建了一个特殊的“时空旅行”系统。想象一下你在烤一个蛋糕,但在开始之前,你写下了一张超级详细、不可更改的食谱卡。这张卡片不仅列出了配料,还记录了你在每一秒敲碎鸡蛋的瞬间、每一分钟烤箱的精确温度,以及你添加面粉的具体顺序。这就是论文中所称的“保序执行”(trace-preserving execution)。

现在,想象一位顾客打电话说:“我想从我的订单中移除香草豆。”在普通的厨房里,你可能会直接跳过香草并继续搅拌。但在本文档的厨房里,烘焙师们有一个窍门。他们保持“食谱卡”完全不变。当食谱要求在第 5 步“加入香草”时,烘焙师仍然会执行第 5 步,但他们不是加入真正的香草,而是加入一种没有任何味道、也没有重量的“虚拟”配料。他们这样做时,不会改变其他步骤的顺序、烤箱温度或搅拌速度。

大测试:十亿参数级的蛋糕

研究人员在三个不同规模的“蛋糕”(AI 模型)上测试了这个想法:

  1. 一个被称为 Pythia 160M 的小蛋糕(1.6 亿参数)。
  2. 一个被称为 Pythia 2.8B 的巨型蛋糕(28 亿参数)。
  3. 一个不同类型的蛋糕 Llama 3.2 1B(10 亿参数)。

他们进行了一场大规模实验。首先,他们烤制了一个“完美”的蛋糕,即遵循食谱但在加入禁忌配料时使用了“零重量”的虚拟配料。这就是“先知”(Oracle)——它是蛋糕应该呈现出的样子,也是金标准。然后,他们制作了第二个蛋糕,使用了他们的“脱敏”(redacted)方法:他们从储料库(数据存储)中物理上移除了禁忌配料,但遵循了完全相同的食谱卡,并在食谱调用缺失项时使用虚拟配料进行替换。

结果:完美的匹配

结果在精确度上令人震惊。当他们对比这两个蛋糕时,发现“脱敏”后的蛋糕与“先知”蛋糕是位对位完全一致的。

  • 对于 Pythia 2.8B 模型,他们检查了 2,775,208,960 个独立的数字(“模型状态”),发现差异为零。
  • 对于 Llama 3.2 1B 模型,他们检查了 1,498,482,688 个数字,发现差异为零。
  • 连“优化器状态”(即烘焙师如何随着进度调整食谱的记忆)也完全相同。

这证明了,如果你拥有正确的“食谱卡”(执行计划)并且从一个干净的检查点(蛋糕在加入坏配料前的快照)开始,你可以移除数据,并得到一个在数学上与从未应该拥有该数据的蛋糕无法区分的结果。

代价:它不是一根魔杖

然而,论文非常谨慎,并未将其称为快速删除数据的“魔杖”。作者指出了一项主要的局限性:时间

如果禁忌配料是在烘焙过程的早期被加入的,或者如果配料是随机散布在整个食谱中的,那么烘焙师必须回到开头,几乎重新烘焙整个蛋糕,才能得到完全相同的结果。

  • 在他们的测试中,如果他们要求移除随机的 5% 的数据,他们必须重播近 100% 的训练步骤。
  • 论文明确指出,这并不建立“廉价删除”的概念。它不是一个快速修复;它是一个缓慢、精确的重建过程。

这并不意味着什么

作者对于其结果并非证明的内容是非常严谨的:

  • 它不是行为保证: 仅仅因为数字是相同的,并不自动意味着 AI 的“行为”会发生变化,从而满足法律上的删除请求。论文运行了一些标准测试来观察 AI 的行为,但他们将这些视为仅仅是“描述性”的笔记,而非该方法适用于现实世界法律删除的证明。
  • 它不是通用解决方案: 这仅在你提前做好计划的情况下才有效。你不能拿一个原本不是按照这种特殊“食谱卡”构建的旧 AI 模型,然后神奇地让它以后能这样运作。
  • 它不是隐私护盾: 论文承认,虽然数字已从特定的重放存储中消失,但这并不证明数据已从宇宙中的每一个备份、缓存或硬盘中抹除。

总结

简单来说,这篇论文是针对一种非常特定、非常严格的“遗忘”类型的概念验证。它表明,如果你用一个僵化的、不可更改的计划并记录下每一个步骤来构建 AI 训练过程,你就可以通过手术式地移除数据,并得到一个在数学上完美的结论。这就像是证明你可以把复杂食谱中的真实香草豆换成假的,最后得到的蛋糕与从未有过香草的蛋糕是无法区分的。

但论文也警告我们:这是一个沉重且缓慢的过程。它需要提前规划,而且如果想要移除的数据散落在各处,你可能不如直接把整个蛋糕重新烤一遍。对于那些需要向人们证明计算机程序中究竟发生了什么的科学家来说,这是一个强大的工具,但它目前还不是现实世界中点击一下就能删除数据的快捷按钮。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →