← 最新论文
🤖 AI

I-CARE: Analysis of interference-related phenomena in a controllable, diverse and representative unlearning setting for text-to-image models

本文介绍了 I-CARE,这是一种全面的方法论,它为分析文本生成图像模型遗忘过程中的干扰相关现象提供了形式化定义和标准化工具,从而能够在多种不同设置下实现对非预期知识退化的系统化且可复现的评估。

原作者: Leonardo Santiago Benitez Pereira, Marcos Escudero Viñolo, Luis Herranz Arribas

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Leonardo Santiago Benitez Pereira, Marcos Escudero Viñolo, Luis Herranz Arribas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在过去的几年里,人工智能已经学会了根据文字来绘画。你可以输入像“戴着帽子的猫”这样的句子,计算机程序就会生成一张符合该描述的独特图像。这些被称为生成式模型的系统,是通过海量的图像和文本集合进行训练的,学习将词汇与视觉模式联系起来。但随着这些工具变得越来越强大,一个新的问题出现了:当你想要让它们“忘记”时,该怎么办?

想象一下,一个模型学会了绘制某位特定的名人,但随后那个人要求将其图像从系统中移除,可能是出于隐私考量或希望控制自己的数字足迹。这个过程被称为“机器遗忘”(machine unlearning),即尝试让一个人工智能系统“忘掉”某个特定的概念,而不破坏其绘制其他所有事物的能力。这是一个精细的操作。如果你试图过于激进地抹除某样东西,模型可能会意外地损坏它对其他无关事物的认知。一个试图忘记某种特定犬种的模型,可能会开始把所有的狗都画得很糟糕;或者一个试图移除某位政治家的模型,可能会开始生成其他公众人物的扭曲图像。这种对相关概念造成的意外损害被称为“干扰”(interference),直到现在,科学家们还没有可靠的方法来衡量这种干扰有多严重,以及它是如何发生的。

一组研究人员引入了一个名为 I-CARE 的新框架来研究这个问题。他们并没有发明一种新的擦除数据的方法或一种新的 AI 模型,而是建立了一套标准化的方法,用于测试不同的擦除技术如何影响系统的其余部分。可以将它想象成一把测量损伤的新尺子。在这项工作之前,关于遗忘的研究往往是不一致的:一个团队可能在测试忘记一个人,而另一个团队可能在测试忘记一处风景,这使得公平比较结果变得不可能。I-CARE 框架提供了一种通用的语言和一套严格的实验规则。它明确定义了什么是“忘记”某物,如何衡量剩余图像的质量,以及如何追踪哪些无关的概念在过程中受到了损害。研究人员还开发了一个名为 Forgety 的免费开源软件工具,让任何人无需编写代码或理解复杂的数学知识即可探索这些结果。

为了证明他们的方法有效,研究人员进行了一项大规模实验。他们选择了三个截然不同的类别进行测试:名人、特定的犬种以及各种场景(如森林或体育场)。对于每个类别,他们选择了一百个特定的实体,例如一位特定的演员、一种特定的梗犬或一种特定类型的桥梁。然后,他们采用了一种最先进的图像生成器,并应用了三种不同的遗忘技术来逐一移除一个实体。总计,他们必须擦除 900 个不同的概念,并生成 36 万张新图像,以观察会发生什么。他们这样做不仅是为了看目标是否消失,也是为了观察模型绘制该类别中其他 99 个实体的能力是否发生了变化。

结果表明,干扰比科学家之前认为的要复杂得多。一个常见的假设是,模型只会伤害与被擦除对象非常相似的概念。例如,如果你擦除了金毛寻回犬,你可能会预期拉布拉多也会受到影响,但贵宾犬则会保持完好。研究发现,情况并不总是如此。有时,擦除一个实体会导致看似完全无关的实体遭受重大损害,同时却让非常相似的实体保持不受影响。在某些情况下,这种损害是如此难以预测,以至于研究人员无法找到一个简单的规则来解释它。他们发现,造成的伤害程度很大程度上取决于所使用的特定擦除方法。一种依赖于博弈论方法的方法,比测试的其他两种方法造成了显著更多的附带损伤。另一种不需要额外数据即可运行的方法,虽然造成的整体损伤较小,但更难预测。

研究人员还观察了用于保护剩余概念的数据如何影响结果。他们发现,如果在模型“忘记”目标的过程中向其展示相似事物的例子,它在保护这些相似事物方面表现得更好。例如,在尝试擦除一个足球场时,只有当模型在擦除过程中主动看到其他运动场所的图片时,它才能保护好其他的运动场馆。如果缺少这些例子,模型会意外地降低所有运动场馆的图像质量。这表明,模型在“忘记”的同时如何被训练去“记住”,与擦除技术本身一样重要。

或许最令人惊讶的发现是,干扰并不总是具有破坏性的。在大约 2.7% 的案例中,研究人员观察到,擦除一个概念实际上使相似概念的图像变得稍微更好了一些。例如,当他们擦除一位著名的赛车手图像时,模型绘制一位著名游泳运动员的能力略有提升。研究人员称之为“建设性干扰”(constructive interference)。虽然这种情况很少见,但它证明了 AI 模型中概念之间的关系并非简单的单行道——即擦除一件事情并不总是会伤害另一件。有时,移除一个特定的模式可以让模型优化其对相关模式的理解。

研究还强调了预测这些结果的难度。研究人员试图建立一个系统,根据人类感知的相似度来预测哪些概念会相互干扰。他们发现,这些预测经常出错。两个在人类看来非常相似的实体,在模型中可能不会产生干扰;而两个看起来不同的实体,可能会造成巨大的破坏。这表明,这些 AI 模型的内部逻辑在很大程度上仍是一个谜。我们可以看到损伤,但我们还无法在擦除发生之前可靠地预测它会在哪里发生。

为了让这些发现变得易于获取,团队创建了一个名为 Forgety 的 Web 界面。该工具允许用户浏览实验结果,可视化哪些概念相互干扰,并在无需编程的情况下探索数据。它将数以千计的复杂数据点转化为任何人都能理解的简单图表和列表。这种透明度是他们工作的重要组成部分,因为它允许政策制定者、伦理学家和公众看到尝试让 AI 系统忘记数据的现实后果。

论文总结道,尽管我们在理解机器遗忘方面取得了进展,但目前还没有一种单一的“最佳”方法。擦除方法的有效性完全取决于特定的任务和使用的数据。研究人员强调,他们的框架旨在不断演进。随着新 AI 模型的诞生和新数据擦除方法的发明,I-CARE 方法可以被用来测试它们,从而确保该领域能够以清晰、可比且可重复的结果向前发展。最终的目标不仅是让 AI 忘记,而且是在不破坏其思维完整性的前提下实现这一点,从而确保这些强大的工具对每个人来说都是安全且可靠的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →