← 最新论文
🤖 machine learning

GUDA: Counterfactual Group-wise Training Data Attribution for Diffusion Models via Unlearning

本文提出了 GUDA,一种利用机器遗忘(machine unlearning)来高效近似扩散模型中反事实分组训练数据归因的方法,实现了对具有影响力的数据组的可靠识别,且相比于传统的重训练方法实现了显著的加速。

原作者: Naoki Murata, Yuhta Takida, Chieh-Hsin Lai, Toshimitsu Uesaka, Bac Nguyen, Stefano Ermon, Yuki Mitsufuji

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Naoki Murata, Yuhta Takida, Chieh-Hsin Lai, Toshimitsu Uesaka, Bac Nguyen, Stefano Ermon, Yuki Mitsufuji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在欣赏一幅由人工智能创作的精美且复杂的画作。你可能会好奇:“究竟是哪一组特定的训练图片,教会了这款 AI 这种独特的绘画风格?”是“印象派”照片组?“素描”照片组?还是“水彩”照片组?

这篇题为 GUDA 的论文介绍了一种全新的方法,可以为 AI 图像生成器(称为扩散模型,Diffusion Models)回答上述问题。以下是使用简单类比进行的详细解读。

问题所在:“厨师太多”的困境

AI 模型是在包含数百万张图像的海量数据集上进行训练的,这些图像通常按风格或类别进行分组(例如“狗”、“汽车”或“梵高风格”)。

为了找出哪一组对特定的 AI 生成图像产生了影响,目前的“金标准”方法被称为 LOGO(留一组法,Leave-One-Group-Out)。

  • 类比: 想象一支合唱团正在演唱一首歌。为了找出哪个声部(女高音、女中音、男高音、男低音)对某个特定音符贡献最大,你需要先录下合唱团的声音,然后分别在不包含女高音的情况下录一次,再在不包含女中音的情况下录一次,以此类推。
  • 问题: 如果有 100 个声部,你就必须重新录制 100 次歌曲。对于 AI 来说,这意味着要从头开始重新训练模型 100 次。这需要耗费数年的计算时间,在现实中几乎是不可能的。

解决方案:“记忆擦除器”(遗忘)

作者提出了 GUDA(基于组遗忘的数据归因,Group Unlearning-based Data Attribution)。他们并没有每次都从头开始重新训练 AI,而是使用了一种叫做**机器遗忘(Machine Unlearning)**的技术。

  • 类比: 与其解散整个合唱团并重新雇佣一个没有女高音的新合唱团,不如直接对原有的合唱团进行“教导”,让他们“忘记”女高音的部分。你保持其余部分的合唱团完全不变,但微调他们的记忆,使他们不再记得如何唱出女高音的音符。
  • 运作方式:
    1. 从训练好的完整 AI(“全量模型”)开始。
    2. 应用一种特殊的“遗忘”过程,以移除某一特定组的影响(例如“印象派”)。
    3. 这会产生一个“反事实模型”(Counterfactual Model)——一个表现得好像从未见过印象派照片的 AI 版本。
    4. 将原始 AI 的输出与这个“被遗忘”后的 AI 输出进行对比。如果“被遗忘”后的 AI 无法再生成该图像,你就知道印象派就是那个关键成分。

核心秘诀:如何正确地“遗忘”

仅仅删除数据是不够的;AI 需要被引导,明确应该用什么来替换被遗忘的数据,以免产生混乱。论文描述了两种实现方式:

  1. 针对通用图像(无条件): 他们使用了一种名为 ReTrack 的方法。
    • 类比: 如果你告诉 AI “忘记”一张红色的汽车照片,ReTrack 不仅仅是留下一个空白空间。它会查看数据库中所有其他汽车,并说:“好吧,既然你记不起那辆红车了,那就想象一辆蓝车或一辆卡车,并根据它们之间的相似度进行加权。”它将 AI 的注意力重新引导至剩余的数据上。
  2. 针对文生图(有条件): 这更为复杂,因为 AI 还在听从文本提示词(例如“梵高风格的狗”)。如果你移除了“梵高”,文本提示词本身就会变得很奇怪。
    • 类比: 作者使用了锚点(Anchors)。如果提示词是“狗,梵高风格”,而你想忘记梵高,他们会在提示词中将“梵高”替换为另一种风格(如“素描”),同时保持“狗”这一部分不变。这教会了 AI 在不破坏文本指令的前提下,处理“狗”的概念而不受“梵高”的影响。

结果:快速且准确

论文在两个方面测试了该方法:

  1. CIFAR-10: 一个包含 10 个物体类别(如猫、飞机、卡车)的简单数据集。
  2. 艺术风格: 使用 Stable Diffusion 生成不同艺术风格的图像。

研究发现:

  • 速度: GUDA 比从头开始重新训练的“金标准”方法快了大约 100 倍。这就像是在 2 小时内跑完了一场原本需要 200 小时才能完成的马拉松。
  • 准确性: 它在识别“最重要”的组别方面比其他仅通过寻找“视觉相似性”(例如询问“这张图看起来像梵高的画吗?”)的方法要好得多。GUDA 问的是:“如果我们从 AI 的大脑中移除梵高,这张图像还会存在吗?”
  • 对比: 它击败了其他试图通过观察梯度(数学上的斜率)或逐一遗忘单张图片来猜测影响力的流行方法。

总结

GUDA 是一种捷径。它允许研究人员通过轻轻地从 AI 的记忆中“擦除”一组数据并观察变化,而不是每次都痛苦地重新构建 AI 的大脑,从而回答“哪部分训练数据造就了这张 AI 图像?”的问题。它让理解 AI 生成过程变得更加快速且具有实用价值。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →