← 最新论文
🤖 machine learning

A Unified Framework for Diffusion Model Unlearning with f-Divergence

本文提出了一种用于文本到图像扩散模型中概念遗忘的统一框架,该框架将标准的基于均方误差的目标泛化为任意ff-散度,既为包括Hellinger散度在内的特定散度提供了高效的闭式解,又为其他散度提供了一种变分极小极大方法,从而更好地平衡遗忘效果与生成保真度。

原作者: Nicola Novello, Federico Fontana, Luigi Cinque, Deniz Gunduz, Andrea M. Tonello

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicola Novello, Federico Fontana, Luigi Cinque, Deniz Gunduz, Andrea M. Tonello

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位极具天赋的艺术家(即“扩散模型”),他通过在互联网上海量且未经筛选的图像库中进行训练,学会了从世界名画到露骨内容的一切。有时,你希望这位艺术家“忘记”某些特定事物——也许是某位特定艺术家的风格、像 R2D2 这样的特定角色,或不适宜的内容——而无需从头重新训练(那将耗时极长且成本高昂)。

本文提出了一种更聪明的新方法,让艺术家能够忘记这些事物。作者将其方法称为f-DMU

以下是他们想法的通俗类比解析:

1. 旧方法:“平均”策略

此前,研究人员试图通过告诉艺术家:“当你被要求绘制 [目标概念] 时,请绘制出与 [锚定概念] 平均值完全一致的画面”,来让艺术家忘记某个概念。

  • 问题所在:他们使用一种名为“均方误差”(MSE)的标准数学标尺来衡量新画作与锚定概念的接近程度。这就像一位只关心最终成绩是否达到平均水平的严厉老师。如果学生在某道难题上犯了大错,老师会给予严厉惩罚;但如果学生犯了许多小错,老师可能反而察觉不到。这种“惩罚”(梯度)可能过于严厉或过于微弱,导致艺术家要么崩溃(生成怪异、破碎的图像),要么遗忘速度过慢。

2. 新方法:“灵活标尺”(f-散度)

作者提出:“为何只使用一把标尺?让我们使用一整套不同的标尺工具箱。”

在数学中,这些标尺被称为f-散度。论文表明,通过选择不同类型的 f-散度,你可以改变艺术家“学习遗忘”的方式。这就像根据你要修复的问题,在测量距离、测量时间或测量重量的标尺之间进行选择。

他们发现有两种主要的“标尺”类型效果最佳:

A. “温柔之手”(平方海林格距离)

  • 工作原理:这把标尺非常谨慎。如果艺术家犯了大错(目标与锚定之间存在巨大差异),这把标尺会说:“好吧,差距确实很大,但别惊慌。让我们迈出一小步,稳步修正它。”
  • 结果:艺术家平稳地学习。他们不会被大错误“吓到”,因此不会开始胡乱涂鸦。
  • 适用场景:当你希望移除某个概念,同时仍保留艺术家绘制其他事物的优美能力时。这是一种“安全”的选择,能保持剩余艺术作品的质量。

B. “重锤”(卡方散度)

  • 工作原理:这把标尺极具攻击性。如果艺术家犯错,这把标尺会大喊:“立刻修正!”错误越大,惩罚越重。
  • 结果:艺术家会非常迅速地忘记该概念。
  • 适用场景:当你需要彻底抹除某些内容,且不介意艺术家在此过程中变得有些“不稳定”或损失一些细节时。

C. “拔河赛”(变分方法)

对于某些没有简单公式的复杂标尺,作者设计了一场游戏。他们创建一个“判别器”(批评者)和一位“艺术家”(模型)。

  • 批评者试图找出旧作与新作之间的差异。
  • 艺术家则试图欺骗批评者。
  • 他们进行一场拔河比赛,直到艺术家再也无法与“被遗忘”的版本区分开来。这种方法威力强大,但更难控制。

3. 他们的发现

作者在多种场景下测试了这些方法:

  • 抹除风格:让艺术家忘记“梵高”或“毕加索”。
  • 抹除物体:让艺术家忘记"R2D2"或“瓦力”。
  • 抹除不适宜内容:让艺术家忘记裸露内容。

核心要点
“温柔之手”(平方海林格)始终优于旧的“平均”方法(MSE)。

  • 原因:旧方法经常导致艺术家在训练中途陷入混乱,在最终稳定之前生成丑陋、破碎的图像。而新方法在整个过程中都保持了艺术家的稳定性。
  • 权衡:如果你希望极度激进地彻底移除某个概念(即使艺术作品变得有些粗糙),你可以使用“重锤”或“拔河赛”方法。但如果你想要干净、高质量的成果,且希望艺术家完美记住其他所有内容,那么“温柔之手”是获胜者。

总结

可以将这篇论文视为为 AI 艺术家提供了一套新的训练工具。与其使用单一、钝拙的工具来让 AI 忘记某事,他们为我们提供了选择:

  1. 使用“温柔之手”:实现平滑、高质量的遗忘,同时保持 AI 其余技能的完整性。
  2. 使用“重锤”:如果你需要迅速将某个概念彻底抹除。
  3. 使用“拔河赛”:如果你需要一种适用于任何类型概念的灵活解决方案。

这使得开发者能够根据具体任务挑选确切的工具,确保当 AI“忘记”某事时,不会意外地同时忘记如何成为一名优秀的艺术家。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →