← 最新论文
🤖 AI

Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models

本文表明,尽管稀疏自编码器能有效检测扩散模型中的语义概念,但直接利用这些特征进行潜空间干预会导致视觉伪影,从而促使了一种基于检测的替换策略,该策略通过保留模型的激活统计特性,实现了更优越的目标擦除效果。

原作者: Enrico Cassano, Riccardo Renzulli, Rayyan Ahmed, Marco Grangetto, Stephan Alaniz

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Enrico Cassano, Riccardo Renzulli, Rayyan Ahmed, Marco Grangetto, Stephan Alaniz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一把神奇的画笔(一个扩散模型),它可以创造出你描述的任何图像。但有时,你想教这把画笔“忘记”如何画某些特定的东西,比如马或者受版权保护的角色,而又不想从头开始重新训练整个艺术家。这个过程被称为“遗忘”(unlearning)。

最近,研究人员尝试使用一种名为**稀疏自编码器(Sparse Autoencoder, SAE)**的特殊工具来提供帮助。你可以把 SAE 想象成一位组织极其严密的图书管理员,他可以观察艺术家的脑回路(模型的内部数据),并精准地指出负责绘制一匹马的特定“念头”或“神经元”。

问题:“只看,不碰”

研究人员尝试了一种策略,他们告诉艺术家:“嘿,我看到你在想一匹马。别再想它了!”他们试图通过直接调低艺术家大脑中那些特定“马的念头”的音量来实现这一目标。

结果却是一场灾难。

论文将此称为**“只看,不碰”(Look But Don't Touch)**。

  • 看(Look): SAE 非常擅长寻找马的念头。它准确地知道它们在哪里。
  • 不碰(Don't Touch): 当他们试图改变这些念头时,艺术家的脑回路变得混乱了。原本的“马的念头”被随机的、分布外(out-of-distribution)的噪声所取代。

类比: 想象你正在编辑一部电影。你找到了马出现的那个精确帧。你并没有尝试把马剪掉,而是试图从整卷胶片中“减去”马的颜色。结果并不是一个没有马的干净场景,而是一个充满故障、扭曲的混乱场面——天空变成了紫色,草地看起来像静电噪声。艺术家的脑回路被推向了一个它从未见过的状态,产生了严重的视觉伪影(故障)。

解决方案:补丁嵌入替换(Patch Embedding Replacement, PER)

作者意识到,虽然 SAE 是一个糟糕的“橡皮擦”,但它是一个极佳的“定位器”。因此,他们完全改变了策略。

他们不再尝试去操纵艺术家的内部念头,而是仅利用 SAE 来寻找那匹马。一旦 SAE 说:“这张图像的这个特定补丁(patch)里有一匹马”,研究人员就会简单地将该补丁与来自同一张图像中不含马的干净补丁进行交换

类比:
想象你在编辑一张拥挤公园的照片,你想移除特定的人(马)。

  • 旧方法(转向/Steering): 你试图用一根魔杖来“取消发明”这个人。结果魔杖出了故障,人的脸部融化到了背景中,毁掉了整张照片。
  • 新方法(PER): 你使用 SAE 指向那个人。然后,你从同一张照片的其他部分取出一块干净的、空白的草地,并把它粘贴在人的位置上。因为你使用的是照片中已经存在且完美契合的部分,所以结果看起来非常自然。没有故障,也没有奇怪的颜色。

核心发现

  1. 检测容易,操纵难: 论文证明了虽然 SAE 非常擅长识别图像中有什么,但它并不擅长直接控制模型来移除目标。直接操纵会破坏模型的内部逻辑。
  2. “交换”效果更好: 通过使用 SAE 仅用于定位目标,然后交换图像的组成部分(补丁)而不是调整数学参数,其结果要清晰得多。
  3. 不再需要猜测: 旧方法需要进行繁琐的“网格搜索”(尝试数十种不同的强度设置),以观察调低“马的念头”的效果。新方法则无需这种试错过程,可以自动完成。
  4. 效果更佳: 在名为“UnlearnCanvas”的测试中,他们的新方法产生的图像明显减少了故障(伪影更少),并且能更好地保持图像的其他部分(如风格或背景)完好无损。

总结

这篇论文教给我们关于 AI 控制的一个宝贵教训:仅仅因为你能发现模型内部的一个概念,并不意味着你就应该尝试直接编辑它。 有时,移除某样东西最好的方式是让 AI 完成它的工作,识别出不需要的项目,然后简单地用一个已经完美契合的部分来替换那个特定部分,而不是强迫 AI 的大脑去“忘掉”那个概念。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →