← 最新论文
🤖 machine learning

Empty SPACE: Cross-Attention Sparsity for Concept Erasure in Diffusion Models

本文提出了SPACE,一种内存高效的方法,通过迭代地诱导交叉注意力参数的稀疏性,从而有效地从大规模扩散模型中擦除特定概念,同时保持对对抗性提示的鲁棒性。

原作者: Nicola Novello, Andrea M. Tonello

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicola Novello, Andrea M. Tonello

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对论文《Empty SPACE》的解释。

问题:过于“热情”的艺术家

想象你有一位才华横溢的 AI 艺术家(扩散模型),它能画出你描述的任何东西。然而,由于它是从整个互联网学习而来的,有时它会画出你想要的东西,比如受版权保护的艺术风格(例如“梵高”)或不适宜的内容(裸露)。

通常,要阻止这位艺术家画出这些东西,你只有两个糟糕的选择:

  1. 彻底重写:你把艺术家带回学校,从头开始重新训练。这需要耗费永恒的时间,花费巨额资金,就像试图通过让人忘记所有已知知识来“去教育”一个人。
  2. “密集”编辑:你试图通过微调艺术家的大脑,外科手术般地移除那些坏东西的具体记忆。现有方法通过微调大脑中的每一个连接来实现这一点。这就像试图通过稍微放松每一根线,从巨大的挂毯上去除特定的污渍。在小挂毯上,这很有效。但在巨大、复杂的挂毯上(如最新的 AI 模型),污渍只是扩散开来,艺术家仍然记得那个坏东西。

解决方案:"Empty SPACE"

作者提出了一种名为 SPACE(基于稀疏交叉注意力的概念擦除)的新方法。

将 AI 的大脑想象成一个巨大的连接图书馆。当 AI 想要画一幅“梵高”风格的画时,它会使用一组特定的连接。

  • 旧方法(密集):试图稍微削弱所有与梵高相关的连接。结果呢?连接依然存在,只是有点模糊。AI 仍然记得梵高。
  • SPACE 方法(稀疏):SPACE 不像削弱一切,它像一个无情的编辑。它查看连接并说:“我们不需要 90% 的这些连接来记住梵高。让我们把它们完全切断。”

它通过用于创建该概念的绝大多数连接归零,迫使 AI 忘记这个概念,只留下一个微小的、必要的信息骨架。通过使记忆变得“稀疏”(大部分是空白空间),该概念实际上消失了。

工作原理:“快速收缩”

该论文描述了一种数学技巧,可以在不重新训练整个模型的情况下做到这一点。

  1. 目标:他们希望改变模型,使得当你要求“梵高”时,它画出的是一些通用的东西,同时仍然记得如何画“莫奈”或“一只猫”。
  2. 工具:他们使用一种数学算法(FISTA),它像一个智能收缩膜。它迭代地收紧连接。
  3. 结果:它不仅仅是收缩连接;它切断了那些绝对不必要的连接。它将 90% 的“梵高”连接变成了零(空白空间)。

为什么这是一件大事(优势)

1. 它在大模型上确实有效
以前的方法在 AI 模型变得巨大时(如 Stable Diffusion XL)就失败了。“密集”编辑在噪声中迷失了。通过将记忆强制压缩到大脑的一个微小、稀疏的角落,SPACE 即使在这些巨型模型上也能完美工作。这就像试图在干草堆里找一根特定的针;旧方法只是稍微移动了整个干草堆,但 SPACE 只是移除干草,直到只剩下那根针(或者在这种情况下,是没有那根针)。

2. 它节省了巨大的空间(SPACE 中的“空”)
这是最巧妙的部分。由于该方法将 80-90% 的连接变为零,“编辑后”模型的文件大小变得非常小。

  • 类比:想象你有一本 100 页的书。旧方法用稍微不同的字体重写每一页。书仍然是 100 页。
  • SPACE:它拿走这本书,撕掉 90 页,留给你一本 10 页的小册子。
  • 现实影响:该论文声称,这将修改后模型的存储大小减少了约 70%。这使得将这些“安全”模型发送到手机或小型计算机更加便宜和快速。

3. 更难被欺骗
有时,人们试图用狡猾的词语(对抗性提示)欺骗 AI 模型画出被禁止的东西。由于 SPACE 通过使它们变空而物理上移除了画出这些东西的路径,因此很难再欺骗模型记住它们。

总结

SPACE 是一种从 AI 艺术生成器中“遗忘”不良或受版权保护概念的新方法。它不是温和地推动整个大脑,而是外科手术般地切掉不必要的连接,留下一个大部分为空(稀疏)的坏概念记忆。这使得 AI 更安全,“编辑后”的模型文件更小,并且该方法在当今可用的最大、最强大的 AI 模型上表现更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →