← 最新论文
🤖 machine learning

TILDE: TILt-based Distributional Erasure for Concept Unlearning

该论文提出了 TILDE,这是一个用于文本生成图像扩散模型概念遗忘的新型框架,它将该任务表述为一个分布对齐问题,以有效地抑制不需要的概念,同时保留模型在良性数据上的质量、多样性和语义覆盖能力。

原作者: Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位掌握了全世界所有菜谱的大厨,他甚至学会了制作一种特定且具有争议性的食材(比如“魔鬼椒”)的食谱,而你现在想要将这种食材从他的技能库中彻底移除。

这个问题非常棘手:如果你只是告诉大厨,“停止制作魔鬼椒料理”,他可能会感到困惑,甚至开始搞砸其他菜肴。也许他会忘记如何制作普通的番茄汤,因为它们也都是红色的;或者他会停止烹饪任何辛辣的食物。这就是 AI 图像生成器中**概念擦除(Concept Unlearning)**的核心挑战:如何让 AI 忘记某个特定的事物(例如某位名人的脸、某位特定艺术家的风格或某个受版权保护的角色),同时又不破坏它生成其他所有事物的能力。

这篇论文介绍了一种名为 TILDE(基于倾斜的分布擦除,TILt-based Distributional Erasure)的新方法来解决这个问题。以下是它的工作原理,使用简单的类比进行说明:

1. 旧方法:“砸碎桌子” vs “涂抹覆盖”

以往的方法尝试通过两种主要方式来让模型遗忘概念,但两者都存在缺陷:

  • 直接抑制(Direct Suppression): 想象一下,每当大厨伸手去拿香料罐时,你就大喊“不!”来阻止他做魔鬼椒料理。这往往会让大厨变得紧张,导致他停止烹饪任何辛辣的食物,从而毁掉了像普通辣椒酱这样好的菜肴。
  • 锚点替换(Anchor Replacement): 想象一下,你告诉大厨,“不要用魔鬼椒,改用普通辣椒。”这虽然有效,但它会迫使大厨改变他的风格以匹配“普通辣椒”这道菜,而这可能并不是你想要的。这就像是强迫一位画家为了不再画梵高,就必须转而画莫奈一样。

2. TILDE 的解决方案:“隐形过滤器”

TILDE 采取了不同的方法。它不是在喊“不”,也不是强迫其转向一种新的风格,而是为大厨的思想创建了一个智能过滤器

把 AI 的知识想象成一个广阔的图像景观。

  • “魔鬼椒”区域: 在这个景观中,有一个特定的区域,存放着那些你不想要的特定概念的图像。
  • “安全”区域: 其他地方则充满了美丽、安全的图像(良性概念)。

TILDE 并不试图删除“魔鬼椒”区域,也不试图强迫大厨走向特定的“普通辣椒”区域。相反,它轻轻地倾斜了这个景观

  • 它让“魔鬼椒”区域感觉像是一个陡峭、湿滑的山坡,大厨会自然而然地向远离它的方向滑动。
  • 至关重要的是,它没有倾斜其余的景观。“安全”区域依然平坦且舒适。大厨可以像以前一样,在“安全”区域内自由行走。

这被称为**“分布对齐”(Distributional Alignment)**。目标不是寻找一个新的目的地,而是让那个不想要的目的地变得无法到达,同时保持地图的其余部分完全不变。

3. 它如何知道该避开什么:“CLIP 分数”

AI 如何知道哪些图像是“魔鬼椒”,而哪些只是“红番茄”?
TILDE 使用了一个名为 CLIP(一个理解文本与图像之间联系的系统)的工具作为保安

  • 保安有一份关于不想要概念的描述清单(例如:“皮卡丘”、“黄色宝可梦”)。
  • 当 AI 生成图像时,保安会检查:“这看起来像皮卡丘吗?”
  • 阈值(The Threshold): 这是秘诀所在。只有当图像非常明显是皮卡丘时,保安才会拉响警报。如果一张图像只是“一个黄色的卡通形象”但不完全像皮卡丘,保安会说:“没问题,继续吧。”
  • 这防止了 AI 意外惩罚那些看起来稍微有点像禁忌概念的无辜图像。

4. 训练过程:“学习修正”

与其重新训练整个大厨(这需要很长时间),TILDE 使用了一种叫做 Residual GFlowNet 的技术。

  • 想象大厨已经完美掌握了 99% 的菜肴。
  • TILDE 只训练一个小型助手(一个“残差”网络),这个助手的唯一职责就是向大厨低声耳语修正意见。
  • 如果大厨开始走向一道“魔鬼椒”料理,助手就会低声提醒:“嘿,那条路通往禁区,稍微向左转一点。”
  • 如果大厨正在烹饪一道安全的菜肴,助手就会保持沉默。
  • 因为助手只进行修正性的耳语,大厨原本的技能得以保留,他们也不会忘记如何烹饪那些安全的菜肴。

实验结果

论文在移除特定艺术家(梵高)、角色(皮卡丘)和物体等方面进行了测试。

  • 成功率: TILDE 成功阻止了 AI 生成这些不想要的特定概念(成功率接近 100%)。
  • 无附带损害: 与其他方法不同,TILDE 没有破坏 AI 生成相关事物的能力。例如,在遗忘了“梵高”之后,AI 仍然可以完美地绘制“印象派”风格的艺术品。
  • 多样性: AI 并没有变得“乏味”到只制作一种类型的安全图像;它保持了其完整的安全输出多样性。

总结

TILDE 就像一只温柔的、隐形的手,在引导 AI 远离特定的不想要想法的同时,不会将其推向一个被强加的新想法,也不会破坏它完成其他一切事物的能力。它通过数学手段将生成坏图像的概率“倾斜”至接近于零,同时让所有好图像的生成概率保持原样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →