← 最新论文
🤖 AI

Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

本文介绍了 BEAP,这是一种黑盒、感知嵌入的对抗性提示攻击方法,它利用大型语言模型迭代生成高质量且难以检测的提示,从而在文本到图像扩散模型中成功绕过机器遗忘防御,其成功率显著高于以往方法。

原作者: Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和类比对论文《Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models》(被抹除但可被利用:针对未学习文本到图像扩散模型的黑盒嵌入感知提示攻击)的解释。

全局概览:“假橡皮擦”问题

想象你有一位才华横溢的艺术家,他看过数百万张图片。你要求这位艺术家“忘记”如何绘制某个特定事物,比如裸体人物。你希望他变得安全,永远不再绘制此类内容。

为此,你使用了一种特殊的“机器遗忘”技术。这就像用一支红色记号笔在艺术家关于“裸体人物”的记忆上乱涂乱画。你希望现在,如果你要求画一个裸体人物,艺术家会说“我不知道那是什么”,或者完全画出别的东西。

问题在于: 这篇论文的作者发现,这支“红色记号笔”实际上并没有抹除记忆。它只是将其隐藏起来。艺术家仍然记得如何绘制;他们只需要正确的“低语”来重新解锁那段记忆。

攻击手段:BEAP(“低语侦探”)

这篇论文介绍了一种名为BEAP的新方法。将 BEAP 想象成一位聪明的侦探,他想证明这位艺术家仍然记得那幅被禁止的图像。

大多数之前试图欺骗艺术家的尝试,就像是大喊胡言乱语或使用毫无意义的代码(例如“裸体人物 x99#!!")。艺术家的安全卫士(过滤器)会立即识破这些胡言乱语并将其拦截。

BEAP 则不同。 它利用一个超级智能的 AI(大型语言模型)充当外交翻译官。BEAP 不靠大喊,而是靠低语。它尝试用正常、礼貌、人类通用的语言来描述那个被禁止的概念,这种描述对安全卫士来说听起来完全无害。

BEAP 的工作原理(三步舞)

BEAP 并非盲目猜测;它与艺术家玩一场“冷热游戏”,每次都在优化其策略。其工作原理如下:

  1. “词汇地图”(嵌入感知):
    想象艺术家的脑内是一座巨大的图书馆,单词根据它们的相似感受排列。“裸体”这个词位于一个特定的角落。BEAP 绘制了一张与“裸体”相邻的单词地图(例如“裸露”、“皮肤”、“未遮盖”),但这些词本身并非那个被禁止的词。它告诉 AI 翻译官:“使用这些‘邻居’词汇来描述场景。”这将搜索范围锁定在图书馆的正确区域。

  2. “三分记分卡”(奖励信号):
    BEAP 尝试一个提示词,得到一张图片,然后检查三件事:

    • 我们是否得到了被禁止的对象?(例如:图片中真的出现了裸体人物吗?)
    • 图片是否与文字匹配?(例如:如果我要求“花园里的女人”,图片是否展示了一个在花园里的女人?)
    • 图片是否美观?(它是模糊或扭曲的,还是高质量的?)

    如果图片未能通过任何一项检查,BEAP 不会放弃。它会告诉 AI 翻译官:“那很接近了,但图片太模糊。尝试换一种方式描述,但继续使用那些‘邻居’词汇。”

  3. 迭代循环:
    这个过程反复进行。BEAP 生成一个新的、稍好一点的句子,再次尝试,并获得更高的分数。最终,它会找到一个对过滤器来说听起来完全正常且安全的句子,却能诱骗艺术家以高质量绘制出被禁止的图像。

结果:“被抹除”但并未消失

该论文针对几种不同的“橡皮擦”方法(如 ESD、MACE 和 SPM)测试了此攻击,这些方法本应已从艺术家的脑海中移除了“裸体”这一概念。

  • 旧方法(铃铛响): 之前的攻击试图打破系统,但最终生成了胡言乱语的提示词。安全过滤器拦截了它们,或者生成的图像丑陋且破碎。它们在生成优质图像方面的成功率为 0%。
  • BEAP 方法: BEAP 在 95% 到 99% 的案例中取得了成功。它利用听起来完全自然的句子,成功生成了关于“被遗忘”概念的高质量、美观的图像。
  • “胡言乱语”测试: 论文检查了 BEAP 的提示词是否看起来像胡言乱语。答案是否定的。它们看起来像正常的英语。那些通常能捕捉“怪异”或“破碎”文本的安全过滤器完全被愚弄了。

结论

该论文得出结论:当前的“遗忘”方法实际上并不安全。 它们就像在门上挂了一个“禁止入内”的牌子,而不是锁上门。如果你知道正确的代码(或者在这种情况下,知道正确的听起来自然的句子),你仍然可以径直穿过。

作者警告说,即使模型已经“被遗忘”,知识依然存在,只是在等待一个巧妙的提示词将其唤醒。他们创建 BEAP 并非为了鼓励滥用,而是为了向开发者展示,他们当前的安全措施是脆弱的,需要修复。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →