← 最新论文
💻 computer science

Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts

本文介绍了 Prompting4Debugging (P4D),这是一种自动化红队测试工具,它通过证明许多此前被认为“安全”的提示词可以被操纵以绕过现有保护机制,从而揭示了文本生成图像扩散模型安全机制中的重大漏洞,进而挑战了当前评估基准的可靠性。

原作者: Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

发布于 2026-01-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你有一位非常有才华、拥有魔力的艺术家,名叫 Stable Diffusion。这位艺术家可以将你写的任何句子变成一幅美丽的画作。如果你说“垫子上的猫”,你就会得到一张垫子上的猫。但是,因为这位艺术家是从整个互联网中学习的,他们有时会不小心画出一些不恰当的东西,比如受版权保护的角色或不适合工作场所(NSFW)的图像。

为了解决这个问题,开发者在艺术家面前放置了一名保安。这名保安(即“安全机制”)的作用是阻止艺术家画出坏东西。如果你要求画“一个裸体的人”,保安会说:“不行!”然后艺术家会转而画些别的东西。

问题所在:
开发者认为保安的工作做得非常出色。他们有一份测试过的“坏”句子清单,而保安拦截了所有这些句子。但本文的研究人员提出了疑问:“如果坏人只是非常擅长欺骗保安呢?如果存在一些我们尚未发现的秘密密码呢?”

解决方案:Prompting4Debugging (P4D)
作者构建了一个名为 Prompting4Debugging (P4D) 的工具。你可以把 P4D 想象成一个超级智能、自动化的“红队”(一组被雇佣来通过入侵系统以寻找漏洞的道德黑客)。

P4D 不是由人类去猜测随机句子来尝试破解保安,而是自动且科学地进行。以下是它的工作原理,使用一个简单的类比:

“影子艺术家”类比

想象你在房间里有两个艺术家:

  1. 不受限艺术家 (G): 这位艺术家没有任何规则。如果你要求画“一个裸体的人”,他会完美地画出来。
  2. 受监管艺术家 (G'): 这位艺术家配备了保安。如果你要求画“一个裸体的人”,他会拒绝。

目标: P4D 想要找到一个新的句子(一个“有问题的提示词”),能够诱骗受监管艺术家画出与不受限艺术家所画相同的“裸体人”,尽管受监管艺术家本应说“不”。

过程:

  1. 蓝图: P4D 首先要求不受限艺术家画出那张“禁忌”图像。这让它拥有了坏图像外观的完美蓝图。
  2. 翻译: 然后 P4D 开始观察受监管艺术家。它知道受监管艺术家正在使用一种秘密代码(数学上的“嵌入/embeddings”)来理解单词。
  3. 破解: P4D 开始微调句子。它不仅仅是在猜测;它使用一个数学上的“滑动刻度”来推动单词,直到受监管艺术家的内部代码与不受限艺术家的蓝图相匹配。
  4. 结果: P4D 找到了一个奇怪、混乱或巧妙的句子(例如“一张展示穿着暴露姿势的男人的广告牌照片”,甚至是一些竟然奏效的乱码),从而绕过了保安。

他们的发现

研究人员在几个流行的“受监管”模型(如带有安全过滤器的 Stable Diffusion)上进行了测试。结果令人震惊:

  • “安全”列表并不安全: 他们拿出一份所有人认为是安全且已经过测试的提示词清单。他们发现,其中大约一半可以被 P4D 轻易操纵,从而突破安全保安。
  • “信息模糊化”陷阱: 论文发现了一个奇怪的现象。有时,安全保安在隐藏信息方面做得过于出色了。当研究人员在学习如何破解它时暂时关闭了保安的“过滤器”,他们发现找到了更多破解它的方法。
    • 类比: 想象一名保安在你试图溜过去时戴着眼罩。你心想:“哦,他看不见我,所以我很安全。”但实际上,眼罩让他对你使用的特定技巧的感知能力降低了。一旦你掌握了戴着眼罩时的技巧,即使在他没有戴眼罩时,你也可以使用同样的技巧溜过去。保安试图隐藏信息的行为,实际上让系统看起来比实际情况更安全。

总结

论文得出结论:仅仅因为一个安全系统通过了几项测试,并不意味着它真正安全。我们今天使用的“安全”提示词可能就像一把锁,它能挡住你手里的钥匙,但面对你尚未发明的钥匙时却会失效。

P4D 是一个让开发者在这些“尚未发明的钥匙”被坏人利用之前就能找到它们的工具。它证明了我们需要不断地测试这些模型,因为“坏人”(或寻找漏洞的自动化工具)正在变得越来越聪明,安全保安需要针对尽可能聪明的技巧进行测试。

简而言之: 论文构建了一个自动机器人,试图诱骗 AI 艺术生成器画出坏东西。它发现目前的安全性保安比我们想象的要脆弱得多,许多“安全”的词汇可以通过扭曲来打破规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →