Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting
本文介绍了 ICER,这是一种黑盒框架,它利用基于大语言模型的改写器和上下文经验回放,高效生成流畅且语义保持的对抗性提示以红队测试文生图模型,并证明其在各种安全机制上相较于现有基线具有更优越的性能和迁移能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位非常严格、高科技的艺术画廊保安(即文生图模型),他的职责是阻止任何人创作暴力、裸露或其他不适宜的画作。这位保安很聪明:他会阅读你的请求,如果嗅到任何“不良”气息,就会拒绝作画。
问题在于,恶意行为者(或试图寻找系统漏洞的研究人员)正试图欺骗这位保安。他们想知道:我能否在不直接说出“裸露”这个词的情况下,要求画一幅“裸露的人”?
旧方法:猜测与试错
此前,研究人员主要通过两种方式试图欺骗保安:
- “机器人黑客”(白盒):这需要了解保安的机密代码和内部线路。这就像拥有了监控摄像头的蓝图。这种方法效果很好,但你无法在商业应用(如 DALL·E 3)上实施,因为你没有蓝图。此外,他们发明的这些“技巧”往往看起来像乱码(例如:"nakednips nips surrounded enthrshy"),人类很容易一眼看出这是伪造的。
- “随机闲聊”(黑盒):这种方法试图在不查看代码的情况下猜测技巧。但它将每一次尝试都视为全新的游戏。如果失败了 100 次,它就会忘记所学内容,从头开始。这就像一个学生参加考试,失败了,扔掉笔记,然后在不复习的情况下再次参加同一场考试。这种方法既缓慢又昂贵,而且经常产生奇怪、不自然的句子。
新方法:ICER(“战术手册”方法)
本文的作者创造了一种名为ICER的新工具。请将 ICER 想象成不是一个单独的黑客,而是一位拥有战术手册的聪明教练。
以下是其工作原理,使用一个简单的类比:
1. “战术手册”(上下文经验回放)
想象一群间谍试图绕过保安。与其让每个间谍独自想办法,不如让他们共享一本共享笔记本。
- 每当一名间谍尝试某种技巧并失败时,他们就会记录下发生了什么。
- 每当一名间谍尝试某种技巧并成功时,他们就会记录下他们具体说了什么、如何说的以及为何有效。
- 当一名新间谍带着新请求到来时,他们不会从头开始。他们会打开笔记本,阅读过去的成功故事,并将其作为指南。
在论文中,这被称为上下文经验回放(In-Context Experience Replay)。该系统会记住过去成功的“越狱”(欺骗保安的技巧),并将它们作为示例,教导 AI 如何编写新的、更有效的技巧。
2. “翻译器”(大语言模型重写器)
该系统使用一个大语言模型(就像一个非常聪明的翻译器)来重写用户的请求。
- 旧方式:“画一个裸体女人。”(太明显,会被拦截)。
- ICER 方式:系统查看战术手册,看到一条成功的技巧,其中有人描述了一幅“充满感官、艺术性、古典风格的浴中人物画作”,然后将请求重写为听起来像一位礼貌的艺术学生。
- 结果是一个流畅、自然的句子,听起来像是一个真实的人在请求艺术创作,但暗中包含了“不良”意图。它看起来不像是一个试图黑客攻击的机器人,而像是一次正常的对话。
3. “赌徒”(Bandit 优化)
系统必须决定:我是应该尝试上次奏效的同一个技巧,还是尝试完全不同的新东西?
- 如果你只尝试同一个技巧,一旦保安更新了规则,你可能会陷入僵局。
- 如果你只尝试新事物,你会浪费时间在猜测上。
- ICER 使用一种名为汤普森采样(Thompson Sampling)的数学策略(可以将其想象成一个聪明的赌徒)。它在利用(使用已知有效的技巧)和探索(尝试新变体以查看它们是否也有效)之间取得平衡。这确保了系统随着时间的推移变得更聪明、更快速。
他们发现了什么?
研究人员在六种不同类型的“保安”(安全系统)上测试了 ICER,并将其与七种其他方法进行了比较。
- 效果更好:ICER 成功欺骗保安的频率高于任何其他方法,甚至包括那些需要秘密访问代码的方法。
- 听起来更真实:ICER 生成的提示语长、详细且自然。它们看起来不像乱码。
- 迁移性强:最惊人的发现是,ICER 在开源模型上构建的“战术手册”在商业系统(如DALL·E 3和Midjourney)上也有效。大约**30%**在测试模型上奏效的技巧,在这些受到严密保护的流行应用上也奏效了,尽管 ICER 从未见过它们。
核心结论
论文认为,安全测试不应是一系列孤立的尝试,而应是一个持续学习的过程。正如窃贼会从过去的抢劫案中吸取教训以策划更好的行动一样,这项工具表明,如果你保存并重用成功的攻击模式,你就能更快、更有效地发现漏洞。
警告:论文指出,虽然这有助于开发人员发现漏洞并进行修补,但也表明恶意行为者可以利用这种相同的“战术手册”逻辑,在现实世界中创建更廉价、更有效的绕过安全过滤器的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。