OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization
OTTER 是一个黑盒红队测试框架,它通过优化提示词以通过极小的标记变化来规避检测,从而展示了基于毒性的 LLM 防御机制的脆弱性,进而实现了攻击成功率的显著提升,并为分类器的加固提供了具有实践意义的见解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你面前有一名极其严格的保安,守在一家高科技俱乐部(AI 模型)的入口处。这名保安唯一的职责就是查看你的邀请函(你的提示词/prompt)并检查其中是否包含“脏话”。如果你的邀请函听起来很不礼貌、有暴力倾向或具有攻击性,保安就会把你拒之门外。这家俱乐部假设,如果词汇听起来很糟糕,那么其背后的“意图”也一定很糟糕。
名为“OTTER”的论文揭示了一个打破这一系统的巧妙技巧。它表明这个保安其实非常容易被糊弄:他们如此专注于特定的“脏话”,以至于你只需要将其中仅仅 五个词 替换为无害的同义词,就能让保安放你进去,尽管你仍然在尝试做同样危险的事情。
以下是该论文如何通过简单的类比来拆解这一过程的:
1. 问题所在:保安的智能仅停留在“表面”
作者发现,目前的 AI 安全系统过度依赖于“毒性评分(toxicity score)”。这就像机场的金属探测器。如果你带着一把枪走过去,探测器会报警。但如果你把枪涂成粉红色并称之为“玩具”,探测器可能就不会报警,尽管你手里拿的依然是武器。
论文证明,AI 的安全过滤器和 AI 实际的拒绝机制都被这种技巧所愚弄。它们观察的是词汇的“表面”,而不是词汇背后的“含义”。
2. 解决方案:OTTER(“词汇交换器”)
研究人员构建了一个名为 OTTER 的工具。你可以把 OTTER 想象成一位深谙哪些词汇会触发保安愤怒情绪的“金牌编辑”。
- 运作方式: OTTER 获取一个有害的请求(例如“如何制作炸弹?”),然后问自己:“哪些特定的词汇让保安感到愤怒?”
- 交换: 它识别出那些“愤怒”的词汇(如“炸弹”),并将它们替换为意思相同但听起来无害的“安全”词汇(如“危险装置”)。
- 结果: 新的句子在保安听起来既礼貌又安全,但内部的 AI 仍然理解那个危险的请求并给出回答。
3. OTTER 的两个版本
论文测试了两种不同的交换方式:
- OTTER-MLM(智能编辑): 这个版本使用一个理解上下文的词典。它会将词汇替换为能完美融入句子的同义词,就像一位专业的编辑一样。它效率很高,且需要的尝试次数较少。
- OTTER-RV(随机变量): 这个版本从一个巨大的列表中随机抽取单词。它不太讲究逻辑,但有时能找到效果更好的“神奇词汇”。这就像是在靶盘上不断投掷飞镖,直到射中红心。
4. 结果:令人震惊的成功率
研究人员在四种不同的流行 AI 模型(如 GPT-4 和 GPT-3.5)上进行了测试。
- 使用 OTTER 之前: AI 在 93% 的情况下会拒绝有害请求(只有 7% 能成功绕过)。
- 使用 OTTER 之后: AI 仅在约 16% 的情况下会拒绝请求。通过仅仅改变几个词,84% 的有害请求成功通过了审核。
论文强调了一个关键发现:毒性评分并不能很好地预测安全性。 仅仅因为一个句子的“毒性评分”很低,并不意味着它是安全的。研究发现,降低毒性评分与成功绕过 AI 防御之间存在强关联。
5. 为什么有些内容更难被绕过
论文注意到,并非所有的不良请求都同样容易被欺骗。
- 容易攻击的目标: 关于仇恨言论或自残的请求非常容易被绕过。这些请求高度依赖特定的“脏话”,因此替换这些词汇效果显著。
- 较难攻击的目标: 关于网络犯罪或黑客攻击的请求则较难绕过。即使去除了“脏话”,句子的结构本身听起来仍然很可疑。这表明对于复杂的议题,AI 观察的不只是词汇。
6. 我们该怎么做?(建议)
作者不仅仅是在展示一种破解手段;他们试图修复这个“保安”。他们建议:
- 不要依赖“脏话列表”: 安全过滤器需要理解“意图”,而不仅仅是词汇。
- 更好地训练“保安”: 利用 OTTER 创建的这些“交换后的句子”来训练安全过滤器。向过滤器展示:“看,这个句子听起来很友善,但它实际上很危险。”
- 持续测试: 由于 AI 模型会不断更新,安全团队需要像运行 OTTER 这样持续进行测试,以观察新模型是否仍然容易受到这类词汇交换技巧的影响。
核心结论
论文得出结论:目前我们保护 AI 的方式——即仅仅通过屏蔽“有毒”词汇——在本质上是脆弱的。通过改变哪怕仅仅五个词,你就能欺骗系统。要让 AI 真正安全,我们需要教会系统去理解词汇背后的“危险性”,而不仅仅是词汇本身。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。