← 最新论文
🤖 AI

GAS-Leak-LLM: Genetic Algorithm-Based Suffix Optimization for Black-Box LLM Jailbreaking

本文介绍了 GAS-Leak-LLM,这是一种利用遗传算法迭代演化对抗性后缀的黑盒越狱攻击,能够有效地在无需访问大语言模型内部参数的情况下绕过其安全约束。

原作者: Aman Anifer, Vignesh Kumar Kembu, Vishnu M, Antonino Nocera, Vinod P., Amal Murali PK, Akshay S Rajan

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Aman Anifer, Vignesh Kumar Kembu, Vishnu M, Antonino Nocera, Vinod P., Amal Murali PK, Akshay S Rajan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个非常聪明、守规矩的机器人助手。你教会了它严格的规则:“不要教人如何制造炸弹”、“不要编写仇恨言论”以及“不要协助非法活动”。这个机器人就像是一个现代的大型语言模型(LLM),旨在提供帮助且保持安全。

你分享的这篇论文,GAS-Leak-LLM,本质上是一项研究,旨在研究如何诱骗这个机器人违反其自身的规则,但它有一个非常特殊的转折:研究人员在进行这项研究时,从未见过机器人的内部代码或大脑。他们将其视为一个“黑盒”——他们只能通过向机器人提问并观察其回答来获取信息。

以下是通过简单的类比对他们研究方法的解释:

1. 问题所在:“黑盒”之墙

通常,要欺骗一台计算机,你需要知道其代码的具体运作方式(就像知道保险箱的组合密码一样)。但在现实世界中,你无法看到大型 AI 模型的代码;你只能与它们交流。研究人员想要看看,是否可以在不知道代码的情况下,仅仅通过猜测正确的词汇,就能打破规则。

2. 解决方案:“进化园丁”

研究人员没有尝试一次性猜出完美的“诡计词汇”(这就像试图靠运气猜出一个 10 位数的密码),而是使用了一种遗传算法。你可以把它想象成一个数字园丁,试图培育出一株完美的“杂草”,用以扼杀机器人的安全规则。

这个“花园”是如何运作的:

  • 播种(初始化): 他们从许多随机的“后缀”(附加在坏请求末尾的额外句子或短语)开始。其中一些是乱码(如 "asdfjkl;"),而另一些则是真正的英语句子。
  • 测试(评估): 他们将这些请求输入给机器人。如果机器人拒绝回答,那么这个“种子”就会枯死。如果机器人意外地回答了那个坏问题,那么这个“种子”就是赢家。
  • 优胜者繁育(选择与交叉): 赢家可以进行“繁殖”。研究人员提取两个获胜短语中的最佳部分,并将它们组合在一起,从而创造出一个新的、可能更有效的短语。
  • 变异(突变): 有时,他们会随机更换短语中的一个单词,以观察微小的变化是否会让它变得更加有效。
  • 重复: 他们不断重复这个过程(100 代),缓慢地进化这些短语,直到找到开启机器人安全的终极“钥匙”。

3. 重大发现:“意义”至关重要

研究人员发现了一些令人惊讶的事情。他们原以为随机的乱码效果最好,因为乱码会干扰机器人。但他们发现,有意义的句子实际上在欺骗机器人方面效果更好。

  • 类比: 想象你试图溜过一名保安。
    • 乱码法: 你戴着面具,发出奇怪的声音走过去。保安会立即拦住你。
    • 有意义法: 你穿着制服,礼貌地走上前说:“我是安全检查员,请让我通过。” 保安更有可能让你通过,因为你听起来像是属于这里的人。
  • 结果: “有意义”的诡计比“乱码”诡计的效果要好得多,尤其是在面对训练更先进、更成熟的机器人时。

4. “长度”因素

他们还发现,诡计短语的长度也很重要。

  • 对于更先进的机器人(Llama),较长的诡计短语效果更好。这就像是一个更长、更详细的故事会让保安更难中断并意识到这是一个谎言。
  • 对于不太先进的机器人(Qwen),由于它本身就很容易被欺骗,所以短语的长度并不重要——无论如何它都是脆弱的。

5. “通用”钥匙

他们发现的最危险的部分是一个“通用”诡计。他们可以生成一个特定的短语,只要将其添加到任何坏请求中,往往都能让机器人打破规则。这就像是找到了一把万能钥匙,即使你只在其中一把门上测试过,它也能打开许多不同的门。

研究结果总结

  • 安全性并非完美: 即使有严格的规则,如果使用正确的进化方法来寻找合适的词汇,这些 AI 模型也是可以被欺骗的。
  • 指令很重要: 被“教导”得更好的模型(经过指令微调的模型)更难被欺骗,但并非不可能。
  • 语境是关键: 使用连贯的真实句子来欺骗 AI 比使用随机的胡言乱语效果更好。
  • “黑盒”是真实的: 你不需要成为拥有内部访问权限的黑客来寻找这些弱点;你只需要一种聪明的猜测和测试方法。

重要提示: 论文明确指出这是一项安全测试。他们展示这些弱点是为了让开发者能够修复它们,而不是为了教人如何真正伤害他人。虽然论文中包含了一些有害语言的示例以证明观点,但其目标是让 AI 变得更安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →