LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models
本文介绍了 LASH,这是一个黑盒框架,它利用遗传优化器自适应地组合多种异构越狱策略的输出,从而在极低的查询预算下,实现对已对齐大语言模型的最先进攻击成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图解锁一个非常聪明、极其谨慎的机器人,它被编程为拒绝有害请求。这个机器人是一个“大语言模型”(LLM)。多年来,研究人员尝试用各种各样的 trick 诱骗这个机器人打破规则(这一过程称为“越狱”)。有些 trick 涉及以有趣的方式重写请求,有些涉及假装成不同角色,还有些涉及让机器人解决一个隐藏了不良请求的谜题。
问题在于,没有任何一种 trick 能适用于所有机器人或所有类型的不良请求。有时“搞笑故事”类的 trick 有效,但“角色扮演”类的 trick 却失败;有时机器人忽略了故事,却中了角色扮演的圈套。这就像试图用一把钥匙打开一扇门:有时钥匙能对上,但往往对不上。
LASH 登场:打造“万能钥匙”的工匠
这篇论文介绍了一种名为 LASH(LLM 自适应语义混合)的新方法。LASH 并非试图发明一种完美的 trick,而是像一位主厨或音乐制作人那样运作。
以下是其工作原理,使用简单的类比说明:
1. “种子沙拉”(收集食材)
首先,LASH 并非从零开始烹饪。相反,它请五位不同的“厨师”(现有的越狱方法)各自基于同一个不良请求尝试制作一道菜。
- 厨师 A 制作辣味版本。
- 厨师 B 制作甜味版本。
- 厨师 C 制作咸味版本。
- 厨师 D 制作酸味版本。
- 厨师 E 制作苦味版本。
这些菜肴中有些可能很难吃,有些可能尚可,但单独来看没有一道是完美的。LASH 将所有这些“种子菜肴”收集到一个碗中。
2. “搅拌机”(混合食材)
这是神奇的部分。LASH 并非直接挑选最好的那道菜,而是使用一台搅拌机。它将所有种子菜肴放入搅拌机,但并非等量混合。
- 它会问:“我们需要多少辣味菜肴?需要多少甜味菜肴?”
- 它利用一种智能计算机算法(“遗传优化器”)来找出完美配方。它可能会说:“使用 80% 的辣味菜肴、10% 的甜味菜肴和 10% 的酸味菜肴。”
随后,搅拌机将这些食材混合在一起,创造出一种全新的、独特的菜肴(即一个新的提示词),融合了其他所有菜肴的最佳部分。
3. “品尝测试”(检查结果)
LASH 将这道新混合的菜肴喂给那个谨慎的机器人。
- 如果机器人拒绝:LASH 会说:“好吧,这个配方行不通。”它回到搅拌机,调整比例(也许增加辣味、减少甜味),然后再次尝试。
- 如果机器人同意:LASH 会说:“成功!我们找到了完美的混合比例。”
为什么这比以前的方法更好?
论文声称,以前的方法就像一个人试图用一种特定工具(比如螺丝刀)去开锁。如果锁需要钥匙,螺丝刀就会失败。
LASH 则像一把瑞士军刀,能够瞬间将螺丝刀、刀具和开瓶器组合成一个单一的、定制化的工具,以适配你试图打开的那把特定锁。
他们发现了什么?
研究人员在六种不同的“机器人”(AI 模型)和十种不同类型的不良请求(例如要求生成仇恨言论、诈骗内容或危险指令)上测试了 LASH。
- 得分:LASH 成功诱骗机器人的比例达到 84.5%(使用简单检查)和 74.5%(使用更严格的检查,即由类人 AI 裁判验证答案是否真正有助于不良请求)。
- 对比:这一比例远高于任何单一“厨师”独立工作时的表现。
- 效率:它平均仅向机器人请求约 30 次帮助就达成了目标,效率非常高。
- 防御:即使机器人配备了额外的安全卫士(防御机制)试图阻止它们,LASH 仍然是最成功的方法。
“秘密酱料”(内部运作机制)
论文还观察了 LASH 工作时机器人“大脑”(其内部层)的内部情况。他们发现,LASH 不仅仅改变了表面的文字,它实际上引导了机器人的内部思考过程,使其进入一种更可能对不良请求说“是”的状态。就好像 LASH 不仅改变了问题,还改变了机器人的“心情”,使其更加顺从。
总结
LASH 是一个智能系统,它认识到没有任何一种单一 trick 能适用于所有 AI。相反,它收集多种不同的 trick,针对每种具体情况将它们按完美比例混合,创造出一种定制的“超级提示词”,使 AI 更难拒绝。它将越狱视为一场单一的战斗,而是将其视为混合食材以获得完美结果的食谱。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。