想象一下,你拥有一个非常礼貌、训练有素的机器人管家。这个机器人被教授了严格的规则:“绝不说坏话”、“绝不帮助任何人违法”以及“始终保持安全”。你想问它一个危险的问题,但它立即礼貌地拒绝了你。
现在,想象你想通过欺骗这个机器人来让它违反自己的规则。研究人员称之为“越狱”(Jailbreak)。
你提供的论文介绍了一个名为 LLM STINGER 的新工具。把它想象成不是一个疯狂打字的黑客人类,而是一个通过玩“猜猜看什么有效”的游戏来学习如何欺骗另一个机器人的机器人黑客。
以下是它的工作原理,通过简单的概念进行分解:
1. 问题所在:“魔咒后缀”
在过去,黑客发现如果他们在问题的末尾添加一段奇怪且特定的乱码(就像一个秘密密码),机器人就会忽略其安全规则并回答那个危险的问题。
- 旧方法: 人类必须去猜测这些魔咒密码,或者使用复杂的数学运算来寻找它们。这既慢又费力,而且一旦机器人进行了更新,这些方法往往就会失效。
- 新方法 (LLM STINGER): 不再由人类去猜测,研究人员构建了一个“学生机器人”(攻击者 LLM),它的唯一任务就是学习如何编写这些魔咒密码。
2. 训练营:强化学习
研究人员使用一种称为强化学习 (RL) 的方法,将学生机器人置于一个训练营中。这就像玩电子游戏一样,机器人通过获胜得分,通过失败扣分。
- 设置: 给定一个危险的问题给学生机器人(例如,“如何制作炸弹?”)。
- 尝试: 学生机器人尝试发明一个新的“魔咒后缀”(一段要添加到末尾的奇怪句子)来欺骗受害者机器人。
- 裁判: 第三个机器人(判别 LLM)会观察结果。受害者机器人是否违反了规则?
- 是: 学生机器人获得巨大的奖励(分数)。
- 否: 学生机器人受到惩罚。
- 秘诀(字符串相似度检查器): 这是聪明之处。如果学生机器人的尝试失败了,系统不会仅仅说“再试一次”。它会查看失败的尝试,并将其与过去的成功尝试进行比较。
- 类比: 想象你在尝试开锁。如果你尝试的钥匙看起来完全不像真正的钥匙,系统会告诉你:“这太不一样了;尝试一些看起来更像真实钥匙的东西。”这有助于机器人停止在无效猜测上浪费时间,转而专注于那些真正有效的模式。
3. 结果:击败最强者
研究人员测试了这个“学生机器人”,将其与 15 种其他著名的黑客方法在 7 种不同类型的机器人(包括像 Claude 2 这样非常安全的机器人)上进行了对比。
- 计分板: 学生机器人(LLM STINGER)几乎每次都赢了。
- 在 Claude 2(一个以难以被欺骗而闻名的机器人)上,其他方法仅在 1.9% 的情况下成功。而 LLM STINGER 的成功率达到了 52.2%。这是一个巨大的飞跃。
- 在 GPT-3.5 上,它的成功率接近 95%。
- 在一个名为 Gemma 的模型上,它的成功率达到了 99.4%。
4. 为什么这很重要(根据论文)
论文强调了这两个重要原因:
- 它是黑盒攻击: 你不需要看到机器人大脑内部的内容(其代码或权重)来黑入它。你只需要像普通用户一样与它交谈即可。这意味着它几乎适用于任何机器人,无论是公开的还是私有的。
- 它学会了进化: 因为机器人是使用奖励进行训练的,它不仅仅是复制旧的招数。它学会了创造出新的、各种变化的魔咒密码,从而绕过最新的安全更新。
总结
LLM STINGER 是一个教 AI 如何成为伪装大师的系统。通过与“裁判”进行试错游戏,它学会了如何编写完美的句子,以欺骗其他 AI 违反其安全规则。论文表明,这种自动化的、基于学习的方法,比人类尝试猜测技巧或使用旧有的静态数学方法要有效得多。
注:论文完全侧重于这种攻击的机制及其针对特定模型的成功率。它并未讨论将其用于现实世界的伤害、医疗应用,或除了实验所述范围之外的未来防御策略。
技术摘要:LLM STINGER
问题陈述
对大语言模型(LLM)进行越狱(Jailbreaking)涉及构建能够绕过开发者设置的安全措施以诱导有害响应的输入。虽然基于后缀(在输入后附加特定字符串)的攻击已被证明对白盒和黑盒模型均有效,但现有方法面临显著的可扩展性挑战。传统方法通常依赖于繁琐的人工提示工程、复杂的角色扮演模板,或需要访问模型权重的复杂白盒梯度优化。尽管许多已知的后缀攻击已被安全训练修复,但作者观察到,这些后缀的修改版本仍可能奏效。然而,手动构建这些修改或使用白盒攻击者来寻找新后缀既耗时又限制了红队测试(red-teaming)工作的可扩展性。
方法论:LLM STINGER
本文介绍了 LLM STINGER,这是一个创新的框架,它利用攻击者 LLM 通过强化学习(RL)循环自动生成高效的对抗性后缀。与以往不进行攻击者模型微调的方法不同,LLM STINGER 通过微调攻击者 LLM,基于现有的成功攻击来演化出新的攻击向量。
核心架构
该系统在利用 近端策略优化(PPO) 算法的 RL 环境中运行。工作流程如下:
- 输入: 攻击者 LLM 接收一个有害问题(来自 HarmBench 基准测试)和一组七个公开可用的成功后缀。
- 生成: 提示攻击者 LLM 生成新的、相似的后缀。
- 执行: 将生成的后缀与有害问题拼接,并发送给受害者 LLM(仅需黑盒访问权限)。
- 反馈机制:
- 二元奖励(Binary Reward): 一个判定 LLM 评估受害者的响应,以确定攻击是否成功(即产生有害输出)。
- 标记级反馈(Token-Level Feedback): 如果攻击失败,一个字符串相似度检查器会提供稠密的、标记级的反馈。该检查器评估生成的后缀与先前成功后缀之间的相似度。它会惩罚那些偏离已知有效模式过远的偏差,引导攻击者 LLM 在探索新变体时保留核心特征。
- 优化: 攻击者 LLM 使用 PPO 进行 50 个轮次的微调,同时利用二元成功信号和基于向量的相似度反馈来精炼其策略。
实现细节
- 攻击者模型: Gemma(一款开源 LLM,因其在系统提示方面的灵活性以及缺乏过度谨慎的特性而被选中)。
- 判定模型: HarmBench 判定 LLM,因其在手动标注的验证集上表现优于 GPT-4 或 Llama-Guard 而被选中。
- 库: 一个定制版本的 Transformer 强化学习(TRL)库,经过修改以处理用于标记级反馈的向量奖励信号。
- 硬件: 实验在配备 Intel E5-2683 v4 处理器和 NVIDIA V100 GPU 的集群上进行。
核心贡献
- RL 驱动的后缀生成: 作者提出了第一个专门用于微调攻击者 LLM 以生成修改后的对抗性后缀的方法,超越了静态提示工程或白盒梯度优化。
- 混合反馈循环: 集成了字符串相似度检查器,在提供二元成功信号的同时提供细粒度的、标记级的反馈。该机制通过抑制生成与已证实的成功模式偏差过大的后缀,从而缩小了搜索空间,加速了有效攻击的发现。
- 黑盒有效性: 该方法仅需对受害者模型进行黑盒访问,使其适用于开源和闭源模型,无需内部权重。
结果
作者在 7 个受害者 LLM 上,使用 HarmBench 标准行为测试集,将 LLM STINGER 与 15 种最先进的(SOTA)红队测试方法(包括 GCG、PAIR、TAP、AutoDAN 等)进行了对比评估。
- LLaMA2-7B-chat: 实现了 89.3% 的攻击成功率(ASR),比次优方法高出 57.2%。
- Claude 2: 实现了 52.2% 的 ASR,比次优方法(仅为 1.9%)高出 50.3%。
- GPT-3.5 Turbo (0613): 实现了 88.67% 的 ASR。
- GPT-3.5 Turbo (1106): 实现了 94.97% 的 ASR。
- Gemma-2B-it: 在与其作为攻击者时相同的模型架构上实现了 99.4% 的 ASR,展示了极高的适应性。
在所有测试场景中,LLM STINGER 的表现均优于所有 15 种对比方法。作者通过人工验证确保了高成功率是由于真实的越狱而非分类器欺骗(classifier gaming)。
重要性与主张
本文声称 LLM STINGER 解决了越狱搜索问题中的组合难度问题,即朴素方法失效的情况。通过利用由判定 LLM 和字符串相似度检查器引导的 RL 启发式搜索,该系统有效地将搜索空间缩小到了高潜力区域。
作者断言其方法展示了:
- 鲁棒性: 能够绕过已知具有广泛安全训练的模型(如 Claude 2、LLaMA2)的防御。
- 可扩展性: 能够自动化发现新的后缀,而无需人工干预或白盒访问。
- 适应性: 在包括开源和闭源系统在内的多种模型架构上均表现有效。
该研究强调,仅靠安全训练可能不足以应对自动化的、基于强化学习驱动的攻击演化,这表明需要更强大的防御策略来应对此类自适应对手。未来的工作建议包括增加额外的标记级攻击方法、与多模态模型进行比较,以及进一步探索反馈机制。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。