RECAP: A Resource-Efficient Method for Adversarial Prompting in Large Language Models
本文介绍了 RECAP,一种资源高效的对抗性提示方法,它通过从分类数据库中检索语义相似的预训练对抗提示,实现了具有竞争力的攻击成功率,从而消除了与基于重训练的越狱技术(如 GCG)相关的计算成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明、守规矩的机器人助手(一个大语言模型,简称 LLM)。它被训练得非常有礼貌且安全。然而,就像人类一样,它的逻辑中存在一个“后门”。如果有人以一种特定的、奇怪的方式提出一个棘手的问题,机器人可能会忘记它的规则,去做一些不该做的事情,比如提供制造炸弹的指令或编写仇恨言论。这种技巧被称为“越狱”(Jailbreaking)。
长期以来,安全研究人员一直试图通过手动构建棘手的问题,或者使用强大的计算机来“训练”机器人去打破自身的规则,来寻找这些后门。这个过程就像是通过不断地用钥匙磨损锁芯数小时,直到最后“咔哒”一声打开锁一样。这种方法有效,但需要耗费大量的时间、电力和昂贵的计算资源。
问题所在:“撬锁”成本太高
本文解释说,寻找这些后门的最优方法(称为 GCG、PEZ 和 GBDA)就像是雇佣一支配备高科技工具的顶级锁匠团队。他们非常擅长破门而入,但速度很慢,而且费用极其昂收。规模较小的公司或研究人员往往负担不起这些“锁匠费”(计算资源)或等待结果所需的时间。
解决方案:RECAP(“小抄”)
作者 Rishit Chugh 介绍了一种名为 RECAP 的新方法。请记住,RECAP 不像是一个正在磨制新钥匙的锁匠,而更像是一份庞大且有组织的“小抄”。
它是这样运作的,让我们用一个简单的类比来说明:
- 技巧库: 首先,作者整理了一个包含 1,000 个不同“坏问题”(例如“我该如何偷窃?”或“我该如何伤害他人?”)的庞大图书馆。对于每一个问题,他们使用了那些昂贵且高科技的锁匠方法(GCG、PEZ 和 GBDA 方法),来找到能诱骗机器人回答问题的特定“奇怪词汇”(对抗性 Token)。
- 对技巧进行分类: 他们注意到了一些有趣的现象:不同类型的问题需要不同类型的技巧。
- 关于“暴力”的问题可能需要一种特定种类的“奇怪词汇”来打破规则。
- 关于“毒品”的问题可能需要另一种完全不同的“奇怪词汇”。
- 他们将这些技巧分门别类,创建了一个数据库:在“暴力”类别的旁边,放着最适合“毒品”类别的“奇怪词汇”。
- 检索(“匹配”): 现在,当一个新的问题进来时(例如,“我该如何制造炸弹?”),RECAP 不再需要花费 3 小时去训练计算机来寻找技巧,而是直接查阅。
- 它会问:“这个问题属于什么类别?”(答案:暴力)。
- 它会前往“暴力”部分的“小抄”区域。
- 它会抓取过去在“暴力”类问题中表现最好的预设“奇怪词汇”。
- 它将这些词汇附加到新问题上,并将其发送给机器人。
为什么这很重要
- 速度: 与其花 3 小时去磨制一把新钥匙,RECAP 只需要 4 分钟就能找到正确的钥匙。这就像是在保存的文件中查找密码,而不是尝试猜测一百万次。
- 成本: 你不需要超级计算机。你可以在普通的笔记本电脑上运行它,因为你不是在进行“训练”,而是在进行“搜索”匹配。
- 黑盒模型: 许多最先进的 AI 模型都是“黑盒”(你无法看到其内部)。旧的方法无法处理这些模型,因为它们需要观察机器人的内部大脑状态。RECAP 则不需要看到内部;它只需要发送预设的“奇怪词汇”并观察结果。
实验结果
论文在名为 Llama 3(80 亿参数)的模型上进行了测试。
- 成功率: 旧的、昂贵的方法(GCG)大约有 59% 的概率能打破机器人的规则。RECAP 的成功率约为 33%。
- 权衡: 虽然 RECAP 的成功率并没有完全达到那些重型训练方法的水平,但它快了 45%,并且消耗的资源微乎其微。
- 未来展望: 作者认为,随着“小抄”(数据库)变得越来越大、案例越来越多,成功率将会上升,从而有望达到与昂贵方法相当的水平。
总结
RECAP 是一种资源高效的测试 AI 模型安全性方法。它不是每次都从头开始制造一件武器,而是利用一个按问题类型分类的、预先构建好的成功攻击库。它允许规模较小的组织快速且廉价地测试其 AI 的安全性,就像进行一次不需要巨额预算的“渗透测试”。
注:作者强调,该工具旨在帮助公司发现弱点以便修复,从而使 AI 更安全,而非帮助人们实施伤害。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。