FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption
本文介绍了 FlashRT,这是一个新颖的框架,可显著提升基于优化的红队测试在长上下文大语言模型中的计算与内存效率,从而实现对提示注入和知识篡改攻击更快、更易获取的安全评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位超级聪明的图书管理员(即大型语言模型,或 LLM),他读过数百万本书,并能根据他当前持有的海量文档库回答任何问题。这就是让现代人工智能如此强大的“长上下文”能力。
然而,存在一个问题:一个狡猾的捣蛋鬼(攻击者)可以将一张微小且隐蔽的纸条塞进那堆庞大的文档中。如果图书管理员不够小心,他可能会忽略原本的问题,转而遵循捣蛋鬼的纸条,从而给出错误或危险的回答。这被称为“提示注入”或“知识污染”攻击。
为了保护这些图书管理员的安全,安全研究人员会进行“红队”演练。他们试图扮演捣蛋鬼,以观察图书管理员有多容易被愚弄。测试这一点的最佳方法是使用“基于优化”的方法——本质上,就是利用计算机通过数学计算来找出要塞入的“完美”隐藏纸条。
问题所在:“沉重的背包”
这些最佳测试方法的问题在于它们极其沉重且缓慢。
- 背包(内存): 为了找出完美的纸条,计算机必须为庞大图书馆中的每一个单词携带一个巨大的“计算背包”(梯度)。如果图书馆很长,这个背包会变得极其沉重(占满计算机的所有内存),导致计算机崩溃。
- 马拉松(时间): 计算机必须进行一场马拉松,逐一检查成千上万种可能的纸条。对于长文档而言,这可能需要数小时。
由于这些测试如此沉重,研究人员往往无法测试最大、最强大的人工智能模型,或者不得不完全放弃对长文档的测试。
解决方案:FlashRT(“闪光”工具)
本文的作者开发了一种名为 FlashRT 的新工具。可以将 FlashRT 想象为一套“效率技巧”,它能让计算机进行相同的安全测试,但背负的背包更轻,运行时间更短。
以下是他们如何利用简单的类比来实现这一点的:
1. “选择性重读”技巧(解决时间问题)
通常情况下,为了检查一张新的隐藏纸条是否有效,计算机每次尝试新纸条时,都必须从头开始重新阅读整堆文档。这就像仅仅为了修改中间的一句话,就要重新阅读一本 500 页的书。
FlashRT 的修复方案:
FlashRT 意识到书中的大部分内容并未改变。它表示:“让我们记住书的前半部分和结尾部分。我们只需要重新阅读纸条所在的中间部分,以及附近可能需要的几句重要句子。”
- 比喻: 想象你在检查一份长长的食谱。如果你修改了中间的一种配料,你就不需要重新阅读整个配料清单和最后的摆盘说明。你只需要重新计算你修改的部分以及依赖它的几个步骤。
- 结果: 这将测试一张纸条所需的时间缩短了 2 到 7 倍。原本需要一小时完成的测试,现在不到十分钟即可完成。
2. “部分地图”技巧(解决内存问题)
为了找到完美的纸条,计算机通常需要绘制整个图书馆的详细地图,以查看每个单词如何与其他单词相连。对于巨大的图书馆而言,这张地图会占用大量空间(GPU 内存),导致计算机空间不足。
FlashRT 的修复方案:
FlashRT 表示:“为了推测方向,我们不需要整个图书馆的完美地图。让我们只随机查看几个书架,以获得大致的方向感。”
- 比喻: 如果你试图在巨大的图书馆中找到一本特定的书,你不需要记住每一本书的位置。你只需要检查几个随机通道,就能很好地掌握寻找的方向。这并非 100% 精确,但足以让你在无需携带整栋建筑地图的情况下,保持正确的行进方向。
- 结果: 这将所需的内存减少了 2 到 4 倍。原本需要 264 GB 巨大内存(大多数计算机都不具备)的测试,现在只需 65 GB 的标准内存即可运行。
他们发现了什么?
研究人员在各种人工智能模型和数据集(如阅读理解和对长报告进行摘要)上测试了 FlashRT。
- 速度: 快了 2 到 7 倍。
- 内存: 使用的内存减少了 2 到 4 倍。
- 有效性: 在发现安全漏洞方面,它与旧有的、沉重的方法一样有效(甚至更好)。
为什么这很重要
在 FlashRT 出现之前,许多研究人员无法测试长上下文人工智能的安全性,因为他们的计算机会崩溃,或者过程耗时过长。FlashRT 充当了安全测试的“轻量级”版本,使研究人员能够系统地检查这些强大的人工智能助手在现实世界中是否安全,即使它们正在同时阅读数千页文本。
该论文还指出,该工具可用于测试旨在“安全”的人工智能模型(如 Meta-SecAlign),证明即使是最稳健的模型,如果攻击足够强大,也可能被愚弄;而现在,我们无需超级计算机即可对此进行测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。