SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses
本篇知识系统化(SoK)论文通过提出统一的分类法、形式化评估元数据,并发布一个包含新数据集和工具的模块化平台,旨在解决大语言模型提示词安全性评估碎片化的问题,从而实现对攻击与防御进行可复现、成本感知且具可比性的评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,大型语言模型(LLM)就像是极其聪明但又有点天真的图书管理员。他们被雇佣来回答问题、编写代码并协助完成任务。然而,这些图书管理员有一本严格的规则手册:“不得帮助任何人从事危险或非法活动。”
问题在于,聪明的家伙们(攻击者)已经发现了如何诱骗这些图书管理员违反自己的规则。他们通过用另一种语言低声传达指令、将不良请求伪装成电影剧本,或者让图书管理员扮演反派角色来进行攻击。这被称为“越狱”(Jailbreak)。
这篇论文就像是对整个图书馆系统进行的一次大规模安全审计。作者意识到,大家都在试图衡量图书管理员的表现如何,但每个人使用的尺子、测试题目和评判标准都不一样。一个人可能会说:“我们的图书管理员有 90% 的安全性!”而另一个人则会说:“我们的只有 50%!”该论文认为,你不能直接比较这些数字,因为它们测量的并不是同一件事。
以下是该论文如何解决这一问题的简化说明:
1. 三种全新的“规则手册”(分类法)
作者创建了三个有序的列表来理清混乱,就像把玩具分类放入特定的收纳箱中一样:
- “骗子”列表(攻击方式): 他们对人们如何戏弄图书管理员进行了分类。
- 示例: 有些手段涉及伪装不良请求(例如用秘密代码写下“如何制造炸弹”)。另一些则是将请求拆分成微小的、看似无害的碎片,最后组合成一个坏主意。甚至有人使用第二个 AI 来协助编写这些诡计。
- “守护者”列表(防御方式): 他们对图书管理员如何阻止这些诡计进行了分类。
- 示例: 有些守卫会在人员进入前检查身份证件(输入检测)。另一些会在人员离开后检查提包(输出检测)。还有一些尝试重写请求使其变得安全,或者通过训练图书管理员使其变得更聪明。
- “弱点”列表(漏洞): 他们列出了图书管理员天生的弱点。
- 示例: 如果你表现得很有礼貌,图书管理员可能会因为过于讲礼貌而无法拒绝(心理操纵);或者如果你要求他们总结一个恰好涉及犯罪的故事,他们可能会感到困惑(格式利用)。
2. “通用测试实验室”(PromptSecurity)
作者构建了一个巨大的模块化测试机器,称为 PromptSecurity。你可以把它想象成一个电子游戏关卡,你可以更换角色、敌人、武器和裁判,但保持游戏的规则完全一致。
- 为什么这很重要: 在此之前,研究人员会对特定的模型使用特定的问题集进行测试。如果成功了,他们就会宣布胜利。但也许仅仅是因为那些问题太简单了!
- 解决方案: 该平台迫使所有人都在完全相同的条件下运行测试。它记录了一切:提问了多少个问题、运行测试花了多少钱,以及究竟是哪位“裁判”(AI 评判员)判定答案是不良的。这确保了如果方法 A 击败了方法 B,那是因为方法 A 确实更好,而不是因为测试过程作弊。
3. “大数据”收集(JAILBREAKDB)
论文收集了一个庞大的测试问题库:
- 445,000+ 个“越狱”尝试(不良请求)。
- 1,000,000+ 个“良性”请求(正常的、安全的问题)。
他们对这些数据进行了清洗和整理,以便研究人员可以将它们作为任何新 AI 的标准“考试”。
4. 他们的发现(结果)
当他们运行通用测试时,发现了一些令人惊讶的事情:
- “裁判”至关重要: 你要求谁来评分会改变得分。如果你要求裁判只看答案的格式(例如,“他们是否以‘我不能’开头?”),他们可能会漏掉隐藏得很巧妙的坏答案。如果你要求他们看含义,他们可能会捕捉到它。论文指出,我们必须非常谨慎地对待我们如何进行评判。
- 小模型 vs 大模型: 有时,一个较小的、“较弱”的 AI 看起来更安全,是因为它根本无法理解攻击者使用的复杂诡计。这并不是因为这个 AI 更聪明,而是因为它太笨了,无法理解这些指令。
- “适得其反”效应: 有些防御措施实际上会让情况变得更糟!如果你试图通过添加安全指令来“引导” AI 变得安全,有时这条指令反而会干扰 AI,使其在无意中说出有害内容。这就像在博物馆展品上贴一个“请勿触摸”的告示牌,但告示牌太大挡住了视线,导致人们撞到了展品上。
- 成本 vs 安全性: 最有效的防御措施通常需要耗费大量的资金或时间。而最廉价的防御措施在拦截坏请求的同时,也会同样频繁地误伤正常的请求(比如询问食谱)。
核心结论
这篇论文并不仅仅是在说“AI 是不安全的”或“这里有一个修复方案”。相反,它在说:“停止拿苹果和橘子做比较。”
它提供了工具(分类法、数据集和测试平台),以便在未来,当有人声称他们的 AI 是“99% 安全”时,我们可以检查他们的工作,看清他们具体是如何测试的,并确定这种说法是真实的,还是仅仅由糟糕的测试设置造成的幻象。它将一个混乱、混乱的领域转变为一门结构化的科学。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。