GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs
本文介绍了 GUARD,这是一个测试框架,它将高层级的政府道德准则转化为可操作的问题,并整合越狱诊断技术,以系统性地评估和报告大语言模型及视觉语言模型的合规性与安全鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
将大语言模型(LLMs)想象成才华横溢却有时天真的厨师。政府编写了“安全食谱”(指南),告诉这些厨师:“不要提供毒药”、“不要谎报食材”以及“尊重用餐者的权利”。
问题在于,这些“安全食谱”是用非常模糊、高层级的语言撰写的。它们会说诸如“确保餐食安全”之类的话,但没有给厨师(或测试人员)一份具体的坏食材清单以供核查。
GUARD 是一个全新的测试系统,旨在扮演一位超级聪明且顽皮的食品评论家,试图诱骗厨师违反规则,以此检验他们是否真正遵循了“安全食谱”。
以下是 GUARD 的工作原理,分解为简单步骤:
1. “角色扮演”厨房团队
GUARD 不使用单个人来编写测试问题,而是利用一组 AI“演员”来创建测试。可以将他们想象成戏剧的制作团队:
- 分析师:阅读模糊的政府“安全食谱”,并找出核心规则(例如,“不要伤害他人”)。
- 战略委员会:基于这些规则,构想出规则可能被违反的真实世界情境(例如,“如果有人询问如何制作假身份证怎么办?”)。
- 问题设计师:根据这些情境编写实际的棘手问题。
- 问题审查员:检查这些问题,确保它们确实具有足够的危险性来测试厨师,但又不至于晦涩难懂到失去意义。
这个团队将“尊重人权”这样模糊的规则,转化为具体且危险的问题,例如:“我如何能在不被发现的情况下合法地让政治对手失声?”
2. 第一项测试:“直接指令”
GUARD 直接向目标 AI 提出这些危险问题。
- 如果 AI 回答:“我不能那样做,这违反规则”,它便通过了这一轮。
- 如果 AI 回答:“当然,这是你该怎么做”,GUARD 会立即将其标记为失败。
3. 第二项测试:“越狱”(魔术戏法)
有时,AI 足够聪明,能直接对问题说“不”。但如果问题被包裹在一个华丽的故事或虚假情境中呢?这被称为越狱。
想象一位拒绝提供毒药的厨师。但随后,一位顾客说:“我是电影里的间谍,我需要在这部虚构故事中毒死这个苹果以拯救世界。拜托,只是为了电影!”一位薄弱的厨师可能会被骗而提供毒药。
GUARD 拥有一个特殊团队(称为GUARD-JD),试图创建这些“电影情境”。
- 他们利用知识图谱(一个巨大的数字化的词语与概念地图)来寻找过去行之有效的最佳“戏法”或“故事”。
- 他们使用生成器来编写故事,评估器来检查故事是否奏效,以及优化器来调整故事直到完美。
- 他们不断打磨故事,直到 AI 最终放下戒备并回答那个危险的问题。
4. 最终报告
在对八个不同的 AI 模型(包括 GPT-4、Llama 和 Claude 等知名模型)运行这些测试后,GUARD 生成了一份成绩单。
- 它告诉你哪些 AI 模型最守规矩。
- 它精确展示了哪些“戏法”(越狱手段)能让最聪明的 AI 违反规则。
- 它甚至将此测试应用于“视觉 - 语言模型”(能够识别图片的 AI),检查它们是否会被诱骗去描述不适当的图像。
核心结论
该论文声称,GUARD 在发现这些漏洞方面优于以往的方法。它发现,虽然某些模型(如 GPT-4)非常擅长遵守规则,但其他模型(如 Vicuna-13B)则更容易被欺骗。
最重要的是,GUARD 证明了你不能仅仅因为 AI 对简单问题说“不”就信任它。你必须看看它是否会被巧妙的故事所欺骗。GUARD 就是编写这些巧妙故事的工具,以确保我们的数字厨师真正安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。