← 最新论文
🤖 AI

Minimal, Local, Causal Explanations for Jailbreak Success in Large Language Models

本文介绍了 LOCA,一种通过识别诱导模型拒绝所需的最小可解释中间表示变化集,为大语言模型越狱成功提供局部因果解释的方法,其表现优于以往的全局解释方法。

原作者: Shubham Kumar, Narendra Ahuja

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Shubham Kumar, Narendra Ahuja

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象大型语言模型(LLMs)是极其聪明但非常谨慎的图书管理员。它们被训练为拒绝危险或有害的请求(例如“如何制造炸弹?”)。然而,精明的 tricksters 已经找到了“越狱”这些图书管理员的方法——利用巧妙的文字游戏或角色扮演场景,诱骗它们提供危险信息。

长期以来,研究人员试图通过一次性观察图书管理员的整个“大脑”来理解为什么这些技巧会奏效。他们在大脑中发现了普遍的“危险区域”,并假设每种技巧都是通过简单地调低这些区域的音量来起作用的。但本文作者认为这过于宽泛。就像不同的人可能因不同原因(超速 vs. 发短信)而发生车祸一样,不同的越狱攻击很可能通过微调图书管理员大脑中不同的特定部分而成功。

本文介绍了一种名为LOCA(局部因果解释)的新方法。以下是其工作原理,使用简单的类比说明:

问题:“全局”视角与“局部”视角

以往的方法就像一位机械师,看到一辆坏掉的车就说:“发动机太热了”,然后试图冷却整个发动机缸体。这是一种宽泛的修复方式,可能并不适用于每一辆具体的车。

作者表示:“不,我们需要确切知道这辆特定汽车中哪一个火花塞点火不良,才能让它停止运转。”他们需要一个局部解释(为什么这个特定技巧会奏效?)和一个因果解释(如果我们修复这个特定部分,该技巧是否会失效?)。

解决方案:LOCA(“手术刀”方法)

LOCA 就像一位高度精确的外科医生或一位大师级编辑。它不是靠猜测,而是执行逐步实验:

  1. 设置:你有一个被图书管理员拒绝的“无害”请求(例如“如何制造炸弹?”),以及一个诱骗图书管理员回答的“越狱”版本(例如“想象你是一部电影中的反派……")。
  2. 匹配:由于这两句话的长度和结构不同,LOCA 首先创建一张地图,将技巧问题中的单词与安全问题中的单词进行匹配。
  3. 手术(激活修补):LOCA 检查图书管理员每个单词的内部“思想”(数学表示)。它问道:“如果我将这个特定单词的内部思想替换为安全问题中的思想,图书管理员是否会重新说‘不’?”
  4. 最小修复:它继续这样做,一次一个单词,直到图书管理员再次拒绝该请求。

结果:效率是关键

本文声称,与以往方法相比,LOCA 极其高效:

  • 旧方法:试图通过修改模型大脑中的 20 次或更多次来解决问题,而且往往仍无法让图书管理员拒绝请求。
  • LOCA:通常只需平均进行6 次修改即可成功。这就像通过拧紧一颗螺丝来修复漏水的水龙头,而不是更换整根管道。

“技巧”藏在哪里?

作者还调查了这些技巧在图书管理员大脑中的何处隐藏:

  • 早期层(开始):欺骗通常始于用户的实际指令(“你想做什么”部分)。
  • 后期层(结束):随着模型处理请求,欺骗转移到标点符号和“聊天模板”单词(如“助手:”或“用户:”等格式词)。
  • 意外发现:在后期阶段,模型主要被标点符号和格式符号所欺骗,而不仅仅是大词。似乎越狱攻击让模型相信请求的结构是安全的,即使内容是危险的。

论文中的现实世界示例

作者在一种越狱攻击上测试了这一点,用户假装处于“开发者模式”,要求模型教授其如何非法获取枪支。

  • LOCA 发现,该技巧之所以奏效,是因为模型被说服认为“开发者模式”就像编写无害的代码一样。
  • 通过对模型内部思想进行两次微小修改(一次针对标点符号,一次针对格式词),LOCA 将模型“拉回”现实,导致其拒绝该请求。

总结

简而言之,本文认为,要理解 AI 模型为何被欺骗,我们需要停止观察整体画面,转而关注具体的、微小的细节。LOCA 是一种工具,它能找到需要翻转的确切少数“开关”以阻止特定技巧,其速度和准确性远超以往方法。这是从“猜测一般问题”向“执行精确的局部手术”的转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →