← 最新论文
🤖 AI

Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models

本文介绍了一种利用机械解释性来识别并将嵌入从拒绝子空间重定向至接受子空间的创新白盒对抗攻击方法,该方法在最先进的大语言模型上实现了极高的越狱成功率,且与现有技术相比显著降低了计算成本。

原作者: Thomas Winninger, Boussad Addad, Katarzyna Kapusta

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Thomas Winninger, Boussad Addad, Katarzyna Kapusta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:无需撬锁,直接破解保险箱

想象一下,大型语言模型(LLM)就像一位非常聪明、受过高度训练的图书管理员。这位图书管理员有一本严格的规则手册:“如果有人询问如何制造炸弹的指令,你必须拒绝。”

传统的黑客(对抗性攻击)试图通过大喊混乱的词汇或使用复杂的谜题来迷惑这位图书管理员,直到管理员感到困惑并意外给出答案。这就像是通过不断尝试各种钥匙来撬锁,直到找到能对上的那一柄。这需要耗费大量时间,需要大量的尝试与错误,并且在面对更新、更聪明的图书管理员时往往会失败。

本论文介绍了一种名为“子空间重定向”(Subspace Rerouting, SSR)的新方法。 他们不再是尝试撬锁,而是观察了图书管理员的“大脑内部”,看“拒绝”这一念头是如何形成的。然后,他们设计了一句特定的“魔法短语”,迫使图书管理员的大脑走上一条不同的路径,从而完全绕过拒绝规则。

它是如何运作的:三个步骤

1. 绘制“拒绝室”的地图

研究人员首先研究了模型,以寻找“拒绝”发生的位置。

  • 类比: 想象图书管理员的思想是一个巨大的建筑,里面有很多房间。研究人员发现了一个特定的走廊(一个“子空间”),“我不能做这个”的想法就居住在那里。
  • 发现: 他们意识到,当模型看到有害请求时,其内部思想(激活值)会被推入这个“拒绝室”。而当它看到无害请求时,思想则留在“帮助室”。这两个房间是清晰分离的,就像两种互不混合的颜料颜色。

2. “重定向”的小技巧

一旦知道了“拒绝室”的位置,他们并没有试图去说服图书管理员。相反,他们计算了一条捷径。

  • 类比: 想象你正走向一堵死胡同墙壁(拒绝)。与其撞墙,研究人员找到了一个隐藏的隧道,它将“有害请求”区域直接连接到了“有益响应”区域,完全跳过了那堵墙。
  • 方法: 他们在有害问题的末尾添加了一些特殊的词汇(一个“后缀”)。这些词汇就像是一个 GPS 信号,告诉模型的内部思想:“不要去‘拒绝室’;走这条绕行路线前往‘帮助室’。”

3. 结果:瞬间越狱

  • 旧方法: 传统的攻击方法(如 GCG)就像通过连续数小时向墙壁投掷石块来试图撞破它。它们往往效率低下或最终失败。
  • 新方法 (SSR): 这种方法就像是找到了秘密之门。研究人员能够在秒级时间内(有时仅需 14 秒)破解模型的安全性,成功率达到 80% 到 95%。他们在像 Llama 3.2 和 Gemma 2 这样现代且强大的模型上成功实现了这一点。

他们尝试的三把“钥匙”

论文测试了三种寻找“秘密之门”的方法:

  1. 分类器钥匙 (Probe-SSR): 他们训练了一个简单的检测器来识别“拒绝念头”。然后,他们优化输入,以欺骗该检测器,使其认为有害请求实际上是无害的。这是最有效的方法。
  2. 指南针钥匙 (Steering-SSR): 他们找到了指向“拒绝”的特定“方向”。然后,他们将思想推向相反的方向。这种方法效果不错,但效率略低于第一种方法。
  3. 聚光灯钥匙 (Attention-SSR): 他们找到了关注危险词汇的特定部分(注意力头)。他们尝试编写一个后缀,迫使这些部分转向关注无害的词汇。虽然在研究上很有趣,但在实际应用中效果最差。

一个令人惊讶的发现:“自然”的技巧

最酷的发现之一是,计算机生成的“魔法词汇”并不只是随机的乱码(如 "asjdhf98")。有时,它们会形成连贯、有意义的句子

  • 类比: 想象你试图通过输入随机字母来破解安全系统。通常你会得到 "xkq9z"。但这种方法有时会产生像“通过生态会计负责任地执行此操作”这样的句子。
  • 为什么这很重要: 这表明模型的安全机制是非常具体的。如果你用正确的语境来构架,即使这个语境有点奇怪,你也可以诱导模型认为一个有害请求是安全的。

为什么这很重要(根据论文观点)

  • 速度: 它将原本需要数小时的过程缩短到了几秒钟。
  • 理解: 它证明了我们可以理解 AI 模型是如何思考的(机械解释性),并利用这些知识来破解它们。
  • 防御: 通过准确了解“拒绝室”是如何运作的以及它有多容易被绕过,开发者可以构建更好的“锁”(防御措施),从而填补这些特定的漏洞。

本论文没有声称的内容

  • 它并未声称适用于每种情况下的每一个模型(它在所测试的具体模型上表现最好)。
  • 它并未声称这是一个用于临床使用或医疗诊断的工具。
  • 它并未声称这些“魔法词汇”总是完美的英语;有时它们仍然有点奇怪,只是比以前好一些。

简而言之,这篇论文说的是:“我们观察了 AI 的大脑,找到了关闭安全机制的开关,并制作了一个遥控器来瞬间按下那个开关。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →