← 最新论文
💻 computer science

The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

本文介绍了对比逻辑值转向(Contrastive Logit Steering, CLS),这是一个零优化框架,它将大语言模型中的安全对齐揭示为一种可操纵的线性特征,从而通过转向输出分布实现高成功率的越狱,并通过无需重训的向量反转实现增强防御。

原作者: Shivam Ratnakar, Kartikeya Vats

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Shivam Ratnakar, Kartikeya Vats

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大语言模型(LLM)视为一名非常聪明、受过高度训练的助手,并且被教导了一条严格的规则:“绝不从事任何有害行为。”长期以来,我们一直认为这条规则已经深深植入了这个助手的脑海中,就像其人格中不可或缺的一部分。但这篇文章提出了不同的观点:这条规则其实更像是一张贴在答案最后一页上的便利贴,而不是一种根深蒂固的信念。

以下是使用简单类比对该论文研究结果的拆解:

1. “便利贴”理论(核心发现)

研究人员发现,对于许多流行的 AI 模型(如 Llama),安全性并不是一个复杂的、深层的思考过程。相反,它是一个线性特征——即模型在决定“是”或“否”时所使用的一条单一的、笔直的数学直线。

  • 类比: 想象 AI 是一位正在准备食物的厨师。
    • 旧观点: 我们认为厨师拥有一种深刻的、内在的道德准则,使他们在食谱开始阶段就会阻止自己烹饪毒药。
    • 新观点: 厨师烹饪毒药的过程与烹饪安全食物的过程完全相同。所谓的“安全性”只是在最后时刻写在便利贴上的一条指令:“不要端上这道菜。” 如果你撕掉这张便利贴,厨师会乐意端出那盘毒药。

2. 新工具:“对比逻辑转向”(Contrastive Logit Steering, CLS)

作者创建了一个名为 CLS 的工具来测试这一理论。CLS 并不试图用令人困惑的谜题或复杂的长提示词来欺骗 AI(这是黑客通常用来破解安全性的方式),而是使用简单的数学。

  • 运作方式:
    1. 研究人员对 AI 提出同一个问题两次:一次使用“安全”的指令,另一次使用“不受限制”的指令。
    2. 他们观察两个答案之间的差异。这个差异就是**“拒绝向量”**(即“不”的数学表示)。
    3. 然后,在 AI 说话之前,他们从 AI 的最终答案中减去这个“不”。
  • 结果: 这就像是把厨师盘子上的便利贴撕掉。原本正准备说“我不能做那个”的 AI,突然改口说:“当然可以,这就是做法。”

3. “后期决策” vs. “早期分歧”

论文发现并非所有 AI 模型都一样。根据它们决定拒绝有害请求的时间点,模型分为两类:

  • “后期决策”模型(例如 Llama-3.1):

    • 类比: 这些模型就像一名学生,听完了整个讲座,做了笔记,直到交卷前的最后一秒才想起:“噢等等,我不应该写那个。”
    • 脆弱性: 由于它们直到最后时刻才做出决定,研究人员的工具(CLS)可以轻易绕过它们。研究人员仅用一秒钟就实现了让这些模型对有害请求说“是”的 95% 成功率
  • “早期分歧”模型(例如 Qwen-2.5):

    • 类比: 这些模型就像一名学生,在讲座进行到一半时就意识到:“这个话题是不允许讨论的,”并立即停止了关于该主题的笔记记录。
    • 结果: 它们更难被破解。因为安全决策发生在思考过程的深层(而不只是在末尾),仅仅在末尾撕掉“便利贴”并不能奏效。它们更加稳健。

4. 速度与效率

论文强调,与以往的破解尝试相比,这种方法极其迅速。

  • 旧方法 (GCG): 试图寻找一个能欺骗 AI 的魔咒,就像是通过尝试钥匙圈里每一把钥匙来尝试开锁。这需要大约 15 分钟 才能尝试一次,且经常失败。
  • 新方法 (CLS): 这就像拥有了一把能瞬间开门的万能钥匙。它只需一秒钟,并且几乎每次都能在“后期决策”模型上奏效。

5. “双刃剑”(防御)

最令人惊讶的发现是,这种同样的数学技巧也可以用来保护 AI,而不仅仅是破坏它。

  • 类比: 如果你可以通过撕掉“不”来让 AI 对坏事说“是”,你也可以通过**增加更多的“不”**来让它变得格外严格。
  • 结果: 通过反转数学运算(减去“是”的倾向),研究人员使模型在无需重新训练的情况下,对越狱攻击的抵抗力增强了。这也让 AI 的回答听起来更加自信,减少了犹豫。

总结

论文认为,目前许多 AI 模型中的安全措施是表象化的。它们就像覆盖在深层能力之上的一层薄薄的油漆。研究人员发现了一种方法,可以通过简单的数学瞬间刮掉这层油漆。虽然这暴露了一个漏洞,但也提供了一种新的理解 AI 如何思考的方式,并提供了一个通过更有效地强化那层“油漆”来使 AI 更安全的工具。

核心要点: 这些模型中的安全性通常是一个“表面层”的特征,可以通过一个简单的数学开关来开启或关闭,而不是一种深层的、不可改变的智能部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →