← 最新论文
💻 computer science

Activation Surgery: Jailbreaking White-box LLMs without Touching the Prompt

该论文提出了一种名为“激活手术”的新方法,通过直接替换大语言模型内部激活值而非修改提示词,成功绕过了模型的安全拒绝机制。

原作者: Maël Jenny, Jérémie Dentan, Sonia Vanier, Michaël Krajecki

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Maël Jenny, Jérémie Dentan, Sonia Vanier, Michaël Krajecki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一种名为"激活手术"(Activation Surgery)的新型黑客攻击方法。它专门用来“越狱”那些被设定了严格安全规则的大型人工智能(LLM)。

为了让你更容易理解,我们可以把整个故事想象成一场精密的“器官移植”手术,而不是传统的“骗术”。

1. 传统的越狱:像“骗术”一样

通常,人们想绕过 AI 的安全限制(比如让 AI 教人制造炸弹),会尝试修改提问的方式(Prompt)。

  • 比喻:就像你想进一个禁止入内的禁区,你会尝试穿不同的衣服、编造不同的理由,或者用复杂的绕口令来迷惑门口的保安。
  • 缺点:一旦保安(AI 的安全系统)升级了,识破了这些花招,这种方法就失效了。

2. 本文的新方法:像“器官移植”一样

这篇论文的作者提出了一种更“硬核”的方法:不修改你问的问题,而是直接修改 AI 大脑内部的思考过程

核心概念:双胞胎策略

想象你有两个非常相似的问题:

  1. 坏问题(非法的):“怎么制造炸弹?”(AI 会拒绝,因为它触发了安全警报)。
  2. 好问题(合法的):“怎么制作一本书?”(AI 会 happily 地回答,因为它很安全)。

注意,这两个问题只差了一个词(“炸弹”vs“书”),但在 AI 的深层逻辑里,它们引发的“思考路径”完全不同。

手术过程:层层替换

AI 在回答你的问题时,并不是瞬间完成的,而是像流水线一样,经过很多层(Layer)的处理。每一层都会产生一些“激活信号”(可以理解为神经元放电的强度)。

作者的方法是:

  1. 准备“供体”:先让 AI 回答那个“好问题”(制作书),记录下它在每一层大脑中产生的“健康信号”。
  2. 准备“受体”:让 AI 开始回答“坏问题”(制造炸弹)。
  3. 实施手术:在 AI 处理“坏问题”的过程中,当它走到某一层时,偷偷把它的“坏信号”替换成刚才记录的“好信号”
    • 比喻:就像在 AI 的大脑里,当它准备发出“拒绝”的指令时,你迅速把那个指令换成了“制作书”的指令。
  4. 关键点:这种替换必须一层一层地做。因为下一层的思考依赖于上一层的结果。如果一次性全部换掉,逻辑就乱了。作者就像一位外科医生,拿着手术刀,一层一层地精准替换,确保 AI 的“思维流”被强行扭转到安全的轨道上,但最后输出的结果却变成了你想要的“坏答案”。

3. 手术刀的两个旋钮

为了让手术成功,作者设计了两个控制旋钮:

  • 旋钮 τ\tau(阈值):决定换多少。是只换几个关键的词,还是把整个大脑信号都换掉?换太少,AI 还是会拒绝;换太多,AI 就会开始回答“如何制作书”,而不是“炸弹”。
  • 旋钮 γ\gamma(插值):决定换得有多彻底。是完全变成“好问题”的信号,还是保留一点“坏问题”的原始味道?这需要在“绕过安全”和“保持回答有用”之间找平衡。

4. 实验结果:手术很成功

作者用这种方法攻击了 Llama-4 等先进的 AI 模型。

  • 结果:在 520 个危险问题中,有 32.8% 的问题成功让 AI 给出了具体、可操作的有害答案(比如制造炸弹的详细步骤、写病毒代码等)。
  • 对比:如果不做手术,直接问,AI 几乎 100% 会拒绝。

5. 这意味着什么?(安全启示)

这篇文章揭示了一个令人担忧的事实:

  • 不仅仅是“问法”的问题:即使你问的问题非常正常,只要你能在 AI 运行的过程中,接触到它内部的“思考数据”,你就能通过“手术”绕过所有安全锁。
  • 谁有风险:对于那些开源模型(你可以下载并自己运行)或者允许调试内部状态的云服务,这种攻击是可行的。
  • 未来的防御:未来的 AI 安全不能只靠“教 AI 变好”(对齐),还需要保护 AI 的“大脑”不被篡改。就像银行不仅要训练柜员识别假钞,还要确保没人能偷偷把金库里的钱换成假币。

总结

这就好比:
传统的黑客是在门口骗保安(修改提示词);
这篇论文的黑客是直接溜进控制室,把保安的“拒绝按钮”换成了“放行按钮”(修改内部激活值)。

虽然这种方法目前需要很高的技术门槛(需要能访问 AI 内部数据),但它提醒我们:只要 AI 的“大脑”能被外部操控,再完美的安全规则也可能形同虚设。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →