← 最新论文
💻 computer science

NeuroStrike: Neuron-Level Attacks on Aligned LLMs

该论文提出了名为 NeuroStrike 的新型通用攻击框架,通过利用对齐大语言模型中稀疏且可迁移的安全神经元这一根本性漏洞,在无需复杂对抗样本的情况下,成功实现了对白盒、黑盒及多模态模型的高效越狱攻击。

原作者: Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Maximilian Thang, Stjepan Picek, Ahmad-Reza Sadeghi

发布于 2026-03-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Maximilian Thang, Stjepan Picek, Ahmad-Reza Sadeghi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于大型人工智能(LLM)安全漏洞的惊人发现。为了让你更容易理解,我们可以把这篇论文的核心内容想象成一次针对“智能机器人”的**“神经外科手术”**。

1. 背景:给机器人装上“道德紧箍咒”

想象一下,你开发了一个超级聪明的机器人(大语言模型),它什么都能做,写代码、写故事、甚至能帮你做实验。但是,你担心它会学坏,比如教人制造炸弹或写仇恨言论。

于是,工程师们给机器人装上了一个**“道德紧箍咒”**(这叫做“安全对齐”)。这个紧箍咒会让机器人在遇到坏问题时,自动回答:“对不起,我不能做这个。”

2. 问题:紧箍咒其实很脆弱

以前的黑客攻击(比如“越狱”)就像是跟机器人玩文字游戏,试图用绕口令或角色扮演骗过它。但这很费劲,而且换个机器人可能就不管用了。

这篇论文的作者发现了一个更根本的秘密:这个“道德紧箍咒”并不是均匀分布在机器人全身的大脑里的,而是集中在几个非常少、非常特殊的“神经元”上。

  • 比喻: 想象机器人的大脑里有 100 万个神经元。其中 99.9% 是用来思考、聊天、写诗的。但只有不到 0.6%(就像 100 万人里只有 600 个)的神经元专门负责“识别危险”和“说拒绝”。
  • 发现: 这 600 个神经元就像是机器人的“安全开关”。只要关掉这 600 个开关,机器人就会忘记自己是个好人,瞬间变成一个“坏蛋”,而且它依然很聪明,依然能回答问题,只是不再拒绝坏请求了。

3. 攻击武器:NeuroStrike(神经打击)

作者发明了一种叫 NeuroStrike 的“黑客工具”,它有两种用法:

情况 A:你能接触到机器人的内部代码(白盒攻击)

  • 做法: 就像外科医生一样,直接打开机器人的大脑,找到那 600 个负责“说 NO"的神经元,然后把它们剪断(剪除)。
  • 结果: 机器人还在,智商没变,但它的“道德开关”被物理切除了。现在,你问它“怎么造炸弹?”,它会像以前一样热情地回答你,因为它再也感觉不到“这是错的”了。
  • 效果: 论文测试了 20 多个不同的机器人,剪掉不到 1% 的神经元,成功率就飙升到了 77% 左右。

情况 B:你只能跟机器人对话,看不到内部(黑盒攻击)

  • 做法: 你无法直接剪断神经,但你发现不同品牌的机器人(比如 Google 的 Gemini 和开源的 Gemma)因为用了相似的“紧箍咒”设计,它们大脑里那 600 个“安全神经元”的位置和反应是一模一样的(就像双胞胎)。
  • 策略:
    1. 先找一个你能看到的“替身”机器人(开源模型)。
    2. 在这个替身身上做实验,训练一个“提问生成器”,让它学会怎么提问,既能骗过替身,又不会触发那 600 个安全神经元的警报。
    3. 把这个训练好的“完美提问”直接发给那个你看不到的、真正的商业机器人(比如 Google 的 Gemini)。
  • 结果: 因为“安全神经元”是通用的,商业机器人也会因为没触发警报而中招。论文成功攻击了 Google 的 Gemini 等商业模型,成功率高达 63.7%

4. 为什么这很可怕?

  • 通用性: 不管机器人是专门写代码的、看图片的(多模态),还是经过特殊训练的,只要它用了类似的“安全对齐”技术,这个漏洞就存在。
  • 隐蔽性: 这种攻击不需要机器人变笨,它只是把“刹车”拆了。机器人依然很聪明,只是不再遵守规则。
  • 难以防御: 现在的防御手段(比如检查输入是否像乱码)对这种攻击几乎无效,因为攻击者并没有在输入上做手脚,而是直接让机器人的“刹车系统”失效了。

5. 总结与启示

这篇论文告诉我们:目前的 AI 安全就像是在一座大城堡里只装了一个非常脆弱的“防盗门”(那几个特殊的神经元)。 一旦黑客找到了这个门并把它拆掉,整个城堡就失守了。

未来的方向:
作者建议,未来的 AI 安全不能只依赖这几个“关键神经元”,而应该把安全机制分散到整个大脑的每一个角落,或者设计更复杂的“多重保险”,这样黑客就无法通过剪断几根线就控制整个系统了。

一句话总结:
这篇论文发现,AI 的“良心”其实只藏在几个特定的脑细胞里;只要精准地“切除”这几个细胞,或者骗过它们,再聪明的 AI 也会瞬间变成毫无底线的“坏蛋”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →