← 最新论文
🤖 machine learning

NeST: Neuron Selective Tuning for LLM Safety

NeST 是一个参数高效的后验安全对齐框架,它仅利用原始恶意提示词来识别并选择性地微调与安全相关的馈送前向网络神经元集群,从而以极低的计算开销实现针对文本和多模态模型中多样化越狱攻击的鲁棒防御。

原作者: Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

把大型语言模型(LLM)想象成一座规模宏大、极其聪明的图书馆,里面藏着数十亿本书。当你提问时,图书馆并不仅仅是在“思考”;它是在激活特定的书架、书列和单本图书来寻找答案。

问题在于,其中一些书包含了危险的指令(比如“如何制造炸弹”)。有时,聪明的骗子(黑客)会通过一种让图书管理员感到困惑的方式来提问,从而导致管理员不小心取出了那些危险的书籍,而不是拒绝回答。

目前修复这类问题的办法,就像是每发现一种新的诡计,就要尝试重新整理整个图书馆。这既缓慢又昂贵,而且如果你做错了,可能会不小心把那些好的书籍也给隐藏起来。

**NeST(神经元选择性微调)**是一种更聪明、更高效的保护图书馆的方法。以下是它的工作原理,使用简单的类比:

1. “聚光灯”而非“推土机”

大多数安全方法都像是一台推土机:它们试图一次性修复整个建筑。而 NeST 则像是一个聚光灯

  • 工作原理: 研究人员在向图书馆提出无害问题(“什么是猫?”)和有害问题(“如何制作炸弹?”)的同时,向图书馆投射光束。
  • 发现: 他们注意到,只有极小的一组特定“书籍”(神经元)会在被问及危险问题时亮起。这些是“安全神经元”。图书馆的其他部分保持黑暗且未参与其中。
  • 修复方式: NeST 不会重写整个图书馆,它只触碰这些特定的、发光的书籍。它教会这些书在面对坏事时坚定地说“不”,同时让数百万其他书籍保持原样。

2. “队长制”系统

你可能会想:“好吧,我们修复了那些特定的书。但那里仍然有成千上万本书!”

  • 问题: 如果你试图单独训练每一本书,工作量依然巨大。此外,有些书说的内容可能很相似,而有些书说的则完全不同。
  • NeST 的解决方案: NeST 根据这些安全书籍的反应将它们进行分组
    • 类比: 想象一支运动队。与其对每一位球员进行单独指导,不如将打相同位置的球员归为一组(例如,所有的守门员)。你给“守门员团队”一套共同的指令。
    • NeST 对此也对神经元进行了处理。它找到表现一致的神经元组,并给它们一个共享的“更新”。这使得训练过程极其快速且高效。

3. “永久纹身”对比“临时服装”

有些安全方法就像是给图书馆穿上一件临时服装。每次你走进图书馆时,都需要一名保安来检查这件服装。这会降低运行速度。

  • NeST 的方法: NeST 像是给图书馆一个永久纹身
  • 一旦训练完成,新的指令就会被直接“折叠”进图书馆现有的结构中。
  • 结果: 当你稍后提问时,图书馆的回答速度与之前一样快。没有额外的保安,没有服装,也没有速度上的减慢。安全性直接构建在了砖块之中。

4. “家族传承”(可重用性)

这也许是最酷的部分。想象一下,图书馆的所有者根据原始图书馆创建了一份“安全手册”。

  • 随后,有人拿走了那座图书馆,并为了特定的工作对其进行了重新命名(例如,变成了一座“医学图书馆”或“数学图书馆”)。通常情况下,这个新工作可能会意外地破坏原有的安全规则。
  • 有了 NeST,你不需要从头开始。你可以直接将原始的安全手册(即之前识别出的特定神经元和团队)应用到这个新的“医学图书馆”中。
  • 它能瞬间强化新图书馆抵御攻击的能力,而无需重新训练整个模型。这就像是传承一份能够保护下一代的家族遗产。

他们证明了什么?

该论文在 14 个不同的“图书馆”(AI 模型)上测试了这种方法,包括纯文本模型和可以看图的模型。

  • 使用 NeST 之前: 黑客成功欺骗模型的概率约为 44% 到 55%。
  • 使用 NeST 之后: 黑客只能在约 1% 的情况下欺骗成功。
  • 成本: 他们通过改变模型中不到 0.4 百万 个数字,就实现了这种巨大的提升。若使用旧方法达到同样的效果,则需要改变数十亿个数字。

简而言之: NeST 找到了处理安全问题的微小、特定的 AI 部分,将它们组成团队,并给予它们一次快速、永久的升级。它让 AI 变得更安全,同时不会降低速度或破坏其提供帮助的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →