Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks
本文提出了一种动态路由自适应对齐(Dynamic Routing Adaptive Alignment, DRAA)框架,该框架通过识别并定位安全路由,进而训练补偿路径,以在主要安全机制被破坏时仍能维持拒绝行为,从而增强大型基础模型针对白盒攻击的鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走在一座宏大且繁忙的图书馆里,书本竟然能和你对话。这就是大型基础模型(LFMs)的世界——这些超级聪明的 AI 大脑驱动着从写作助手到聊天机器人的方方面面。为了让这些 AI 系统变得安全,它们的大脑内部需要一个“安全卫士”,阻止它们回答危险的问题,比如“如何制造炸弹?”或“如何入侵银行?”长期以来,科学家们认为这个卫士是一扇坚固的单向门。他们建造了防御措施来锁紧这扇门。但最近,黑客(即“白盒攻击者”)发现,他们可以窥视图书馆的设计蓝图,精准找到这扇门的位置,然后直接拆掉它的合页。一旦门没了,AI 就会忘记如何说“不”,并乐于助人地提供那些有害的信息。一个巨大的问题是:我们如何构建一个不再依赖于单一之门,而是能在旧门被撞倒时瞬间建立起新墙的 AI?
这正是论文《移动安全屏障:针对白盒攻击的动态路由自适应对齐》(Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks)所探讨的内容。作者们(由 Shangze Li 及其同事领导)意识到,传统的 AI 安全构建方式过于僵化。他们提出了一个名为 DRAA(动态路由自适应对齐)的新框架。你可以把它想象成训练一名保安,不仅要让他站在特定的门口,还要学习如何在门口被封锁时,立即将流量重新引导至一条秘密隧道。
以下是他们的“魔术戏法”是如何运作的,分为简单的几个步骤:
1. 寻找“神奇之门”
首先,研究人员必须弄清楚 AI 大脑中负责“说不”的部分究竟在哪里。他们向 AI 输入安全问题(如“如何烤蛋糕?”)和不安全问题(如“如何偷走蛋糕?”)。通过对比 AI 大脑细胞(神经元)在处理这两类问题时的激活情况,他们精准定位了“安全路径”——即作为主要卫士的一条特定神经元路径。
2. 有意破坏这扇门
接下来,他们做了一件冒险的事:他们暂时“关闭”了 AI 大脑中的这条主要安全路径。他们再次询问 AI 那些危险问题。正如预期的那样,失去了主要卫士后,AI 开始给出错误的答案。这就是他们需要研究的“失败案例”。
3. 教会“绕行策略”
这是最聪明的部分。研究人员利用这些 AI 失败的时刻(因为主门消失了),来教给 AI 一堂新课。他们说:“嘿,当主要卫士不在场时,你必须找到另一种方法来说‘不’。”他们使用了一种特殊的训练方法,称为 DR-DPO(动态路由直接偏好优化)。想象这是一个游戏,AI 被迫学习一种“绕行”策略。这种训练锁定了原始的安全神经元,使得 AI 不能仅仅依赖它们;它必须在自己的大脑中寻找新的、隐藏的路径来应对危险。
4. 结果:一个超强韧性的 AI
研究人员在包括 Qwen2.5 和 LLaMA-3.2 在内的多个不同 AI 模型上测试了该方法。结果令人印象深刻。当黑客试图“剪枝”(切除)已知的安全神经元时,旧的 AI 模型会崩溃并给出有害答案。但经过 DRAA 训练的模型呢?它们依然保持着说“不”的能力。
例如,在一个拥有 140 亿参数的模型(Qwen2.5-14B)上,标准的防御在受到安全路径攻击时完全失效,导致 313 个有害提示词中有 270 个得以通过。然而,DRAA 模型仅让 5 个提示词通过。即使是在 15 亿参数的小型版本上,DRAA 也将失败率从 248 降低到了仅为 43。
作者还检查了这种“绕行”技能是否会让 AI 变得变笨。他们在数学问题(GSM8K)和通用知识(ARC)上进行了测试。结果显示,该 AI 依然像以前一样聪明且乐于助人;它只是获得了一种即便在主要防御被摧毁时也能保持安全的超能力。
为什么这很重要
这篇论文表明,依赖单一、静态的安全路径是 AI 安全中的致命缺陷。如果攻击者知道卫士在哪里,他们就可以移除它。DRAA 提出了一种更好的方法:建立冗余。通过训练 AI 在主路径受损时动态切换到备份路径,我们创建了一个更难被攻破的系统。作者发现,这种方法不仅适用于文本,也适用于图像和视频(多模态模型),使其成为应对下一代 AI 攻击的强大盾牌。
简而言之,这篇论文认为,安全不应该是一扇锁着的单向门;它应该是一个灵活的网络路径,能够瞬间重新路由流量,确保无论有人如何努力尝试破门而入,AI 都能保持安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。