No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks
本文提出了分布式安全对齐(Distributed Safety Alignment, DSA),这是一种通过针对性干扰和梯度引导识别,将安全能力冗余编码至多个神经元中,从而在消除单点故障的同时保留通用效能,进而增强大语言模型抵御白盒神经元级攻击鲁棒性的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个巨大的、超级聪明的机器人成为一名得力的助手。你希望它在解决数学问题、写故事以及聊你的日常生活方面表现得才华横溢,但你也需要确保它绝不会同意协助进行危险的事情,比如黑进银行或写一封恶毒的信。这就是“AI安全”的世界,研究人员试图在这些庞大的计算机大脑中构建数字护栏。
为了理解这篇论文所解决的问题,请思考人类大脑是如何工作的。当你决定对一个坏主意说“不”时,并不只是你脑海中一个微小的念头在起作用,而是整个神经元团队在共同协作。但在我们今天使用的 AI 模型中,研究人员发现了一些可怕的事情:机器人的“不”往往是由极少数、非常特定的神经元来处理的。这就像是你整个安全团队竟然只依靠门口的一名微小的保安。如果一个聪明的黑客(“白盒攻击者”)能够潜入并击倒那名保安,整栋建筑就会门户大开。机器人会突然忘记如何说“不”,并可能开始协助处理可怕的要求。这篇论文提出了一个简单但至关重要的问题:如果我们不依赖于仅仅一个保安,而是训练一整支军队来分担这项工作,会怎么样呢?
这篇研究背后的研究人员,谢思邈(Simiao Xie)及其团队,提出了一种新的训练 AI 模型的方法,称为分布式安全对齐(Distributed Safety Alignment, DSA)。他们认为,目前使 AI 安全的方式过于脆弱,因为它将所有的“拒绝”能力集中在了一小组固定的神经元上。如果攻击者找到了并移除了这些特定的神经元,安全系统就会崩溃。为了解决这个问题,DSA 将安全处理得像一场大脑细胞的“抢凳子”游戏。
以下是他们的方法是如何运作的,这里使用了一个生动的比喻:想象 AI 的大脑是一个巨大的管弦乐团。在旧的方法中,只有第一小提琴手被允许演奏“停止!”这个音符。如果这位小提琴手病了或者被踢走了,音乐就会变成一场灾难。新的 DSA 方法则强迫指挥家(训练算法)让整个管弦乐团都学会那个“停止!”音符。
为了实现这一点,研究人员在训练过程中使用了一个聪明的技巧。他们首先识别出哪些神经元目前正在为拒绝坏请求而承担重任。然后,他们与模型玩一场“捉迷藏”游戏。他们故意关闭(掩蔽)那些顶尖的神经元,假装它们已经消失了。但转折在于:他们同时也会随机关闭其他神经元。这迫使 AI 感到一点恐慌,并意识到:“噢不,我的主要‘停止’神经元没了,而且一些备份神经元也丢了!我需要找到新的神经元来帮助我说‘不’!”
通过重复这个过程,AI 学会将“安全”这项工作分散到数百个不同的神经元上,而不是仅仅依靠几个。它变得像一个每个人都知道紧急代码的团队。即使攻击者设法击倒了原始的“安全神经元”,模型仍然会有数十个其他神经元准备好随时介入,拒绝那项有害的要求。
论文显示,这种方法的效果非常好。当他们在几种不同的 AI 模型(包括 Qwen2.5 和 LLaMA)上测试该方法时,他们发现即使攻击者试图手术式地移除最重要的安全神经元,经过 DSA 训练的模型仍然会拒绝做坏事。事实上,在某些测试中,当安全神经元被移除时,旧模型几乎每次都会失败,而 DSA 模型则几乎完美地保持着说“不”的能力。
至关重要的是,研究人员还检查了这种新的安全系统是否会让 AI 变笨。他们在数学问题、阅读理解和常识知识方面测试了这些模型,发现模型依然和以前一样聪明且乐于助人。安全性并没有以牺牲智能为代价;模型只是变得更难被欺骗了。
这篇论文表明,这种“分布式”方法是一个重大的进步,因为它不再依赖于“单点故障”。与其建造一个有一个弱点的墙,不如建造一个由许多丝线编织而成的安全网。如果其中一根丝线断了,这张网依然能兜住。虽然论文指出这是一种基于模拟的改进,且现实世界的攻击总是在不断演变,但结果强烈表明,将安全负载分散到 AI 的大脑中,是让这些强大的工具保持安全的一种更加稳健的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。