SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs
本文介绍了 SafeNexus,这是一个跨模态安全对齐框架,它通过针对性的抑制与激活放大来识别并引导模态通用的安全神经元,从而在保持效用的同时,使多模态大语言模型能够稳健地防御多种跨模态威胁。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网是一个巨大且繁忙的图书馆,其中的书不仅能被阅读,还能与你对话。在很长一段时间里,这些会说话的书仅仅是文本形式,就像一个非常聪明的聊天机器人。但最近,它们已经进化成了“多模态大语言模型”(MLLMs)。你可以把它们想象成超级图书管理员,现在它们可以同时阅读文本、观察图片并聆听音频。它们非常乐于助人,但这种新超能力也带来了一个代价:它为那些捣蛋鬼提供了新的欺骗手段。正如博物馆的保安可能懂得如何识别假画,却没能注意到假录音一样,这些人工智能模型通常拥有的安全防护机制往往只针对某一种类型的输入起作用。如果你试图用一张图片而不是文字,或者一段音频而不是句子来欺骗它们,这些守卫可能会完全忽略危险。研究人员提出的重大问题是:我们该如何构建一个无论捣蛋鬼尝试以何种方式潜入都能奏效的安全系统?
这正是名为 SafeNexus 的一项新研究介入的地方。来自中国和新加坡大学的研究团队决定不再从外部观察人工智能的安全性能,而是深入到人工智能的“大脑”内部进行一场“寻宝之旅”。他们发现,人工智能拒绝恶意请求的能力并不是随机分布的;它实际上是由一组被称为神经元的微小、特殊的内部开关所控制的。
有趣的部分在于:研究团队发现,虽然不同类型的输入(如文本、图像或音频)使用大脑的不同部分来处理信息,但存在一个秘密的、共享的神经元俱乐部,它充当了所有输入的终极“危险探测器”。他们称之为 US-Neurons(模态通用安全神经元)。这就像是发现,无论你是试图携带刀具、炸弹还是假身份证绕过安检,走廊里都有一台特定的、微小的监控摄像头能识破这一切。如果你关掉那台摄像头,无论入侵者携带什么,整栋建筑都会变得不安全。
论文指出,以往的方法试图通过重新训练整个人工智能或添加外部过滤器来修补安全漏洞,这就像是为每一扇门都雇佣一名新的保安。SafeNexus 则采取了不同的方法:它找到了那些关键的“危险探测器”神经元,并赋予它们超能力。团队测试了两种方法:
- 放大器(The Amplifier): 在人工智能思考的过程中,他们简单地调高了这些特定神经元的“音量”,让它们更大声、更快地喊出“危险!”。
- 校准器(The Calibrator): 他们对这些特定神经元进行了微小的、有针对性的“调优”(使用一种称为 LoRA 的方法),使它们能够更自然地识别麻烦,而无需重新训练整个人工智能。
结果令人印象深刻。当他们在 Qwen 和 VITA 等模型上进行测试时,他们发现增强这几个神经元能让人工智能更好地拒绝有害请求,无论该请求是以文本、图片还是声音的形式呈现。至关重要的是,他们发现这种增强并没有让人工智能变得“愚笨”或过度谨慎。它不会开始拒绝无害的问题(比如“我该如何烤蛋糕?”),也不会忘记它的其他职责。事实上,在某些测试中,这种新方法在阻止攻击方面远优于目前最好的方法,同时改变的参数量还不到人工智能总脑力的 0.05%。
研究人员还展示了这种技巧甚至适用于他们并未明确训练过的领域,例如视频。尽管在“调优”阶段从未向人工智能展示过视频片段,但经过增强的神经元在识别视频攻击中的危险方面依然表现出色。这表明他们真正找到了一个核心的、通用的安全机制,而不仅仅是记住了特定的例子。
简而言之,SafeNexus 表明,我们不需要为了让 AI 在所有格式下都保持安全而重建整个 AI 的安全系统。相反,我们只需要找到机器内部那几个微小的、通用的“刹车”,并确保它们发挥出全力的强度。这有点像意识到,要让汽车不再超速,你不需要更换整个引擎,你只需要确保刹车踏板与车轮紧密连接即可。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。