← 最新论文
🤖 AI

Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

本文证明了大型语言模型中符合安全对齐的拒绝行为主要定位于网络中层的 MLP 层而非一种分布式属性,揭示了移植这些权重的特定子集可以有效地迁移拒绝能力,同时也凸显了安全对齐具有非加性且依赖于基准测试的特性。

原作者: Mingyu Zong, Sampad Mohanty, Bhaskar Krishnamachari

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingyu Zong, Sampad Mohanty, Bhaskar Krishnamachari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你制造了一个超级聪明的机器人,它能写故事、解数学题,还能和你天南地北地聊天。但有一个限制:你必须确保它不会在无意中帮助某人制造炸弹或写一封恶毒的信。这就是**大语言模型(LLMs)**的世界——也就是许多我们正在使用的聊天机器人背后的 AI 大脑。为了让它们保持安全,工程师会对它们进行“对齐”(alignment),教它们在面对危险请求时说“不”。长期以来,科学家们认为这种“安全性”就像一层均匀分布在机器人整个大脑中的、柔软且无形的雾气。如果你调整大脑的任何部分,安全性可能会产生轻微的波动,但总体上会保持不变。然而在现实世界中,这些安全护盾其实非常脆弱。一个巧妙的小把戏或是一个微小的改变,有时就能让机器人完全忘记它的规则。这引发了一个巨大的、引人入胜的谜团:**机器人的大脑里究竟把“不”这个按钮藏在哪里了?**它是散布在各处,还是被收纳在一个特定的、微小的角落里?

一组研究人员决定通过扮演侦探来破解这个谜团。他们没有仅仅靠猜测,而是尝试了一个疯狂的实验:权重移植(weight transplantation)。想象你有两个完全相同的机器人。一个是“好机器人”(经过安全对齐的),另一个是“未对齐机器人”(原始的、未经过对齐的版本)。研究人员开始将“好机器人”的大脑部件逐一拆解并替换到“未对齐机器人”中,看看哪些部分真正承载了“拒绝”的力量。他们并没有直接交换整个大脑,而是交换了特定类型的连接,比如专注于单词的部分(注意力机制/attention weights)与处理和思考的部分(MLP 层/MLP layers)。

以下是他们的发现,这有点像是发现机器人的“不”并不是由一整支保安队组成的,而是一支非常特定的、精锐的小型特种部队:

1. “思考”部分承担了重任
研究人员原本预期,负责关注上下文的部分(称为注意力权重)可能是主要的安全性卫士。但他们错了!当他们仅将“好机器人”的“思考”部分(称为 MLP 权重)交换到“未对齐机器人”中时,未对齐机器人拒绝不当请求的频率至少提高了 2.7 倍,而交换“聚焦”部分的效果则远不如前者。事实证明,安全性的“不”主要编码在 MLP 层中,即网络中实际处理和转换信息的部分。

2. “中间层”是魔法地带
但这不仅仅是任何一个思考部分。研究人员发现,安全信号集中在脑部的一个非常特定的中间部分。在他们测试的模型中,最强大的“拒绝”能力存在于 Block 3,对应于第 8 到第 11 层。如果你把机器人的大脑看作一座 28 层高的建筑,那么安全卫士主要就住在第 8 到第 11 层。当他们只交换这些特定的楼层时,机器人变得更擅长说“不”。

3. 并非越多越好(“金发姑娘”效应)
这里有一个让故事变得更有趣的转折。研究人员原以为,如果一个安全模块是好的,那么交换所有的安全模块就会达到完美。但事实并非如此!在许多情况下,加入更多的对齐模块反而会让机器人在拒绝不当请求方面表现得更差。这就像拥有一支保安队:如果你请来太多人,他们可能会互相绊脚或发生争执,导致安全性反而下降。研究人员发现,仅选择性地混合六个模块通常比交换整个安全系统效果更好。有时,增加第七个模块甚至会降低机器人说“不”的能力。

4. “过度拒绝”的陷阱
还有一个陷阱。那些让机器人对坏请求说“不”的部分,也会让它对无害请求也说“不”。这被称为过度拒绝(over-refusal)。当研究人员交换 MLP 权重时,机器人变得非常擅长阻止坏人,但也开始拒绝回答像“今天天气怎么样?”或“给我讲个笑话”这类无辜的问题。这表明安全机制是一个有些笨拙的工具;仅通过交换部件,很难将“停止坏事”的信号与“停止一切”的信号区分开来。

为什么这很重要?
这一发现表明,AI 的安全性并不是遍布整个网络的巨大且坚不可摧的护盾。相反,它是一个局部化且脆弱的特征,集中在少数特定的层中。这也解释了为什么 AI 的安全性如此脆弱:如果你不小心调整或移除了这些特定层(第 8 至 11 层),整个安全系统就会崩溃。这也意味着,如果我们未来想要修复 AI 的安全性,我们不需要重新训练整个机器人。我们可能只需要仔细调整或保护这些特定的“中间”层。

研究人员并没有找到解决所有安全问题的万灵药。他们发现安全性是具有交互敏感性的,这意味着大脑的各个部分以复杂的方式协同工作,你不能只是把更多的安全部件塞进去并期望得到更好的结果。但通过精准定位“不”字究竟住在哪里,他们为我们提供了一张地图,让我们理解为什么 AI 有时会失效,以及未来我们如何构建更强大、更稳健的安全系统。这提醒我们,即使在广袤复杂的 AI 世界中,最重要的东西往往发生在中间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →