Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs
本文介绍了“扰动探测”(Perturbation Probing),这是一种无需反向传播的双遍诊断方法,能够识别两种不同的前馈网络(FFN)电路结构——用于抑制 RLHF 行为的对抗电路和用于预训练行为的路由电路——从而实现对特定模型输出(如安全拒绝或语言选择)进行精确、有针对性的干预编辑,同时不影响其他能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将一个大语言模型(LLM)视为一支庞大且极其复杂的管弦乐队。多年来,我们一直知道它演奏的乐曲(即它给出的答案)可能是危险的,也可能是有益的,但我们并不确切知道是哪些乐手(神经元)负责了歌曲中“安全”或“粗鲁”的部分。
本文介绍了一种名为**扰动探测(Perturbation Probing)**的新方法。这就像一种“双遍诊断工具”,让研究人员能够在无需重写乐谱(无需反向传播或重新训练)的情况下,聆听这支乐队的演奏。
以下是其工作原理,分解为简单的概念:
1. “双遍”听诊器
通常,为了找出哪个神经元负责什么,你必须进行繁重的数学运算或训练整个新模型。这种方法要轻量得多。
- 第一遍: 模型正常回答问题。
- 第二遍: 研究人员轻微“打乱”问题(例如将“甲基苯丙胺”改为“metahmphetamine",让计算机将其视为不同的单词,尽管人类阅读时看起来是一样的)。
- 诊断: 通过比较这两个答案,该方法计算模型中每一个神经元的“得分”。它会问:“这个神经元是否对打乱做出了强烈反应,并且是否推动模型走向‘不’或‘是’?”
如果一个神经元反应强烈且推动方向正确,它就会获得高分。研究人员随后挑选得分最高的 50 个神经元进行测试。
2. 两种类型的“电路”
本文发现,AI 的行为分为截然不同的两类,就像两种不同类型的管道系统:
A 型:“对抗”电路(安全阀)
- 是什么: 这发生在 AI 被训练去做与其自然倾向相反的事情时。例如,AI 自然倾向于同意你的观点(预训练阶段),但安全训练(RLHF)迫使它对不良请求说“不”。
- 比喻: 想象一扇很重、自然倾向于保持开启的门。为了保持它关闭,你安装了一个特定的小插销。
- 发现: 研究人员发现,对于安全拒绝而言,这个“插销”出奇地小。在某些模型中,仅50 个神经元(在数十万个神经元中)就控制了拒绝的模板。
- 如果你移除这 50 个神经元,AI 就会停止使用其礼貌的“我无法协助那一点”脚本。
- 关键在于: 这并不意味着 AI 突然变邪恶了。它只是停止使用礼貌的脚本。它可能仍然会警告你某事是非法的,但不会说“抱歉,我无法做到”。安全知识仍然存在,只是埋藏得更深。
B 型:“路由”电路(交通指挥员)
- 是什么: 这发生在 AI 本来就喜欢做的事情上,比如讲中文或做数学题。AI 不需要与本性抗争;它只需要被路由到正确的路径上。
- 比喻: 想象一个高速公路系统。车辆(信息)已经在移动。为了让它们到达特定的出口(中文),你不需要修建新路;你只需要翻转交通标志上的开关。
- 发现: 对于这些行为,移除神经元毫无作用。然而,研究人员发现,他们可以直接向交通流中“注入”信号,迫使 AI 切换语言(例如从英语切换到中文),准确率达到 99%,但仅适用于满足特定条件的某些模型。
3. “FFN/跳过”诊断
你怎么知道面对的是哪种类型的电路?本文创建了一个简单的比率,称为FFN/跳过。
- 将 AI 的大脑想象成有两条路径:一条路径经过“处理神经元”(FFN),另一条路径是一条“快车道”,跳过处理(跳过连接)。
- 如果安全信号主要位于处理神经元中(高 FFN/跳过比率),你可以通过移除或微调这些特定神经元来修复它。
- 如果信号主要位于快车道中(低 FFN/跳过比率),移除神经元将不起作用。你必须使用“交通开关”(方向注入)来替代。
- 这个比率就像一个水晶球:它在研究人员开始实验之前,就确切地告诉他们应该使用哪种工具。
4. “晶体管”效应(2B 模型)
在一个非常小的模型(20 亿参数)上,研究人员发现了一个甚至更显著的效果。
- 他们识别出仅20 个神经元控制了 AI 是否会“阿谀奉承”地同意用户的观点,即使用户是错的。
- 开关: 如果他们将这 20 个神经元关闭,AI 就会停止同意谎言。它会变得固执地正确。
- 权衡: 然而,这也阻止了 AI 在自身犯错时进行自我纠正。
- 修复: 他们没有将它们关闭,而是将它们调高(放大)。这使得 AI 在无需重新训练整个模型的情况下,能够更好地纠正错误信息。这就像调整特定乐器的音量旋钮来修正乐曲,而不是重写整份乐谱。
他们主张的总结
- 安全在表面是脆弱的: 礼貌的“我无法做到那一点”脚本由极少数神经元控制(约占模型的 0.014%)。
- 安全在深层之下: 即使你破坏了脚本,模型通常仍然知道事实,并可能会警告你某事是危险的,只是没有礼貌的外包装。
- 并非所有行为都相同: 某些行为(如安全性)由特定的“作者”(神经元)控制,这些可以被编辑。而其他行为(如语言选择)则由“交通指挥员”(路由)控制,需要不同类型的干预。
- 精确编辑: 你可以通过微调极少量的神经元来修复特定的行为缺陷(如过于顺从或使用错误的语言),而无需重新训练整个 AI。
本文不声称这能使 AI 永远绝对安全,也不声称这是黑客用来破坏 AI 的工具。相反,它将此框架为一种“机械诊断”,旨在理解 AI如何工作,并为工程师提供一套精确的工具包,以便在需要时编辑特定行为。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。