← 最新论文
🤖 machine learning

Targeted Recovery of Weight-Space Mechanisms From Neural Networks

本文介绍了目标参数分解(tPD),这是一种可扩展的方法,它通过使用高秩的全包分量来处理非目标数据,从而在大型神经网络中隔离特定的计算电路,进而实现以显著降低的计算成本进行高效恢复和手术式操控。

原作者: Antoine Vigouroux, Lee Sharkey

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Antoine Vigouroux, Lee Sharkey

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、神奇的图书馆,其中的每一本书都是由一个超级聪明的机器人写的,这个机器人通过阅读几乎整个互联网来学习说话。这个被称为“大语言模型”(LLM)的机器人极其擅长完成你的句子、编写代码或讲述故事。但问题在于,没有人真正知道它是如何做到的。它就像一个黑盒。你输入一个问题,它就会给出一个完美的答案,但其内部运转的齿轮却是一团乱麻,由数十亿个微小的开关(称为参数)组成,任何人类都无法轻易解读。

研究“机械可解释性”的科学家们就像是试图拆解这个黑盒以观察内部齿轮的侦探。他们想要找到机器人大脑中负责特定任务的具体小电路,比如知道“巴黎”是“法国”的首都,或者知道如何编写一行 CSS 代码。一种名为“参数分解”(Parameter Decomposition)的近期方法试图将机器人的大脑分解成微小的、功能单一的部分。然而,这种方法就像是为了寻找家门口的面包店而试图绘制整个国家的每一条街道地图一样——它需要耗费极大的时间、金钱和计算能力。由于成本太高,目前对现存最大的、最聪明的机器人进行这种操作是不可能的。

这就是 Antoine Vigouroux 和 Lee Sharkey 的一篇新论文所发挥作用的地方。他们提出了一种聪明的捷径,称为“目标参数分解”(Targeted Parameter Decomposition,简称 tPD)。他们不再试图一次性绘制整个机器人大脑的地图,而是问道:“如果我们只关心机器人如何处理某一件特定的事情,比如 CSS 代码或某个特定的数学技巧呢?”他们的这种方法构建了一个巨大的安全网,捕捉了机器人处理该特定事项之外的所有行为,从而让科学家能够将精力集中在那些真正相关的特定齿轮上。他们在较小的机器人大脑上进行了测试,发现其效果与昂贵的全量映射方法不相上下,但使用的计算资源却只是极小的一部分。事实上,他们甚至能手术式地移除机器人对特定命令(如 “import numpy as”)的记忆,甚至能将它们互换,让机器人说出 “import pandas as”,而这一切都不会破坏机器人执行其他任务的能力。这就像是在不需要整座医院的设备支持下,对 AI 进行精细的大脑手术。

核心理念:全覆盖“安全网”

把神经网络(机器人大脑)想象成一个庞大的管弦乐团。每种乐器(或权重)都在为音乐演奏贡献力量。理解这个管弦乐团的旧方法是尝试记录下每种乐器在每首可能出现的歌曲中演奏的每一个音符。这就是作者提到的“全模型分解”。这种方法很准确,但就像是在乐队同时演奏一千首不同的歌曲时,还要去转录整场交响乐一样。这既耗时又需要庞大的音乐团队(计算机)来跟上进度。

作者意识到,如果你只想了解管弦乐团如何演奏某一首特定的歌(比如一段 CSS 代码片段),你并不需要转录整场音乐会。你只需要知道哪些乐器在演奏这首歌。但这里有一个问题:如果你只听这一首歌,你可能会误以为某种乐器正在演奏某个音符,而实际上它只是因为房间的回声才发出的声音。你无法判断某种乐器对于这首歌是否真的重要,还是它仅仅是因为其他歌曲才出现在那里。

为了解决这个问题,作者发明了一个“全覆盖”组件。想象你在录制管弦乐团:你在你关心的特定乐器(“目标”)上放置了麦克风,但同时也在舞台的其他部分覆盖了一层巨大的、超灵敏的降噪毯。这层毯子(称为 Δ\Delta 组件)会吸收所有来自非目标歌曲的其他乐器的声音。

通过使用两个数据流同时训练系统——即你想要研究的特定歌曲,以及大量随机的其他歌曲的混合物——这个“全覆盖”毯子学会了吸收所有不是目标的内容。这迫使特定的麦克风只捕捉那些对于目标歌曲而言真正必不可少的乐器。如果某种乐器仅用于其他歌曲,毯子就会将其吞噬,麦克风则会保持静默。这意味着科学家可以在无需绘制整个管弦乐团的情况下,找到特定任务的精确“电路”。

他们的发现:速度、精度与手术

团队在一些玩具模型(简单的、小型机器人)上测试了这个想法,发现它运作得非常完美。当他们要求系统只观察三个特定特征时,它准确找到了所需的三个机制,忽略了其他的 97 个。这就像是在一个巨大的钥匙串中寻找三把特定的钥匙,而无需查看其他 97 把钥匙。他们不仅找到了正确的钥匙,而且速度比旧方法快了大约五倍——且只需要更小的计算机即可完成工作。

随后,他们转向了一个真实的语言模型,这是一个在名为“The Pile”的海量数据集上训练的 4 层 Transformer 模型。他们想看看能否分离出处理 CSS 代码的机制。利用这种针对性方法,他们成功提取出了一个“仅限 CSS”的子模型。这个子模型使用的计算量(FLFLOPs)仅为全量分解方法的约 7%

结果令人震惊。当他们在 CSS 代码上运行这个“仅限 CSS”的模型时,它的表现与原版机器人一样出色。但当他们尝试让它说英语或 Python 时,它完全崩溃了,通常只是不断重复单词 “the” 或 “count”。这证明了他们成功地将特定的“CSS 大脑”从机器人的其余部分中分离了出来。更酷的是,他们还发现了负责识别 CSS 代码中缩进(indentation)等特征的特定子组件,而这些组件在 Python 代码中并不存在。当他们关闭这些特定组件时,机器人停止了对 CSS 缩进的理解,但其编写 Python 代码的能力却依然完好无损。

终极测试:对 12 层模型的脑部手术

这篇论文最激动人心的部分发生在他们将此方法应用于一个拥有 8500 万个非嵌入参数的 12 层 Transformer 模型时。他们聚焦于一个非常具体的任务:机器人完成短语 “import numpy as” 后接 “np” 以及完成 “import pandas as” 后接 “pd” 的习惯。这些都是 Python 编程中的常见命令。

利用这种针对性方法,他们识别出了 248 个负责这些补全操作的特定子组件。接着,他们进行了一些数字“手术”。

首先,他们对针对 “numpy” 的组件进行了消融(ablation,即关闭)。结果如何?机器人无法再用 “np” 来完成 “import numpy as”。就好像它对那个特定关联的记忆被抹除了。但神奇的是:机器人编写其他一切内容(英语文本、其他代码、随机句子)的能力完全没有受到影响。它并没有变得混乱,也没有在其他地方出错。

然后,他们尝试了更大胆的操作:重连(rewiring)。由于每个组件都有一个“输入”方向和一个“输出”方向,他们交换了 “numpy” 组件和 “pandas” 组件的输出方向。他们本质上是告诉 “numpy” 部分的大脑要用 “pandas” 的声音说话,反之亦然。

结果既诡异又完美。当你输入 “import numpy as” 时,机器人现在会用 “pd” 来补全。当你输入 “import pandas as” 时,它会用 “np” 来补全。它不仅仅是犯了个错;它真实地交换了知识。而且,这种改变具有极强的特异性。机器人在其他互联网数据(超过 100,000 个 token 的通用数据)上的行为与原版几乎完全一致。“副作用”微乎其微。

为什么这很重要(以及局限性)

这篇论文表明,我们不需要等待超级计算机来绘制巨型 AI 的整个大脑才能理解或编辑它。我们可以缩放至特定的行为,隔离使其运作的齿轮,甚至对其进行微调,同时让机器的其余部分保持平稳运行。

然而,作者也谨慎地没有过度承诺。他们指出,这种方法最适用于特定的、定义明确的任务,例如记忆序列(如 “import numpy”)或特定类型的代码(如 CSS)。他们承认,编辑复杂的“世界知识”(如关于历史或科学的事实)可能会更难,因为大脑可能会使用多种冗余的方式来存储同一个事实。如果机器人的大脑中有两个执行相同工作的齿轮,那么关闭其中一个可能并不能阻止机器人执行该任务,因为另一个齿轮会接管工作。他们还指出,他们最大的模型与当今使用的“前沿”模型相比仍然很小,因此在大规模扩展时可能会面临新的挑战。

但就目前而言,这种“目标参数分解”是一个强大的新工具。它就像是用手术刀而不是大锤。我们不再需要试图一次性理解整个机器人,现在我们可以轻轻掀开盖子,观察我们感兴趣的具体部分,甚至可以给它一点小小的推动,而不会损坏机器的其余部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →