RACE: Scalable Statistical Estimation of Functional Consistency in LLM Neurons
本文介绍了 RACE,这是一个计算高效的前向传递统计框架,用于评估 Transformer 神经元的全域功能一致性,证明了其相比于现有的基于梯度的方法具有更优越的可扩展性和特异性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能庞大的数字大脑内部,存在着一层隐藏的活动层,研究人员才刚刚开始对其进行绘制。这些被称为大型语言模型的系统,并不像人类那样以句子或段落进行思考。相反,它们通过数十亿个被称为神经元的微小、互连的开关来处理信息。当你要求计算机写一首诗、解一道数学题或调试一行代码时,特定的神经元组就会被点亮以执行任务。多年来,科学家们一直难以理解哪些神经元负责哪些任务。其难度在于规模之大;这些模型的复杂程度,使得观察它们的工作过程往往感觉就像试图通过观察一个路灯来理解一座城市。以往寻找正确开关的方法要么过于缓慢而无法投入实际应用,要么过于专注于单个瞬间,从而错过了系统随时间变化的整体行为图景。
一组研究人员现在引入了一种新的方式来倾听这些数字大脑,他们称之为 RACE 方法。该方法并非试图对整个系统进行逆向工程,也非计算每一个连接的影响力,而是将模型的内部活动视为一种统计模式。研究人员意识到,服务于特定目的(如编写 Python 代码或解决代数问题)的神经元并不会随机放电。相反,每当执行该特定类型的任务时,它们都会以一种一致且稳定的方式对模型的内部状态做出贡献。通过追踪这些跨越数千个示例的一致性贡献,团队可以识别出哪些神经元是针对给定工作的真正专家。这不仅仅是寻找一个闪烁一次后便遗忘的神经元,而是寻找那些每当模型被要求做某事时都能可靠出现的神经元。
这项发现的核心在于科学家衡量重要性的方式发生了转变。旧的技术通常依赖复杂的计算,需要计算机沿着自身的逻辑向后运行,这个过程极其缓慢且计算成本高昂。新的 RACE 方法只需进行一次前向传递,观察模型信息如何自然地从头到尾流动。它观察每个神经元对模型内部记忆流所做的微小更新。如果一个神经元能持续推动模型的思维朝着特定任务的正确方向发展,它就会获得高分。如果其行为不稳定,或者仅在少数几次偶然情况下提供帮助,则会被忽略。这使得研究人员能够构建一份可靠的模型能力图谱,而无需停止并计算每一种可能的结果。
为了测试这张图谱是否准确,研究人员在几种不同的不同规模的大型语言模型上进行了一系列受控实验,涵盖了从 40 亿参数的小型模型到 320 亿参数的巨型模型。他们专注于三个不同的领域:编写计算机代码、解决数学问题以及控制特定的行为(例如使用特定的句子结构风格)。在每种情况下,他们都使用 RACE 方法来识别负责该任务的顶层神经元。随后,他们进行了一项精细的操作:在模型工作时暂时屏蔽掉这些特定的神经元。
结果令人震惊。当研究人员屏蔽掉由 RACE 识别出的负责编码任务的神经元时,模型的正确代码编写能力显著下降,但其回答一般性问题或解决数学问题的能力基本保持不变。在数学领域也是如此;屏蔽掉数学神经元削弱了模型的推理能力,却并未影响其通用的语言能力。这证实了该方法成功隔离了负责这些技能的特定组件。相比之下,当他们使用旧的、精确度较低的方法来选择要屏蔽的神经元时,造成的损害往往是广泛性的,会损害模型的整体性能,而非仅仅针对某一项技能。
其中一个最重要的发现是这些模型内部两种主要神经元之间的区别。研究人员发现,负责数学推理和编程的神经元具有高度专业化特征,且极少在任务间共享。然而,涉及“注意力”(即模型决定关注哪些词的部分)的神经元则要通用得多。这些注意力神经元似乎是可重复使用的工具,帮助模型完成几乎所有的任务,从写诗到解方程。这种区别解释了为什么模型的某些部分比其他部分更容易进行剪枝或修改:专门化部分就像车间里的专用工具,而注意力部分则像是握住这些工具的手。
研究人员还发现,他们的方法效率极高。以往的技术需要计算机进行相当于运行模型 144 次的计算量才能为神经元评分,而新方法所需的计算量甚至不到一次完整的运行。这种速度使得分析和审计比以往任何时候都更大的模型成为可能。这也意味着,在未来,开发人员可以利用这种技术来微调模型,在无需从头开始重新训练整个系统的情况下,移除不想要的某种行为或增强特定的技能。
研究还观察了当模型被要求执行与其受训内容略有不同的任务时,这些专门化神经元的表现。当研究人员在全新的、未见过的数学问题上测试模型时,被 RACE 识别出的神经元在被屏蔽后依然会导致性能大幅下降。这表明该方法找到的是技能的基础机制,而不仅仅是针对特定问题集的记忆模式。模型使其知识泛化能力依赖于这些相同的稳定神经元。
或许最微妙的发现涉及模型使用特定风格的能力,例如编写使用特定列表结构的 Python 代码。研究人员训练系统去识别这种特定风格,然后屏蔽了相应的神经元。结果显示,模型仍然可以编写代码,但几乎完全停止了使用那种特定风格,尽管它仍能以其他方式编写正确的代码。这种精度的水平表明,该方法可以隔离非常细微的行为,从而提供一种以手术级精度引导模型输出的方式。
研究人员承认,他们的方法并非解决所有问题的完美方案。他们发现,该方法对于那些以直接、加性方式处理信息的模型部分效果最好,但在映射注意力机制中发生的更复杂、更重叠的交互作用方面效果较差。他们还指出,该方法依赖于线性模式,这意味着它可能会错过一些神经元之间更复杂的非线性协作方式。然而,对于他们测试的大多数任务,该方法都提供了一种清晰、可靠且快速的方式来理解模型正在做什么。
这项工作代表了“机械解释性”领域的一个重要进步,该领域旨在打开人工智能的“黑箱”。通过提供一种识别和隔离这些庞大系统中特定功能组件的方法,研究人员为我们提供了一套新的工具,用以理解、调试和改进这项日益塑造我们世界的技术。精准定位模型中哪些部分负责特定技能的能力,意味着我们可以超越猜测,开始就如何构建这些系统以及如何使用它们做出明智的决策。前进的道路不再是试图一次理解整座城市,而是能够走上一条特定的街道,并确切知道那里正在发生什么。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。