← 最新论文
🤖 machine learning

Distributed Sparse Interventions in Language Models

本文介绍了分布式稀疏干预(Distributed Sparse Interventions, DSI),这是一种通过识别跨层级的稀疏神经元集合,来有效激活语言模型中特定任务行为的新颖方法,它能够捕捉到传统线性转向方法所忽略的非线性效应与相互作用。

原作者: Maximilian S. Ernst (Max Planck School of Cognition, Center for Lifespan Psychology Max Planck Institute for Human Development, Machine Learning Group Technische Universität Berlin), Lorenz Linhardt (
发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Maximilian S. Ernst (Max Planck School of Cognition, Center for Lifespan Psychology Max Planck Institute for Human Development, Machine Learning Group Technische Universität Berlin), Lorenz Linhardt (Machine Learning Group Technische Universität Berlin, Berlin Institute for the Foundations of Learning and Data), Aaron Peikert (Center for Lifespan Psychology Max Planck Institute for Human Development), Oliver Eberle (Machine Learning Group Technische Universität Berlin, Berlin Institute for the Foundations of Learning and Data)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个大型语言模型(比如驱动聊天机器人的那些模型)就像一座规模宏大、繁忙喧嚣的城市,拥有数百万名在不同建筑(层)中工作的微小工人(神经元)。当你要求这座城市执行一项特定任务时——比如翻译一个句子或将动词改为过去时——大多数人认为整个城市都需要一起变换节奏,或者认为有一个巨大的“开关”可以让你通过拨动它来实现这一目标。

这篇名为**《分布式稀疏干预》(Distributed Sparse Interventions)**的论文指出,这种假设是错误的。作者发现,你不需要通过拨动一个巨大的开关或移动整座城市,而是可以通过轻微触动极少数特定的工人来触发复杂的任务——有时甚至只需要触动总人口中仅有 0.01% 的部分。

以下是利用简单类比对他们发现的详细解读:

1. 旧方式:“全局音量旋钮”

以往的研究将模型视为一套音响系统。如果你想改变音乐的“情绪”(任务),你会转动全局音量旋钮,或者为整个房间滑动推子。这假设任务就像简单的直线关系:如果你把旋钮调大一点,音乐就会变大声一点。

问题在于: 作者发现,该模型并不是一个简单的音响系统。它更像是一个复杂的管弦乐队。如果你只是调大整个房间的音量,只会得到噪音。真正的魔力在于特定的音乐家在准确的时机演奏出特定的音符。这些工人之间的关系并不是一条直线;而是一个错综复杂的交互网络。

2. 新方式:“分布式稀疏干预”(DSI)

作者开发了一种称为 DSI 的方法。你可以把它想象成一位高水平的指挥家,他不会要求整个管弦乐队都提高音量。相反,这位指挥家会:

  1. 倾听: 对比乐队在已知曲目(10-shot 示例)与未知曲目(0-shot 示例)时的表现差异。
  2. 识别: 找出那些决定了演出好坏的关键性的、极其微小的特定音乐家群体。
  3. 轻触: 温柔地触动那几位特定的音乐家,让他们发挥作用。

结果: 通过对仅有的 8 到 64 个神经元(在数万个神经元之中)进行干预,他们就能让模型执行一些它并未被明确告知的任务,且其表现往往能达到给模型提供 10 个示例进行学习的效果。

3. “非线性”的惊喜

论文强调,这些神经元的工作方式并不像简单的开关。

  • 类比: 想象你在烤蛋糕。如果你假设它是线性的,你可能会认为“每多加一个鸡蛋,蛋糕就会好上一倍”。但实际上,加一个鸡蛋可能让蛋糕变得湿软,加两个则恰到好处,而加三个则会毁掉一切。
  • 发现: 作者发现,触动一个神经元的效果高度依赖于其他神经元正在做什么。你不能仅仅挑选出“最好”的一个神经元并去触动它;你必须找到正确的神经元组合,并以正确的强度去触动它们。他们的 DSI 方法通过迭代调整这些触动强度,从而找到完美的“配方”,而不是靠一次性猜测并寄希望于运气。

4. 解构“任务”(“复制”与“转换”的类比)

这篇论文最引人入胜的部分之一,是他们如何利用这种方法来理解模型的思维方式。他们观察了一个类似将 "run" 改为 "ran"(时态切换)的任务。

他们发现,模型实际上将此过程分解为两个步骤:

  1. 复制: 模型首先复制单词 "run"。
  2. 转换: 然后它将 "run" 变为 "ran"。

通过使用 DSI,他们可以分离出负责“复制”部分的神经元和负责“转换”部分的神经元。

  • 实验: 当他们只激活“复制”神经元时,模型会不断重复输入单词(就像坏掉的唱片一样)。当他们激活“转换”神经元时,模型会尝试改变时态,但可能会陷入停滞或不断重复自身。
  • 洞察: 这证明了复杂的任务是由更小的、可重用的神经元“乐高积木”构建而成的。模型并不拥有一个巨大的“过去时”大脑;它拥有一个“复制”大脑和一个“转换”大脑,两者协同工作。

总结

论文表明,语言模型并非单块的智能体。它们是由稀疏、分布式的电路组成的。你不需要重新训练整个模型或使用海量数据来让它完成新任务。你只需要找到掌握该任务“钥匙”的那一小群特定的神经元,并轻轻触动它们。

简而言之: 与其向整座城市大声喊叫指令,作者发现了一种方法,只需向少数特定的人低声耳语,整座城市就会突然开始说一种新的语言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →