Function-Vector Heads Are Two Populations: Writers and Cancellers in In-Context Learning
本文通过揭示功能向量头由两个对立的子群体——促进正确规则的“写入者”和抑制这些规则的“取消者”——组成,挑战了功能向量头是一个同质群体的假设,而这些子群体在仅基于幅度的排序中是不可见的,但在被识别并消融后会对模型性能产生显著影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将一个大型语言模型(比如那些能与你聊天的模型)想象成一个庞大的管弦乐团,正试图根据几个示例来解开一个谜题。在这个管弦乐团中,有一些特定的乐手被称为注意力头(attention heads)。长期以来,研究人员一直认为最重要的乐手就是那些演奏音量最大的乐手。他们假设,如果一个乐手演奏得非常大声,那么他一定是在帮助乐团奏出正确的曲调。
然而,这篇论文发现这个假设是错误的。事实证明,“音量最大”的乐手实际上属于两个完全不同的、对立的群体:书写者(The Writers)和取消者(The Cancellers)。
以下是该论文发现内容的详细拆解,使用了简单的类比:
1. 巨大的误解:音量 vs. 方向
以前,研究人员观察这些乐手并根据音量(即他们对答案贡献了多少)对他们进行排名。他们假设排名前 20 的最响亮的乐手都是“助手”。
本文作者意识到,仅有音量是不够的,你还需要知道方向。
- 书写者(Writers): 这些乐手演奏出一个响亮的音符,将乐团推向正确的答案。
- 取消者(Cancellers): 这些乐手也演奏出一个响亮的音符,但他们是将乐团推向错误的答案。他们正在积极地试图抵消正确的答案。
类比: 想象一场拔河比赛。
- 书写者是把绳子向终点线拉的那一队。
- 取消者是另一支同样用力拉绳子的队伍,但他们是在相反的方向上拉。
- 如果你只看他们拉的力量(强度),你会认为他们都是同样重要的“拉力者”。但如果你观察方向,你会看到他们正在互相博弈。
2. 发现:两个群体
研究人员在几种不同的模型(从小型到大型)和不同类型的逻辑谜题上进行了测试。他们发现,在几乎所有情况下,“顶尖”的乐手都会分裂成这两个对立的阵营。
- “书写者”将正确答案的概率推高。
- “取消者”将正确答案的概率推低。
当研究人员静音(消融/ablated)了取消者时,模型的解题能力反而变好了。这就像是移除了拔河队中的一名破坏者;突然之间,“书写者”可以毫无阻力地将绳子拉向终点线。
3. 为什么之前的研究漏掉了这一点
论文解释说,早期的研究(例如 Todd 等人,2024 年的研究)使用了一种仅观察贡献“响度”的方法。因此,他们无意中收集到了书写者和取消者的混合体,但这种混合情况会随着谜题的不同而改变。
- 在某些谜题中,“取消者”的声音更大,因此旧方法认为他们是主要的助手。
- 在其他谜题中,“书写者”的声音更大,因此旧方法认为他们才是主要的助手。
本文指出,由于忽略了“符号”(方向),之前的研究本质上是在混淆英雄与反派,误以为他们都是“响亮的助手”。
4. 取消者仅仅是错误吗?
研究人员想要确保“取消者”不仅仅是模型中损坏的部分或偶然的噪声。他们进行了多次测试,以证明它们是系统中真实存在的、具有功能的组成部分:
- 它们阅读的内容不同: 书写者关注示例中的“标签”(答案)。取消者则关注“格式”(标点符号和空格)。它们观察的是页面的不同部分。
- 它们是由内容驱动的: 取消者并非只是随机地抑制答案;它们是专门试图抑制刚刚在示例中展示出来的那个答案。
- 它们不是“复制抑制器”: 论文排除了这些仅仅是通用的“不要复制”机制的可能性。它们是针对特定任务逻辑的。
5. “L11.H4”角色研究
论文深入研究了一个特定的乐手——L11.H4,以观察它是如何工作的。
- 这个乐手在逻辑谜题中是一个“取消者”(它试图推向错误答案)。
- 然而,如果将谜题改为词汇任务(如匹配反义词),同一个乐手会转换角色,变成一个“书写者”(它帮助正确答案)。
- 教训: 这个乐手本身并不天生“好”或“坏”。它的职责是抑制刚刚被演示的内容。如果演示的是正确答案,它就抑制它(取消者);如果演示的是错误答案(在不同语境下),它就会抑制错误的答案,从而有效地帮助正确的答案(书写者)。
6. 总结
主要结论是,我们不能将 AI 模型中最“活跃”的部分视为一个单一且统一的群体。
- 旧观点: “这些是最重要的 20 个注意力头。让我们利用它们来引导模型。”
- 新观点: “这前 20 个头实际上是一场内战。一半在推动模型走向正确的地方,另一半则在推动模型走向错误的地方。如果你想引导模型,你需要让‘取消者’保持沉默,而不只是放大‘书写者’。”
这篇论文并不声称这使得模型变得“安全”或已准备好用于医疗或法律等现实世界应用。它只是指出,为了理解这些模型如何从示例中学习规则,我们必须承认其内部的“乐手”经常在相互博弈,而不是协同工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。