Correcting Gradient-Based Circuit Localization via Interaction-Aware Backpropagation
本文引入了梯度交互修正(Gradient Interaction Modifications, GIM),这是一种通过纠正因忽略注意力自修复等组件交互而导致的电路定位系统性误估,从而在识别大型语言模型中负责特定行为的模型组件方面达到最先进性能的新技术。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
将大型语言模型(LLM)想象成一个繁忙的大型厨房,数以千计的厨师(神经元和注意力头)共同协作,只为烹饪出一道菜肴(模型的回答)。长期以来,试图理解这些模型如何运作的科学家们使用了一种叫做“电路定位”(circuit localization)的方法。他们的目标是弄清楚究竟哪些厨师负责了这道菜的风味。
旧方法:“一次一个”的错误
传统上,研究人员试图通过一次只开除一名厨师来识别重要的厨师。他们会说:“让我们让厨师 A 今天回家休息,看看汤的味道是否会发生变化。”如果汤的味道没有变化,他们就假设厨师 A 是不重要的。
问题在于,这些厨师并不是孤立工作的;他们会互相交流并互相掩护。如果厨师 A 是切洋葱的高手,但厨师 B 也是切洋葱的高手且正好站在旁边,那么送走厨师 A 并不会改变汤的味道。厨师 B 会直接拿起刀继续切下去。研究人员看到没有任何变化,便错误地得出结论,认为厨师 A 是没用的。
新发现:“注意力自我修复”(Attention Self-Repair)
作者发现了一种在 AI 中发生的特定“互相掩护”方式,他们称之为注意力自我修复。
把 AI 的注意力机制想象成剧院里的聚光灯操作员。聚光灯操作员(模型)决定将亮光投射在哪些演员(词汇)身上。有时,两个演员站在同一个位置,说着完全相同的话。操作员会将光线在两人之间平分,各占 50%。
如果你尝试调暗演员 A 的灯光以观察其重要性,操作员会立即将多出的光线转移到演员 B 身上。因为演员 B 正在说着同样的话,观众(模型)并不会察觉到任何差异。这种“梯度”(告诉我们谁很重要的信号)消失了,使得看起来好像这两个演员都不重要。但实际上,两者都至关重要;他们只是有一个备份计划。
解决方案:GIM(梯度交互修正)
为了解决这个问题,作者创建了一个名为 GIM 的新工具。GIM 不再是一个一个地开除厨师或调暗一个聚光灯,而是通过改变游戏规则来应对这种团队协作。它使用了三个聪明的技巧:
“温暖的聚光灯”(温度调节后的 Softmax):
想象一下,聚光灯操作员通常非常严格,会将 90% 的光投给顶尖演员,而将 10% 给其他人。GIM 告诉操作员可以更宽松一些(增加“温度”)。现在,光线分布得更均匀。当你调暗一个演员的灯光时,其他人不会立即接管,因为光线已经预先广泛分配了。这揭示了谁才是真正持有光线的人,即使他们曾得到过帮助。冻结“音量旋钮”(层归一化冻结/Layernorm Freeze):
在厨房里,有一个主音量旋钮,用于调节整个房间的整体音量。如果一个厨师停止工作,音量旋钮会自动调大其他人的声音,以保持音量恒定。这掩盖了某个厨师离开的事实。GIM “冻结”了这个音量旋钮,因此当一个厨师离开时,其他人不会被人工调大声音。这让研究人员能够看到由于该厨师离开而导致的真实音量下降。“共享工具”修正(梯度范数/Gradient Norm):
有时,两个厨师正在使用同一个工具(比如一把共享的菜刀)进行切割。如果你测量这把刀被使用了多少次,你可能会错误地将同一次切割计数两次——分别记在两个厨师头上。GIM 通过正确分配信用额度来修复这个数学错误,确保没有人因为同一个动作而被重复计算。
结果
当作者在各种 AI 模型和任务(如解决数学问题或回答问题)上测试 GIM 时,它的表现远优于旧方法。
- 它找到了旧方法所遗漏的、模型中“真正”重要的部分。
- 它证明了旧方法由于不理解“自我修复”这种团队协作,系统性地低估了某些部分对 AI 的重要性。
总结
本文认为,我们不能通过孤立地观察复杂 AI 模型的各个部分来理解它。因为各个部分会互相协作,移除其中一个并不总能显示出其真实价值。GIM 是一种新的观察模型的方式,它考虑了这种团队协作,从而为我们提供了更准确的地图,展示了这些数字大脑究竟是如何思考的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。