← 最新论文
🤖 AI

Finding Interpretable Prompt-Specific Circuits in Language Models

本文介绍了 ACC++,一种改进的电路追踪方法,它通过单次前向传播提取可解释的、特定于提示的注意力电路,揭示了语言模型如何利用不同的、依赖于语言的信号,在不同语言语境中解决诸如间接宾语识别等任务。

原作者: Gabriel Franco, Lucas M. Tassis, Azalea Rohr, Mark Crovella

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Gabriel Franco, Lucas M. Tassis, Azalea Rohr, Mark Crovella

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大型语言模型(LLM)是一座庞大而繁忙的城市,数百万名微小的工人(神经元)彼此传递便条以回答问题。长期以来,我们只能看到这座城市产出了什么(答案),却完全不知道工人们是如何决定发送那些便条的。这就像观看一场魔术表演,却不知其中的戏法。

本文介绍了一种名为**ACC++**的新工具,它如同这些模型的“高科技 X 光透视”。它不只是猜测,而是追踪信息流经模型以解决特定问题时的确切路径。

以下是本文所做工作及发现要点:

1. 问题所在:“黑箱”城市

当模型回答一个提示(例如“当玛丽和约翰去商店时,约翰把瓶子给了……")时,它必须推断出答案是“玛丽”。

  • 旧方法:研究人员试图通过逐个开启和关闭工人来找出哪些工人参与其中(就像拉下房屋的保险丝,看哪盏灯会熄灭)。这种方法既缓慢又混乱,且往往给出模糊的图像,伴随过多的“误报”。
  • 新工具(ACC++):ACC++ 不再拉保险丝,而是倾听工人之间的“低语”。它识别出承载做出决策所需关键信息的特定、低音量通道(称为信号)。

2. ACC++ 的工作原理:“信号侦探”

将模型的注意力机制(即它决定关注什么的部分)想象成一个广播电台。

  • 旧方法:试图找到正在广播的整个无线电塔。
  • ACC++:它进行放大,精确定位确切的频率(特定信号)以及在该频率上发言的确切麦克风(工人)。
  • 神奇之处:它在单次遍历中即时完成此操作。它剥离了噪音,留下一张清晰、简洁的地图,精确显示哪些工人相互交谈,以及他们说了什么

3. 重大发现:“提示特定”的蓝图

最令人兴奋的发现是,模型并非对每个问题使用相同的蓝图。它会根据你提问的方式调整策略。

“名字游戏”类比(IOI 任务):
研究人员用这个游戏测试模型:“当 [名字 A] 和 [名字 B] 去商店时,[名字 B] 把礼物给了 [名字 A]。”模型需要选出名字 A。

  • 场景 A:“当玛丽约翰去……"(玛丽排在第一位)。
  • 场景 B:“当约翰玛丽去……"(约翰排在第一位)。

研究发现,尽管任务相同,模型在这两种场景下使用的是完全不同的内部电路

  • 在一种情况下,模型使用“第二项”检测器。
  • 在另一种情况下,它使用“结构模式”检测器。
  • 结论:模型具有灵活性。它拥有一个包含不同策略的工具箱,并根据你提示的确切措辞选择正确的策略。

4. 多语言之谜:相同的工人,不同的语言

研究人员还用不同语言(英语、西班牙语、法语、葡萄牙语)测试了模型。

  • 发现:模型在所有语言中解决该问题时使用的是同一组工人(相同的内部组件)。
  • 转折:然而,这些工人相互传递的消息(信号)是特定于语言的。
  • 类比:想象一个建筑工人在建造房屋。无论他们是在纽约还是巴黎施工,他们使用的是同一批工人。但在纽约,他们讲英语并传递英文蓝图;在巴黎,他们讲法语并传递法文蓝图。工作的结构是相同的,但沟通的语言发生了变化。
  • 额外发现:论文发现,不同语言电路之间的“距离”与这些语言彼此之间的相似程度相匹配。西班牙语和葡萄牙语的电路看起来比英语和法语的电路更相似,正如语言本身一样。

5. 为何这很重要(根据论文)

  • 清晰度:它将混乱、复杂的连接网络转化为清晰、可读的地图。
  • 可解释性:该工具甚至可以将这些内部“低语”翻译成通俗易懂的英语。例如,它可以告诉你:“这个工人正在寻找列表中的第二项”,或者“这个工人正在识别专有名词”。
  • 效率:与以前的方法相比,它能更快、更少“噪音”地找到这些答案。

总结

这篇论文为我们提供了一副新眼镜,让我们能够逐字地看清 AI 究竟是如何思考的。它揭示出 AI 不仅仅是一台静态机器;它是一个动态的问题解决者,会根据你提问的方式以及你使用的语言,重新调整其内部团队并改变其沟通风格。它证明了我们可以在无需拆解这些模型的情况下,理解其“机械原理”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →