LLMs Can Annotate Attribution Graphs
本文介绍了一种利用大语言模型将特征自动分组为用于电路追踪的超节点的流水线,证明了这种自动化实现了人类水平的可解释性,并有效地恢复了多跳任务中的中间推理步骤。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
AI 大脑的秘密生活
想象一下,你拥有一个超级聪明的机器人,它能像人类一样写故事、解数学题并回答问题。但问题在于:这个机器人是一个“黑盒”。你可以输入一个问题,它会输出一个答案,但你完全不知道它的脑内发生了什么,才实现了从 A 到 B 的过程。这就像是在看魔术师从帽子里变出一只兔子,而你却看不见里面的秘密隔层或隐藏的丝线。
研究“机械可解释性”(mechanistic interpretability)的科学家们正试图揭开这层帷幕。他们想要看到 AI 内部齿轮转动的样子。为了实现这一点,他们使用了一种叫做电路追踪(circuit tracing)的技术。把 AI 想象成一座巨大的城市,里面有数百万个微小的工人(被称为神经元或特征)在互相传递纸条。当 AI 回答一个问题时,只有其中一小部分工人实际上在承担重任。电路追踪就像是在绘制一张地图,高亮显示哪些工人参与了工作,以及他们是如何传递纸条以生成最终答案的。
然而,这些地图非常杂乱。它们展示了数以千计的个体工人,人类很难通过查看 500 张细小的纸条清单来理解宏观图景。通常情况下,人类研究人员必须花费数小时将这些微小的工人归类为“团队”(称为超节点,supernodes),这些团队共享一个共同的任务,比如“首都团队”或“加法器团队”。这种手工工作既缓慢、枯燥又昂贵。大问题在于:我们能否教计算机来替我们完成这种分组工作?
论文的核心思想:让 AI 实现自我组织
这篇题为《LLM 可以标注归因图》(LLMs Can Annotate Attribution Graphs)的论文提出了一个聪明且出人意料地简单的解决方案:让 AI 来组织它自己的大脑。
研究人员构建了一个类似于数字取证团队的流水线。他们不再让研究人员盯着杂乱的活跃神经元地图,而是让一个强大的语言模型(一种 AI)来进行分类。以下是他们的“机器人图书管理员”的工作原理:
- 描述: 首先,系统观察一个特定的神经元,并询问:“这个东西是做什么的?”它会查看触发该神经元的文本,并生成一段简短的、人类可读的描述,例如:“这个神经元在看到‘首都’这个词时会激活。”
- 分组: 接着,系统将这些描述的列表交给第二个 AI(即“裁判”)。裁判被要求阅读这份清单并将它们逻辑性地分组。它可能会说:“好吧,这五个描述都是关于美国各州的,所以把它们放入‘州名’团队”;或者“这三个描述是关于‘of’或‘the’的,所以它们属于‘语法助手’团队。”
- 清理: 最后,AI 会进行快速审查,合并重复的团队,并丢弃那些没有意义的团队。
结果呢?一张干净、有序的 AI 内部思维图谱诞生了,整个过程完全由机器完成,仅需几秒钟。
他们的发现:机器人图书管理员表现出色
团队测试了这种方法,以观察它是否真的可以取代人类专家。他们使用了一个特定的任务,称为**“两跳首都”挑战**(Two-Hop Capitals challenge)。想象一下向 AI 提问:“包含达拉斯的那个州的首府是哪座城市?”
为了回答这个问题,AI 需要在脑中执行两个步骤:
- 第一跳: 确定达拉斯位于德克萨斯州。
- 第二跳: 确定德克萨斯州的首府是奥斯汀。
研究人员运行了 100 次这项测试。他们的自动化流水线成功找到了“德克萨斯州”团队(中间跳跃环节),成功率高达 100 次中的 97 次!在剩下的 3 次失败案例中,他们发现其中两例中“德克萨斯州”团队其实已经存在,只是 AI 没有将其完美分组;而在另一例中,该团队确实不存在。
他们还将 AI 生成的组与人类研究人员制作的组进行了对比。通过使用自动化测试来衡量这些分组的“可解释性”(即易于理解程度),他们发现 AI 生成的分组与人类制作的分组一样好,甚至有时略胜一筹。
成本与局限性
这项发现最酷的部分之一是它的廉价程度。研究人员计算出,为单个中等复杂度的地图进行特征分组,成本大约在 3 到 6 美分(针对较小的地图)到最高 61 美分(针对较大、更密集的地图)之间。与人类完成同样工作所需花费的数小时相比,这简直微不足道。
然而,论文谨慎地指出,这并不是一个完美的、万能的解决方案。研究人员承认其方法存在一些局限:
- 它侧重于特定输入: AI 不会观察神经元在“大脑”中的位置(例如所在的层级或位置),而人类有时会利用这一点作为线索。
- 它可能过于笼统: 当他们在数学问题(如数字相加)上测试该系统时,AI 将神经元归类为非常宽泛的类别,如“数字”或“数位”。它忽略了 AI 进行数学运算时使用的具体、巧妙的技巧,比如“进位”或“估算大小”。这表明虽然 AI 非常擅长对明显的概念进行分组,但它可能仍然会错过内部细微且复杂的机制。
- 它是一个概念验证: 团队使用这种方法扫描了 1,000 个随机的维基百科提示词,并发现了几个人类可能想要进一步研究的“有趣”图谱。这表明该方法已准备好进行“开放式探索”,有助于科学家发现那些他们原本并未预料到的、奇特且精彩的 AI 大脑现象。
这为什么重要
这篇论文并不声称已经解决了 AI 意识之谜,也没有绘制出每一个存在的神经元地图。相反,它提供了一个实用、低成本的工具,消除了 AI 研究中的一个主要瓶颈。通过将枯燥、耗时的神经元分组工作自动化,它使人类科学家能够专注于真正有趣的问题:为什么 AI 会这样思考?它是在预先规划吗?它是在编造事实吗?
作者指出,即使是这样一种“简单”的自动化,也能产生有意义的结果,为更快、更广泛地探索这些数字大脑的工作方式打开了大门。这是将“黑盒”变为“透明玻璃窗”的一小步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。