Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?
本文介绍了 AgenticInterpBench 和 HyVE 框架,旨在证明语言模型智能体可以通过迭代的“假设-验证”循环,为识别出的神经回路生成组件级和任务级的解释,尽管其可靠性目前仍受限于验证阶段的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一台庞大且复杂的机器(比如一个巨大的语言模型),它能够写故事、解数学题或回答问题。科学家们已经找到了如何定位这台机器内部执行特定任务的特定“齿轮与杠杆”的方法。这被称为定位电路(localizing the circuit)。
然而,仅仅找到齿轮是不够的。我们仍然不知道每个齿轮具体在做什么,以及它们是如何协同工作的。通常,人类专家必须花费数小时盯着这台机器,猜测某个部件的功能,测试他们的猜想,然后不断尝试。这既缓慢、枯燥,又难以规模化。
这篇论文提出了一个问题:我们能否雇佣一名机器人侦探(语言模型智能体)来为我们进行这些侦探工作?
以下是他们实验的拆解,使用了简单的类比:
1. 问题所在:“黑盒”之谜
把语言模型想象成一个巨大的、锁着的保险箱。科学家们已经使用了特殊的工具,找到了打开保险箱的特定转轴(即“电路”)。但我们并不知道每个转轴的具体功能。
- 旧方法: 人类侦探试图猜测:“也许这个转轴是用来转动锁芯的?”他们进行测试。如果失败了,他们再次猜测。这需要很长时间。
- 新想法: 我们能否把这项工作交给一个 AI 侦探,让它能够思考、编写代码来测试自己的理论,并修正自己的错误?
2. 训练场:一个“玩具”保险箱
为了测试他们的 AI 侦探是否有效,研究人员不能直接使用一个真实的、混乱的保险箱(现实世界的语言模型),因为他们无法知道用于核对的“正确答案”。
相反,他们构建了 84 个“玩具保险箱”(称为 AGENTICINTERPBENCH)。
- 这些是完全从零开始构建的小型人工机器。
- 研究人员完全了解它们的运作方式,因为它们是根据一套简单的指令(就像食谱一样)构建的。
- 他们确切知道每一个齿轮应该做什么。这使得他们可以给 AI 侦探评分:“你猜对了吗?”
3. 侦探:HYVE(“假设、验证、解释”循环)
研究人员创建了一个名为 HYVE 的 AI 智能体。HYVE 不仅仅是在瞎猜;它会对机器中的每一个齿轮遵循严格的侦探程序:
- 观察: HYVE 观察齿轮。“嗯,当输入为 'x' 时,这个齿轮亮起了红光。当输入为 'y' 时,它保持黑暗。”
- 假设: HYVE 做出一个猜想。“我打赌这个齿轮是一个‘红光检测器’,它只在输入为 'x' 时开启。”
- 验证(测试): 这是最关键的部分。HYVE 编写一个计算机程序来测试它的猜想。它可能会说:“让我们强制让这个齿轮即使在输入为 'x' 时也保持黑暗,看看机器是否会损坏。”
- 如果机器完全如预期那样损坏,则猜想被证实。
- 如果机器依然正常工作,则猜想是错误的。HYVE 必须回到第 2 步,尝试新的猜想。
- 解释: 一旦所有齿轮都经过测试,HYVE 会写一份总结:“这台机器是一个‘分数计算器’,它负责统计句子中出现了多少个 'x'。”
4. 结果:侦探很出色,但并不完美
研究人员测试了四种不同的“大脑”(不同的大型语言模型),以观察哪一个能成为最好的侦探。
- 成功: AI 智能体的表现令人惊讶地好!它们识别齿轮功能的准确率达到了约 79%,描述整体任务的准确率达到了约 83%。
- 瓶颈: AI 在做出初步猜想(假设)方面做得很好。问题出现在测试阶段。
- 有时 AI 编写的测试计划过于模糊。
- 有时 AI 编写了运行测试的代码,但代码本身有漏洞(比如侦探制定了测试计划,却忘了带手电筒)。
- 类比: 这就像一个侦探对凶手是谁有一个天才般的理论,但当他试图去犯罪现场核实不在场证明时,却迷路了,或者把自己锁在了大楼外面。
谁表现最好?
- Claude-Sonot 在实际运行测试而不崩溃(编写无 Bug 代码)方面表现最好。
- Gemini 在编写最终易于理解的解释方面表现最好。
- GPT-5.4 擅长规划测试,但其编写的代码经常无法运行。
5. 现实世界测试:“Llama”案例研究
为了看看这在“玩具保险箱”之外是否有效,他们将 HYVE 应用于一个真实的、自然训练的语言模型(Llama-3-8B),该模型负责进行数学运算。
- 他们给出了由其他人类发现的一个电路,该电路帮助模型进行三个数字相加。
- 结果: AI 侦探成功识别出某些齿轮是“传输头”(负责移动数字),并正确识别出其他齿轮仅仅是“冗余的”(它们看起来很重要,但实际上并不需要)。
- 这证明了该方法即使在杂乱、真实的机器上也是有效的,而不仅仅是在干净的玩具模型上。
核心结论
论文得出结论:AI 智能体是解释 AI 如何运作的有前景的新工具。 它们可以承担猜测和测试的繁重工作。然而,它们目前还不完美。主要的障碍是可靠性:AI 需要变得更好,能够编写出实际测试其理论而不出错的代码。
在 AI 改进“执行实验”(验证循环)的能力之前,人类专家仍需对工作进行复核。但这标志着向自动化理解复杂 AI 大脑迈出了重要的一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。