← 最新论文
💬 NLP

Automated Interpretability and Feature Discovery in Language Models with Agents

本文提出了一种自主多智能体框架,通过迭代优化假设并发现大型语言模型中的内部特征,实现了机械可解释性的自动化,其在生成更清晰、可证伪且可审计的解释方面展现出优于一次性方法的性能。

原作者: Arnau Marin-Llobet, Javier Ferrando

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Arnau Marin-Llobet, Javier Ferrando

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一台巨大且极其复杂的机器(大型语言模型),它能写故事、回答问题并解决难题。在这台机器内部,有数十亿个微小的开关和齿轮(神经元和特征)协同工作。问题在于,我们没有操作手册。我们能看到机器在运转,却不清楚每个单独的齿轮究竟在做什么。

长期以来,研究人员试图通过观察某个齿轮、猜测其功能,并贴上诸如“这个齿轮用于数学”的标签来破解这一谜题。但往往,这种猜测要么错误,要么过于模糊,要么一旦尝试稍有不同的示例就会失效。这就像试图仅凭一次观察就猜出汽车零件的功能。

本文介绍了一个名为InterpAgent的新系统。它不像人类那样只猜测一次,而是像一支机器人侦探团队,协同工作以解开机器齿轮实际功能的谜团。

以下是他们如何利用简单类比来实现这一点的:

两支侦探团队

该系统使用两个专门化的机器人代理,它们相互协作:

  1. “特征发现者”(侦察兵):
    想象你想找到所有负责“西班牙语”的齿轮。侦察兵并不知道是哪个齿轮。因此,它会进入机器的“激活空间”(即齿轮如何发光的地图),并寻找模式。它利用统计地图(如同 GPS)来寻找在使用西班牙语单词时一起发光的齿轮集群。它不只是猜测;它运用数学来找出那些能可靠区分西班牙语提示与英语提示的齿轮。

    • 类比: 这就像一名侦探扫描人群,寻找那个只出现在法国派对上、戴着红帽子的特定人物。
  2. “特征解释者”(审讯者):
    一旦侦察兵找到一个候选齿轮,审讯者便接手。它的任务不仅仅是命名该齿轮,而是要压力测试这个名称。

    • 旧方法: 人类可能会说:“这个齿轮用于‘技术’。”
    • InterpAgent 方法: 审讯者说:“好吧,你认为它是用于‘技术’?让我们来测试一下。”它会生成 12 个应该触发该齿轮的示例(如“修理电脑”)和 12 个不应该触发的示例(如“煮意大利面”)。然后它将它们输入机器运行。
    • 转折: 如果该齿轮在“煮意大利面”时也被点亮,审讯者就知道“技术”这个标签是错误的。随后它会重写假设:“也许它是用于‘修理东西’?”它会重复这个过程,生成新的测试,检查结果,并 refine 标签,直到找到一个经得起压力考验的描述。

发现的“循环”

本文强调,这不是一次性事件。它是一个循环

  • 步骤 1: 侦察兵找到一个潜在的齿轮。
  • 步骤 2: 审讯者猜测其功能。
  • 步骤 3: 审讯者试图通过寻找反例(本应触发该齿轮却未触发,或本不应触发却触发的情况)来打破自己的猜测。
  • 步骤 4: 审讯者根据失败情况更新猜测。
  • 步骤 5: 重复直到猜测稳固。

这就像科学家反复进行实验。如果你的理论是“这个按钮打开灯”,但你按下它后收音机却响了,你不会只说“哎呀”。你会将理论改为“这个按钮控制电源”,并再次测试。

他们的发现

作者在 Gemma-2 系列模型(一种人工智能)上测试了该系统。结果如下:

  • 更优的标签: 机器人团队在标记特征方面远优于旧的“一次性”方法。旧方法常给出如“知识”这样模糊的答案。而机器人团队找到了具体、狭窄的答案,例如“技术故障排除语境中的非正式法语措辞”。
  • 发现未知: 该系统不仅解释了研究人员已知的齿轮。侦察兵还发现了人类未曾注意到的新齿轮,例如仅在“有害内容”(如爆炸物)出现时才会激活的特定神经元,或特定的编码模式。
  • 安全检查: 在一个案例研究中,他们发现了一个与拒绝危险请求相关的齿轮。他们能够通过调低该齿轮来“引导”机器,结果机器不再拒绝该请求。这证明了该齿轮实际上导致了安全行为,而不仅仅是观察其发生。
  • 多义性: 有时,机器人发现单个齿轮同时在处理两件截然不同的事情(例如,一个既处理“数学方程”又处理“医学术语”的齿轮)。该系统足够智能,能够指出“这个齿轮令人困惑;它同时在做两份工作”,而不是强行贴上单一的错误标签。

核心结论

本文主张,通过将人工智能解释视为迭代实验(猜测、测试、失败、修正),而非静态标签(观察、猜测、写下),我们可以获得更准确、更可靠的解释。

该系统记录了每一次猜测、每一次测试和每一次失败的“书面痕迹”,使整个过程透明化。它表明,如果你让一个 AI 代理像一位严谨的科学家那样行事——不断试图证伪自己的想法——你就能更清晰地看清机器大脑实际运作的机制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →