← 最新论文
🤖 machine learning

Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability

本文引入了“机械论断层扫描”(mechanistic tomography),这是一个将可解释性技术建模为设计化测量的统一框架,旨在系统地恢复内部模型机制与干预效应,并通过各种实验证明,面向控制的验证和定制化的测量族可以高效地重建大型语言模型中的因果结构与交互作用。

原作者: Vijay Erramilli

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Vijay Erramilli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能系统,通常被称为大语言模型,是由排列在层中的数十亿个微小的数学开关构建而成的。这些系统可以编写故事、解决问题并回答问题,但它们是以“黑盒”模式运行的:我们可以看到输入和输出,但连接两者的内部步骤仍然是隐藏的。多年来,研究人员一直试图通过开启或关闭系统的部分组件,或者通过观察当输入发生轻微变化时内部数值如何变化,来窥探这些黑盒内部。其目标是理解机器的哪些特定部分负责特定的思想或词汇。然而,这些不同的观察内部的方法往往似乎在讲述不同的故事。一种方法可能表明某个组件至关重要,而另一种方法则表明它是无关紧要的,这让科学家们无法确定他们测量的是同一样东西,还是同一个物体的不同影子。

一种被称为“机械断层扫描”(mechanistic tomography)的新方法为统一这些冲突的观点提供了一种途径。其核心思想是将寻找内部机制的过程,视为一个通过设计来解决的测量问题,而非一个靠直觉去破解的谜团。正如医生使用不同类型的扫描来构建患者健康的清晰图像一样,研究人员可以设计特定的、受控的实验,来测量人工智能内部各部分是如何协同工作的。本文提出了这些实验的一个结构化工作流:从最简单、最廉价的测量开始,只有当简单的测量无法预测机器在受到压力时实际会做什么时,才增加复杂度。研究人员发现,虽然简单的测量通常效果良好,但它们有时会忽略部分之间的关键交互作用,并且正确的测量方式完全取决于机器正在被要求执行什么任务。

这段旅程始于一个基本的认识:我们测量机器内部状态的方式会改变我们得到的结果。如果你轻微地推动系统的一部分,得到的结果与你用力推动,或者同时推动多个部分的结果是不同的。作者意识到,研究人员使用的所有不同方法——无论是每次改变一个部分,还是使用梯度来估计效应,或是共同测试一组部分——都可以被描述为同一种类型的测量问题。他将其构思为一个谜题,目标是从一系列局部观测中恢复出一张隐藏的效应图谱。每一次观测都是一次特定的干预,例如改变提示词中的几个单词或改变特定的内部信号,而结果就是一个有助于填充这张图谱的数据点。挑战在于,这台机器并非完全线性的;它的各个部分以复杂的方式相互作用,且测量的“噪声”取决于“推动”的大小。

为了测试这一框架,研究人员在一个已知确切答案的受控环境中进行了测试。他们使用一个简单的概率系统(如隐马尔可夫模型)构建了一个模拟器,作为完美的参考点。在这种设定下,他们可以为人工智能创建一个“风洞”,在那里他们完全清楚机器内部的信念状态应该是怎样的。随后,他们测试了不同的测量方法在用于控制机器时,预测机器行为的准确度。他们发现,内部测量的准确性与控制的成功之间存在直接联系。如果测量稍有偏差,控制动作就会失败。更重要的是,他们发现,某种测量可能通过改善主要目标而显得成功,但却在无意中破坏了系统中另一个不相关的部分。这证明了仅仅看到一台机器在某项任务上表现得更好是不够的;你必须验证内部解释是否真的与所采取的行动相匹配。

从模拟环境转向真实的预训练模型,研究人员应用了他们的逐步程序,以观察简单的测量能走多远。在一个训练用于识别句子中间接宾语的模型实验中,他们首先假设机器的行为是单个部分的简单加总。他们测量了移除特定内部组件组后的影响。这个简单模型起初表现良好,但当他们测试新的、未见过的组件组合时,它无法准确预测结果。这种误差并非随机的,而是具有结构性的。事实证明,机器依赖于部分之间的交互作用。例如,只有当另一组组件被削弱时,一组组件才会变得重要。通过添加专门设计用于捕捉这些交互作用的测量,研究人员能够修复预测误差。他们发现,有一对特定的组件组对最大的剩余误差负责,而仅添加这一个交互项就使模型的预测几乎达到了完美。

在第二个涉及更大规模、旨在遵循指令的现代模型的实验中,研究人员询问是否需要寻找这些复杂的交互作用。他们采用了相同的简单加法方法,并利用几次额外的测量来补偿由于推动幅度大小带来的影响进行校准。这一次,简单模型几乎完美地工作了。它能以极高的准确度预测模型在新的、未见过的提示词下的行为。当他们尝试添加复杂的交互测量时,结果并没有改善。额外的复杂度是不必要的。这个结果与第一个实验一样重要:它表明,你不应该仅仅因为一台机器规模庞大就假设它是复杂的。有时,一个简单的解释就足够了,增加更多的测量层级只会增加成本而不会带来价值。

论文最后为任何试图理解这些机器的人提供了一份实践指南。建议是:从可能解释该行为的最简单、最廉价的测量开始。如果有效,则停止。如果失败,观察失败的模式。如果误差仅仅是规模问题,一个简单的修正或许就能解决;如果误差表明各部分正以简单模型无法察觉的方式协同工作,那么请设计新的测量来捕捉这些交互作用。最后,始终在模型从未接受过训练的任务上,或是在一个引导行动的控制循环中测试该解释。其目标不仅仅是重建机器的图像,而是构建一个能够可靠预测机器在现实世界施压时会做出何种反应的观察者。这种方法将重点从寻找“真实”的内部机制,转向寻找针对特定目的而言最有用且最可靠的测量方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →