← 最新论文
💬 NLP

Tool-Call Dependency Structure is Linearly Decodable in LLM Agent Residual Streams

本文证明,大语言模型智能体中工具调用轨迹的有向依赖图可从模型的残差流中线性解码,从而揭示该网络主动表征抽象执行拓扑,而非仅仅追踪位置顺序或标识符值。

原作者: Tianda Sun, Dimitar Kazakov

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianda Sun, Dimitar Kazakov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创造性类比对这篇论文的解读。

核心理念:解读计划的“幽灵”

想象一个大语言模型(LLM)是一位非常聪明但略显健忘的助手。当你要求这位助手完成一项复杂任务——例如“查找用户、检查其订单,然后交换产品”——它不会一步到位。它必须分几步走,沿途调用不同的工具。

这篇论文提出了一个简单的问题:模型在思考过程中是否“知道”这些步骤是如何相互连接的?

具体来说,如果步骤 A 提供的信息是步骤 B 所需的,模型的内部大脑(其“残差流”)是否真的保存着显示这种连接的地图?还是说,模型仅仅是根据它最后说了什么来猜测下一步?

研究人员发现,是的,模型确实保存着这张地图。 他们构建了一个微小而简单的“解码器”,可以读取模型的内部思维,并以高准确率揭示隐藏的依赖关系图(即谁需要从谁那里获取什么的地图)。

类比:建筑工地的蓝图

将模型想象成一个建筑工地。

  • 工具: 模型使用诸如“获取用户”或“获取订单”之类的工具。
  • 轨迹: 模型采取的行动序列。
  • 依赖关系图: 这就是蓝图。它指出:“在你拿到水泥送货收据(步骤 A)之前,你不能浇筑混凝土(步骤 B)。”

通常,我们只能看到建成的房子(最终答案)。我们看不到工人们脑海中的蓝图。这篇论文就像戴上了一副特殊的 X 光眼镜,让我们能看到工人们在干活时,脑海中漂浮着的蓝图。

他们是如何做到的(“解码器”)

研究人员使用了一个名为 Qwen3-32B 的模型。他们观察该模型解决问题,并记录其内部的“残差流”(代表其当前思维状态的连续数据流)。

他们训练了一个非常小且简单的工具(称为“探针”),来观察这个数据流,并对过程中的任意两个步骤回答一个二元问题:

“步骤 A 的输出是否输入到了步骤 B 的输入中?”

结果:

  • 行之有效: 该探针预测这些连接的准确率约为 87%
  • 并非巧合: 他们针对随机猜测和简单模式(例如“步骤 2 总是跟在步骤 1 之后”)进行了测试。探针的表现远优于这些情况,证明它实际上是在读取连接的逻辑,而不仅仅是事件的顺序。
  • 具有抽象性: 当他们更改数据中的具体数字(例如,将用户 ID 从"123"改为"456")但保持结构不变时,探针仍然有效。这意味着模型理解的是关系(A 依赖于 B),而不仅仅是具体的词语。

机器中的“幽灵”(传播)

最酷的发现之一是关于这些信息如何传播的。

想象你向第一位工人(步骤 A)耳语了一个秘密。论文表明,这个秘密并不会在工人完成任务后就消失。它会穿过整个建筑工地,在“空气”(残差流)中萦绕,一直传递到最后一位工人(步骤 Z)。

他们通过“修补”(交换)第一位工人的内部状态为另一种场景来证明了这一点。尽管模型没有改变其最终行为(它仍然建造了同一座房子),但后期工人内部的“蓝图”却发生了变化,以匹配新的场景。这表明模型正在主动地将结构计划向前推进,而不仅仅是对即时提示做出反应。

这张地图何时消失?

研究人员在不同类型的任务上测试了这一点,以查看这张地图是否始终存在。他们发现了一个规律:

  1. 复杂链条(多跳): 如果任务需要长链条的依赖关系(A \to B \to C \to D),那么这张地图非常清晰且易于读取。
  2. 简单列表: 如果任务只是一系列独立的步骤(A,然后 B,然后 C,没有任何连接),那么这张地图就会消失。
  3. “顺序”线索: 如果步骤简单到仅凭顺序就能告诉你一切(例如,“先做 A,然后做 B"),模型就不需要构建复杂的内部地图。因为仅凭位置就足够了,所以“额外”的信号消失了。

这意味着什么(以及不意味着什么)

这意味着:
我们找到了一种新的方法来审视 AI 智能体内部。我们可以看到,它们不仅仅是在盲目地猜测下一个词;它们正在维护一个结构化的、抽象的地图,显示它们的行动如何相互依赖。这张地图是线性的(易于读取),并穿过模型的各层传播。

这并不意味着(严格基于这篇论文):

  • 这并不意味着我们现在可以轻易控制模型以做出更好的决策(论文明确指出,修补改变了内部地图,但没有改变最终行为)。
  • 这并不意味着这对每一个 AI 模型或每一个小型模型都有效(他们只测试了特定的大型模型)。
  • 这并不意味着我们可以利用这一点来修复“幻觉”或使模型更安全;那是未来的工作。

总结

这篇论文就像发现了一位魔术师助手的助手不仅仅是在背诵剧本,而是实际上持有整个魔术逻辑的思维导图。通过使用一个简单的解码器,研究人员证明了这张地图确实存在,它穿过模型的大脑传播,并且对于解决复杂的多步骤问题至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →