← 最新论文
🤖 machine learning

Markovian Circuit Tracing for Transformer State Dynamic

本文介绍了马尔可夫电路追踪(MCT),这是一个诊断框架,它证明了在合成隐马尔可夫模型任务上的 Transformer 激活编码了粗略的状态转移结构,从而实现了状态抽象,通过激活修补显著提高了反事实预测的准确性。

原作者: Abdullah X

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Abdullah X

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在观看一位魔术师表演戏法。你看到了他们洗牌的牌和所说的话(可见输出),但你无法看到他们脑海中保持的秘密顺序(隐藏状态)。

长期以来,研究人员一直试图通过观察 AI 模型(如 Transformer)的内部齿轮和线路,来弄清楚它们是如何“思考”的。这篇题为**“马尔可夫电路追踪”(MCT)**的论文提出了一种新方法,可以窥探魔术师的大脑,特别是当 AI 试图预测序列中接下来会发生什么时。

以下是他们实验和发现的分解,使用了简单的类比。

1. 设置:一场受控的魔术表演

为了测试 AI,研究人员没有使用真实世界的数据(如莎士比亚作品或新闻文章)。相反,他们基于一个称为隐马尔可夫模型(HMM)的数学概念,构建了一个完全受控的虚假世界

  • 游戏:想象一个棋盘游戏,一个令牌在一个由隐藏房间组成的圆圈中移动。你看不见令牌在哪个房间,但每次令牌移动时,你都会看到一盏彩灯闪烁。
  • 规则:研究人员知道确切的规则:令牌如何在房间之间移动,灯光如何闪烁,以及令牌应该预测的下一个确切内容。
  • AI:他们训练了一个微型 AI(一个"Transformer")来玩这个游戏。它只能看到彩灯,并且必须猜出下一盏灯是什么。

2. 问题:AI 真的在“思考”吗?

当 AI 猜对时,它只是记住了模式,还是真的在构建隐藏房间的内心地图?

研究人员想知道:AI 的内心“大脑活动”(激活值)是否包含这些隐藏房间的地图?

3. 方法:“马尔可夫电路追踪”(MCT)

他们创建了一个名为 MCT 的诊断流程。把它想象成一个翻译器,试图将 AI 混乱的、高维的大脑信号转换为一个简单的“房间”(状态)列表。

他们通过四种方式测试了这个翻译器:

  1. 信念检查:我们能否读取 AI 的内心,看看它是否知道处于每个房间的概率?(就像问:“我有 80% 的把握我在红色房间吗?”)
  2. 地图检查:如果我们强迫 AI 认为它处于特定房间,它的表现是否像真的在那个房间一样?
  3. 转换检查:AI 的内部状态变化方式是否符合游戏规则?
  4. “修补”测试(魔术戏法):这是最重要的部分。他们取出了 AI 的内部“状态”(翻译器对其所在房间的猜测),并在游戏进行中将其交换为不同的状态。
    • 类比:想象 AI 正在开车。在行驶途中,你伸手将司机的心理地图从“我在高速公路上”交换为“我在城市里”。如果 AI 突然开始像在城市里一样驾驶(减速、转弯),那么内部地图就是真实且有用的。

4. 结果:部分成功

发现是“部分但一致的”,意味着 AI 在某些方面做得很好,而在其他方面做得较差。

  • AI 是个好学生:AI 学得非常好。它预测下一盏灯的能力几乎和完美的数学家一样好。
  • “地图”是模糊的:当研究人员试图将 AI 的大脑信号翻译成具体的“房间”时,它并不是完美的 1 对 1 匹配。
    • 简单游戏中(灯光清楚地显示你在哪个房间),AI 的内部地图相当清晰。
    • 困难游戏中(灯光令人困惑或房间太多),AI 的内部地图变得模糊。
  • “修补”证明:这是最大的胜利。当他们强迫 AI 使用特定的内部状态(一个“质心”)时,AI 的行为变化完全符合数学预测。
    • 结果:与使用随机状态或错误状态相比,AI 的行为变得更接近“完美”的数学目标。这证明 AI确实使用特定的内部结构来做决定,即使该结构不是游戏规则的完美复制品。

5. 主要结论

该论文得出结论,Transformer 在解决序列问题时确实会构建内部“状态”摘要,但这些摘要更像是概率信念(例如,“我想我可能在 A 房间”),而不是精确的标签(例如,“我肯定在 A 房间”)。

提到的关键局限性:

  • 这是在微小的合成模型上进行的测试,玩的是虚假游戏
  • 他们使用的“翻译器”很简单。
  • 他们不能声称这适用于复杂的现实世界任务,如写诗或诊断疾病。该论文严格将其主张限制在这个受控的数学基准上。

总结类比

想象你试图通过观察汽车行驶来弄清楚 GPS 是如何工作的。

  • 旧方法:你查看电线,试图猜测地图是如何存储的。
  • 本文的方法:你构建一个微小的、完美的迷宫。你观察汽车如何穿越它。然后,你伸手进入车内,将司机的心理地图与另一个地图交换。如果汽车突然向左转而不是向右转,你就确切地知道司机正在使用地图,并且你成功识别了该地图如何影响驾驶

论文说:“我们建造了一个完美的迷宫,交换了地图,并证明了司机正在使用地图。但我们还不知道这是否适用于在真实的高速公路上驾驶。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →