← 最新论文
💬 NLP

Mechanistic evaluation of Transformers and state space models

本文通过因果干预揭示,尽管 Transformer 和 SSM 在关联召回任务上可能达到相似的准确率,但它们依赖于根本不同的机制——具体而言,Transformer 和基于 Transformer 的模型使用上下文归纳,而大多数 SSM 依赖于单层状态计算,唯有 Mamba 通过短卷积而非其核心 SSM 组件实现了归纳。

原作者: Aryaman Arora, Neil Rathi, Nikil Roashan Selvam, Róbert Csordás, Dan Jurafsky, Christopher Potts

发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Aryaman Arora, Neil Rathi, Nikil Roashan Selvam, Róbert Csordás, Dan Jurafsky, Christopher Potts

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人玩记忆游戏。游戏非常简单:你给机器人展示一组配对列表,比如“苹果 = 红色”,“香蕉 = 黄色”,“葡萄 = 紫色”。然后,你问:“香蕉是什么颜色的?”机器人需要回看列表,找到“香蕉”,并记住它与“黄色”相连。

在 AI 世界中,这被称为联想召回(Associative Recall)。你分享的这篇论文深入探讨了不同类型的 AI 大脑(架构)是如何玩这个游戏的。研究人员不仅看了谁的分数最高,还把机器人放在显微镜下,观察它们在玩游戏时内部到底发生了什么。

以下是他们研究发现的故事,通过简单的概念进行了拆解。

两大主要竞争者

该论文对比了两种主要的 AI 架构:

  1. Transformer: 当前 AI 的冠军(比如驱动大多数聊天机器人的技术)。它们使用一种叫做“注意力(Attention)”的机制,就像一个聚光灯,可以瞬间扫描整个配对列表来寻找答案。
  2. 状态空间模型(SSMs): 新兴的、更快且更高效的挑战者(如 MambaDeltaNet)。它们的设计初衷是比 Transformer 更轻量、更快速,但一直被怀疑在记忆任务上表现较差。

重大发现:不仅仅是关于分数

通常,如果一个 AI 在测试中得了 99 分,我们会假设它学会了教训。但本文认为,拿到正确答案并不意味着你学对了方法。

研究人员使用了一种特殊的“手术”技术,称为因果干预(Causal Intervention)。想象你有一个完美解决记忆游戏的机器人。然后,你在机器人读完列表之后、给出答案之前,偷偷地将记忆中的“香蕉”替换成“汽车”。

  • 如果机器人突然说“汽车是黄色”,这意味着它实际上是在记忆这种联系(归纳/Induction)。
  • 如果机器人只是瞎猜或失败了,这意味着它并没有以一种灵活的方式存储这种联系;它只是在观察紧邻的周围环境。

他们的发现

1. “归纳”与“直接检索”的区别

  • Transformer 和 “Based” 模型: 这些模型学会了用“聪明”的方式玩游戏。它们创建了一个心理地图,在阅读列表时,将项目与数值之间的连接(例如,“香蕉”粘在“黄色”上)存储起来。当被提问时,它们会查找这个存储的地图。研究人员称之为归达(Induction)
  • 大多数 SSMs(如 H3 和 Hyena): 这些模型输掉了游戏。它们无法理解如何存储这些联系。
  • Mamba 和 DeltaNet: 这些模型拿到了高分,但它们作弊了!它们没有建立心理地图。相反,它们使用了一个“捷径”。当“香蕉?”这个问题出现时,它们会立即看向问题前的那个标记(token),或者使用一种非常特定、僵化的技巧来抓取答案。它们并没有学习“关联”事物的通用规则;它们只是学会了从特定位置抓取答案。

2. 秘密武器:“短卷积(Short Convolution)”

研究人员发现,那些确实成功的模型(Mamba 和 Based)拥有一个秘密武器:一个微小的、短期的记忆工具,叫做短卷积

  • 类比: 想象你在读一本书。“长卷积”就像读完整个章节来理解一个句子。“短卷积”就像瞥一眼你刚刚读到的词和它前面的词。
  • 发现: Mamba 使用这种“瞥一眼”(短卷积)的操作,在阅读时将“香蕉”与“黄色”联系起来。如果没有这个特定的工具,Mamba 会完全忘记如何玩这个游戏。事实证明,Mamba 并不是利用它的主“大脑”(SSM 部分)来进行记忆工作,而是利用这个微小的“瞥一眼”工具来承担重任。

3. 转折点:“树状”游戏 (ATR)

为了观察这些发现是否只是简单游戏的偶然现象,研究人员发明了一个更难的版本,叫做联想树调用(Associative Treecall, ATR)

  • 变化: 在简单的游戏中,“香蕉”和“黄色”总是紧挨在一起。“树”游戏中,它们可以离得很远,被其他词分隔开,就像一个家族树。“约翰有一个狗。狗追逐了一只猫。猫看到了一只鸟。约翰有什么?”
  • 结果:
    • Transformer 和 Based: 仍然使用它们的“归纳”地图。它们轻松应对距离问题。
    • Mamba(带有捷径): 仍然使用它的“瞥一眼”工具,并且表现良好。
    • Mamba(没有捷径): 令人惊讶的事情发生了!当研究人员移除了 Mamba 的“短卷积”工具时,Mamba 在简单的游戏中失败了,但在更难的“树”游戏中却成功了。
    • 为什么? 没有了捷径,Mamba 被迫学习“归纳”地图(以 Transformer 的方式)来解决更难的问题。这证明了 Mamba 有能力学习聪明的方法,它只是只有在迫不得已时才会这样做。

总结

论文的结论是:准确率是一个骗子。

两个 AI 模型可能在测试中得到相同的分数,但一个是理解规则的天才(归纳),而另一个是仅仅背下了该特定测试答案表的投机取巧者(直接检索)。

  • Transformer 就像图书管理员,他们整理书架上的书,以便稍后可以找到任何联系。
  • Mamba(在其标准形式下)就像一个只记得自己最后看到的东西的人,除非它使用特定的“便利贴”(短卷积)来提供帮助。
  • 教训: 要真正理解 AI,我们不能只看测试分数。我们必须查看内部,看看机器是如何思考的。这种“机械化评估(mechanistic evaluation)”是作者提出的新工具,旨在防止我们被隐藏了弱理解力的的高分所欺骗。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →