← 最新论文
🤖 machine learning

Transformers Linearly Represent Highly Structured World Models

通过在对数独求解轨迹进行训练,该研究揭示模型在内部构建了一个与领域约束代数而非表面特征相一致的结构化世界模型,并利用如“唯余解”检测器之类的稀疏可解释电路来完成任务。

原作者: Roman Kniazev, Nathanaël Fijalkow

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Roman Kniazev, Nathanaël Fijalkow

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位才华横溢但神秘莫测的学徒来学习如何解数独谜题。你并没有直接教他们规则,而是向他们展示了成千上万例他人逐步解题的实例。一段时间后,这位学徒在解题方面变得非常擅长。

但这里有一个关键问题:这位学徒的大脑究竟是如何运作的? 他们是将谜题视为 81 个独立的空白方格,还是将其视为一组相互关联的规则?

本文正是通过“打开”一个在数独上训练过的计算机模型(Transformer)来探究这一问题。研究人员发现了该模型思考方式的三个惊人之处。

1. “团队队长”与“个体工人”

大多数人假设,如果你向模型展示一个数独网格,它会学会像工人核对清单上 81 个独立项目那样,逐个追踪每一个单元格(小方格)。

论文的发现: 模型并非如此。相反,它将思考组织围绕组别展开。
请将数独谜题视为不是 81 个方格,而是三种类型的“团队”:

  • 行团队(9 条水平线)
  • 列团队(9 条垂直线)
  • 宫团队(9 个小的 3x3 方格)

该模型构建了一个“世界模型”,在其中它追踪的是这些团队中存在哪些数字,而不仅仅是单个方格。这就好比学徒不再盯着单独的砖块,而是开始关注墙壁、地板和天花板。研究人员发现,该模型在回答“数字 5 是否在第一行?”时完美无缺,但在猜测“这个特定方格中是什么数字?”时准确率仅为 80% 左右。

为什么? 因为在数独中,一个数字的有效性取决于它所属的,而非方格本身。模型学会了以规则(代数)而非表面外观(网格)来思考。

2. 中间的“交通指挥官”

该模型拥有 8 层“思考”步骤。研究人员观察了中间层,以查看信息是如何流动的。

论文的发现: 他们发现了特定的“交通指挥官”(称为注意力头),它们充当每个团队的专门管理者。

  • 一位管理者只关注第 4 行
  • 另一位只关注第 5 宫
  • 还有一位只关注第 2 列

这些管理者有一个非常简单的任务:“禁止通行”信号。
如果一个数字(比如 7)已经出现在第 4 行,这位管理者会立即在该行所有空白处为数字 7 挂上“禁止使用”的标志。它们不仅仅是忽略它,而是主动抑制使用它的念头。这种情况会同时发生在所有行、列和宫中,从而生成一份清晰的“可用数字”清单。

3. “灵光一现”神经元

最后,研究人员观察了模型做出移动前的最后一步。这是模型决定“好吧,我要在这里放一个 7"的时刻。

论文的发现: 他们发现了一小群特定的神经元(仅 91 个),它们像灯泡一样运作。

  • 这些灯泡仅当某个特定单元格只剩下恰好一个可能的数字时才会亮起(这种情况被称为“唯余数”或"Naked Single")。
  • 当灯泡亮起时,它不仅仅是在说"7 是好的”。它会高喊:“嘿,整个这个单元格都解出来了!”并同等地提升该单元格中所有数字的置信度。
  • 由于中间层已经完成了排除错误数字的艰苦工作,正确的数字原本就是首选。灯泡只是给予它最后一次巨大的推动,以确保模型确信该答案。

大局观

该论文得出结论:这个人工智能不仅仅是记住了模式,而是构建了一个与谜题逻辑完美匹配的内部地图。

  • 它看到的不是网格,而是约束
  • 它不是随机猜测,而是利用专门的管理者来执行规则。
  • 它不会犹豫不决;当逻辑清晰时,它有专用的开关来锁定答案。

研究人员通过“破坏”模型证明了这一点:当他们关闭“行管理者”时,模型开始建议那些已经出现在该行的数字。当他们关闭“灯泡神经元”时,即使模型知道答案就在那里,它也会对选择哪个数字感到困惑。

简而言之,这个人工智能学会了像人类专家一样解数独:通过理解游戏规则,而不仅仅是盯着空白方格。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →