← 最新论文
🤖 AI

Emergent Analogical Reasoning in Transformers

本文通过范畴论函子的视角将 Transformer 中的类比推理形式化,并通过合成任务与机制分析证明,该类比推理源于关系结构的几何对齐与函子应用,且相关发现对预训练大语言模型同样成立。

原作者: Gouki Minegishi, Jingyuan Feng, Hiroki Furuta, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Gouki Minegishi, Jingyuan Feng, Hiroki Furuta, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《Transformer 中的涌现类比推理》的解释,采用通俗易懂的语言和富有创意的比喻。

核心理念:AI 如何学会“懂笑话”

想象你在教一个机器人理解世界。你给它看一张太阳和围绕其运行的行星的图片。然后,你给它看一张质子和围绕其运行的电子的图片。

人类会立刻看到其中的联系:“哦!太阳就像质子,行星就像电子。”我们之所以能理解这一点,并不是因为太阳长得像质子(它们截然不同),而是因为它们在各自的系统中扮演着相同的角色。这被称为类比

这篇论文提出了一个问题:AI 模型(Transformer)是如何学会进行这种逻辑“飞跃”的? 它们仅仅是死记硬背事实,还是真正理解了底层结构?

实验:一个人工构建的游乐场

为了找出答案,研究人员为 AI 构建了一个“玩具世界”。

  • 设置: 他们创建了两组独立的角色(我们称之为A 组B 组)。
  • 规则: 在 A 组中,每个角色与其他角色都有特定的关系(例如,“爱丽丝是鲍勃的老板”)。在 B 组中,角色是不同的(例如,“X 是 Y 的老板”),但关系的模式与 A 组完全相同。
  • 测试: AI 在 A 组上进行训练。然后,研究人员问它:“如果爱丽丝是鲍勃的老板,且 X 是 Y 的老板,那么谁是 Z 的老板?”AI 必须仅通过观察关系的结构(而不是名字)来推断出"X"对应“爱丽丝”,"Y"对应“鲍勃”。

他们的发现:三阶段成长突增

研究人员观察了 AI 随时间的学习过程,发现它经历了三个截然不同的阶段,就像孩子成长一样:

  1. 死记硬背(机械学习者): 首先,AI 只是死记硬背它看到的具体事实。如果它看到“爱丽丝是鲍勃的老板”,它就记住了这一对确切的关系。
  2. 组合(拼图解决者): 接下来,它学会将事实串联起来。如果“爱丽丝是鲍勃的老板”且“鲍勃是卡罗尔的老板”,它就能推断出“爱丽丝是卡罗尔的老板”。
  3. 类比(富有洞察力的思考者): 最后,也是最重要的是,它学会将 A 组的结构映射到 B 组。它意识到:“我不需要知道 X 是谁;我只需要知道 X 扮演的角色与爱丽丝相同。”

关键发现: 这种最后的“洞察”阶段非常脆弱。仅仅增大 AI 的规模并不会让它自动发生。它需要适量的数据、合适的训练速度以及特定的设置。如果训练过于混乱或数据过于稀疏,AI 就永远无法完成这种飞跃。

秘密配方:AI 实际上是如何做到的

研究人员不仅观察了 AI 如何解决问题,还深入其“大脑”(内部数学机制)查看它是如何解决的。他们发现模型内部发生了两个神奇的步骤:

1. “几何之舞”(结构对齐)

想象 AI 拥有一张巨大的 3D 地图,其中每个角色都是一个点。

  • 学习之前: A 组和 B 组的点随机散布。它们看起来毫无关联。
  • 学习之后: AI 重新排列了这些点。突然,代表“爱丽丝”的点和代表"X"的点在 3D 空间中靠得更近了。代表“鲍勃”的点和"Y"的点也靠得更近了。
  • 比喻: 这就像两个独立的舞池。起初,舞者们随机移动。然后,音乐变了,两个舞池的舞者开始完美地镜像彼此的动作。AI 已经对齐了两个组的几何结构

2. “魔法向量”(函子)

一旦点对齐,AI 就使用一个简单的数学技巧来解决谜题。

  • 它将两组之间的关系视为一个向量(方向和距离)。
  • 它本质上是在做这样的数学运算:目标角色 = 源角色 + 魔法方向
  • 比喻: 想象你有一张伦敦地图。你想知道巴黎相对于伦敦在哪里。你不需要背诵巴黎的每条街道。你只需要一个“翻译箭头”,上面写着“向东移动 200 英里”。AI 找到了这个“翻译箭头”(他们称之为函子),并将其加到源角色上以得出答案。

这在现实 AI 中会发生吗?

研究人员在巨大的预训练 AI 模型(如 Gemma 和 Llama)上测试了这一点,这些模型从未接受过他们特定的玩具游戏训练。

  • 结果: 是的!即使这些大模型没有明确接受过玩具游戏的训练,当你要求它们解决类比问题时,它们也会经历相同的过程。
  • 逐层旅程: 在玩具模型中,这是随着时间(训练步数增加)发生的。在大模型中,这是随着深度(数据在网络层中传递)发生的。早期层是混乱的,但当数据到达最终层时,“几何之舞”已经完成对齐,“魔法箭头”被应用以给出正确答案。

总结

这篇论文表明,类比推理不仅仅是 AI 的一种模糊的“感觉”。它是一个具体的、机械的过程,AI 在此过程中:

  1. 在其内部地图中对齐两个不同世界的形状。
  2. 找到一个简单的“翻译箭头”以在它们之间移动。
  3. 利用该箭头从一个世界跳跃到另一个世界。

这证明了现代 AI 不仅能死记硬背;它还能学会看到连接不同思想的隐藏结构,就像人类一样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →