← 最新论文
💬 NLP

The Mechanistic Emergence of Symbol Grounding in Language Models

本文引入了一个受控评估框架,证明了符号落地(symbol grounding)通过一种聚合机制在规模化训练的多模态语言模型的中间层中涌现,其中注意力头将环境输入与语言预测相连,这一现象在 Transformer 和状态空间模型中被观察到,但在单向 LSTM 中并未出现。

原作者: Shuyu Wu, Ziqiao Ma, Xiaoxi Luo, Yidong Huang, Josue Torres-Fonseca, Freda Shi, Joyce Chai

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuyu Wu, Ziqiao Ma, Xiaoxi Luo, Yidong Huang, Josue Torres-Fonseca, Freda Shi, Joyce Chai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:词语是如何获得意义的?

想象一个机器人读遍了世界上所有的书,但从未见过真正的苹果,没摸过它的表皮,也没尝过它的甜美。对于这个机器人来说,“苹果”这个词仅仅是一个字母组合的模式,就像一段秘密代码。它知道“苹果”经常出现在“红色”或“派”附近,但它并不真正“知道”苹果是什么。

这个问题被称为符号接地(Symbol Grounding)。它在追问:抽象的符号(词语)是如何与现实世界的体验建立联系的?

长期以来,科学家们认为你必须显式地教计算机这种联系(比如每当它说到“苹果”时,都要给它看一张苹果的照片)。但最近的大型 AI 模型似乎通过仅仅预测句子中下一个词,就自行掌握了这一点。

这篇论文提出的核心问题是: AI 是如何做到这一点的?在这个机器人的大脑内部,这个“顿悟”时刻究竟发生在何处?

实验:一个受控的游乐场

为了找到答案,研究人员并没有直接观察一个巨大且复杂的 AI,而是构建了一个微小的、受控的游乐场(一个“测试平台”),以便以慢动作观察学习过程。

设置:
想象一本故事书,其中的每个物体都被描述了两次:

  1. 环境标记(“场景”): 对场景的描述,例如“地板上有一个箱子。”
  2. 语言标记(“言语”): 一个孩子在说话,例如“我看到一个箱子。”

至关重要的一点是,研究人员确保计算机将场景中的“箱子”和言语中的“箱子”视为完全不同、互不相关的代码。AI 别无选择,只能被迫学习到这两个不同的代码实际上代表着同一个东西。

测试:
他们要求 AI 猜测孩子接下来会说什么词。

  • 情景 A(匹配): 场景描述中提到了“箱子”。AI 能够轻松猜出“箱子”。
  • 情景 B(不匹配): 场景描述中提到的是“玩具”。AI 在猜测“箱子”时遇到了困难。

结果:
当“场景”与“言语”匹配时,AI 预测单词的能力变得更强了。这证明了 AI 已经学会了接地这个词(将言语与场景联系起来),而且无需被显式教授。

发现:“大脑中的中层管理者”

一旦确定 AI 能够 做到这一点,他们便想知道它是如何做到的。他们观察了 AI 的“大脑”(其神经网络层),看看哪些部分在努力工作。

他们发现,神奇之处并不发生在最开始(输入端)或最后阶段(输出端),而是发生在中间层

类比:图书馆与图书管理员
把 AI 的各层想象成一个图书馆系统:

  • 早期层: 就像存放书籍(信息)的架子,只是在堆叠数据。它们持有原始数据。
  • 中间层: 这些是图书管理员
  • 后期层: 这些是撰写最终报告的人。

研究人员发现,中间层中特定的“图书管理员”(称为注意力头/Attention Heads)正在承担一项特殊的工作。它们扮演着磁铁的角色。

  1. 收集: 一些图书管理员抓取“环境”信息(场景描述)并将其整合在一起。
  2. 聚合: 其他图书管理员则获取这些整合后的信息,并将其向前推进,以辅助预测“语言”词汇。

他们称之为**“聚合机制”(Aggregate Mechanism)**。这就像一支工作团队,其中一组人负责从仓库收集原材料,而另一组人立即利用这些材料来制造最终产品。

转折:并非所有大脑都构造相同

研究人员测试了不同类型的 AI 架构,以观察这种“接地”能力是一种通用的特征,还是特定设计的产物。

  • Transformer(当前的行业标准,如 GPT): 是的!它们拥有成功的中间层图书管理员,能够将场景与词语连接起来。
  • Mamba-2(一种更新、更高效的设计): 是的!它们也具备这种接地能力。
  • LSTM(较旧的技术): 不是。 这些模型无法将场景与词语联系起来。

为什么? 论文指出,旧的模型(如 LSTM)更像是传送带,只能一步步向前移动。它们无法轻易“向后回溯”去抓取来自场景的信息并将其带到当前的词汇。而较新的模型(如 Transformer)则像一张,其中的每个部分都可以瞬间与其他任何部分进行对话,从而允许它们“向后回溯”并抓取所需的上下文。

总结

这篇论文证明了,当你在足够多的数据上训练现代 AI 时,它会自然而然地发展出一种连接词语与其现实世界语境的机制。它不需要老师说:“这个词代表这张图片。”

相反,AI 在它大脑的中部构建了自己的内部“归档系统”。网络的特定部分学会了充当桥梁,抓取环境线索,并利用这些线索来理解语言。只要 AI 的架构足够灵活,允许这些部分相互通信,这一切就会自动发生。

简而言之: AI 通过构建一支专门的中层工作团队来学习“接地”其符号,这支团队知道如何提取正确的上下文,并将其传递给正确的词汇。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →