← 最新论文
💬 NLP

On the Emergence and Test-Time Use of Structural Information in Large Language Models

本文研究了大语言模型如何从观测数据中学习并应用抽象结构信息,揭示了这种学习能力的涌现虽然与复杂推理相关,但模型在测试时进行组合生成的能力仍然有限。

原作者: Michelle Chao Chen, Moritz Miller, Bernhard Schölkopf, Siyuan Guo

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Michelle Chao Chen, Moritz Miller, Bernhard Schölkopf, Siyuan Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,大型语言模型(LLM)就像是才华横溢的大厨,读遍了世界上所有的食谱。他们可以完美地背诵食谱,甚至能将见过的食材进行组合来制作新菜肴。但他们真的理解烹饪的“逻辑”吗?他们能否根据一个基本规则(比如“如果你加盐,它就会变咸”)应用到一个他们从未见过的全新食材上,还是说他们只是在死记硬背特定的菜谱?

这篇名为**《论大型语言模型中结构化信息的涌现与测试时使用》**的论文,就像是一场旨在回答这个问题的科学厨房实验。研究人员想要观察这些 AI 大厨学习的是底层的“语法规则”(结构),还是仅仅记住了它们训练过的特定句子。

以下是利用简单类比对研究结果进行的拆解:

1. 游乐场:一个“语法健身房”

为了测试这些模型,研究人员并没有向它们投喂随机的句子。他们基于一个被称为“转换语法”(Transformational Grammar)的概念,构建了一个特殊的**“语法健身房”**。

把语言想象成一套乐高积木。

  • 深层结构(Deep Structure): 句子的核心思想(例如,“约翰很快乐”)。
  • 表层结构(Surface Structure): 我们实际表达的方式(例如,“看起来约翰很快乐”)。

研究人员创建了一个数据集,要求 AI 对句子进行特定的“转换”,比如将陈述句变为疑问句、将主动语态变为被动语态,或者将主语移到句首。这就像是要求大厨把一个蛋糕食谱瞬间改写成一个派的食谱,并遵循严格的规则。

2. 发现:AI 何时“开窍”?

研究人员观察了 AI 在训练过程中的表现,通过观察其内部的“脑电波”(数学表示)来查看它何时开始理解这些规则。

  • “顿悟”时刻: 他们发现,AI 学习这些规则并不是渐进式的。相反,它经历了一个**相变(Phase Transition)**过程。想象一下灯开关被拨动的瞬间。在训练的某个特定点(大约在第 64,000 步时),AI 突然开始能够区分不同类型的句子变化。
  • 与推理的联系: 有趣的是,这种“开关”的开启不仅帮助 AI 更好地预测下一个词,还与其在复杂推理任务上的表现提升相关联。这表明,为了解决困难的逻辑谜题,AI 需要理解语言的底层结构,而不仅仅是单词本身。

3. 测试:AI 能组合规则吗?(“组合”问题)

这是实验中最关键的部分。研究人员问道:如果我们分别教 AI 规则 A 和规则 B,它能否将规则 A + 规则 B 组合起来,应用在一个它从未见过的句子中?

  • 结果: AI 表现挣扎。
    • 当 AI 被给予中间步骤(例如,“先做规则 A,再做规则 B”)时,它表现良好。
    • 但当被要求在没有帮助的情况下一次性完成整个链条时,它经常失败。
  • 隐喻: 想象教一个学生如何系左鞋带,以及如何系右鞋带。如果你要求他们在不看步骤的情况下同时系好两只鞋,他们可能会感到困惑。AI 似乎是在死记硬背特定步骤的组合,而不是真正理解这些独立规则以实现自由的混搭。

4. 机器内部:魔力发生在哪里?

研究人员还对 AI 的大脑进行了“手术”(称为消融实验),以观察哪些部分在承担重任。

  • “肌肉” vs. “大脑”: 他们发现,MLP 层(可以理解为 AI 的“肌肉”或进行重度计算的处理单元)贡献了约 65% 的转换成功率。而 注意力头(Attention heads)(决定关注点的“大脑”)仅贡献了约 35%
  • 最后一层: 实际决定“如何转换这个句子”的过程主要发生在网络的最后几层。这就像是 AI 花了大部分时间在思考,然后在最后一秒钟才确定要应用的具体规则。

5. 核心结论

论文以一种既有喜讯又有现实警示的方式作结:

  • 好消息: LLM 确实 学习到了结构化信息。它们不仅仅是在背诵文本;它们建立了一套关于句子如何运作的内部地图,并且随着推理能力的增强,这张地图变得越来越清晰。
  • 现实警示: 然而,这种学习目前还不完美。当涉及到组合这些规则以在测试时生成全新的、复杂的知识(测试时组合)时,AI 仍然受到限制。它严重依赖于看到中间步骤,并且难以将规则“解耦”,从而无法在新的情境下灵活地应用规则。

简而言之: AI 正在学习游戏的规则,但它目前仍像是一个掌握了数学公式却需要看例题解题步骤,才能独立解决新问题的学生。它们尚未完全掌握纯粹且灵活的创造力艺术。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →