← 最新论文
💬 NLP

Language Models Generalize to Human-like Word Order Preferences

本研究表明,当语言模型在缺乏修饰语排序直接证据的数据上进行训练时,仍能一致地泛化并倾向于选择符合人类习惯的范围同构词序,这表明这些偏差源于通用的学习机制,而非简单的统计关联。

原作者: Amanda Popadich, Shane Steinert-Threlkeld

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Amanda Popadich, Shane Steinert-Threlkeld

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人学习一门新语言,但你决定耍个花招。你给了机器人一个庞大的书籍库,但你仔细地撕掉了每一页包含“含有多个名词修饰语”句子的页面。因此,机器人学会了可以说“红色的球”或“大的球”,但它从未见过“大的红色的球”或“红色的大的球”。它从未直接接触过如何将多个描述词堆叠在一起的证据。那么,大问题来了:如果你要求机器人去猜测一个新句子如“大的红色的球”的顺序,它会随机乱猜吗?还是它会以某种方式领悟语言中隐藏的逻辑,并选出正确的顺序,就像人类儿童那样?

这正是语言学和人工智能的核心谜题之一。科学家们长期以来一直在思考,人类是否天生拥有一个特殊的“语言芯片”,告诉我们如何排列单词顺序,或者我们仅仅是通过观察听到的模式来学习一切。为了测试这一点,研究人员使用了一种被称为“人工语言学习”(Artificial Language Learning)的方法。这就像是一个受控实验,他们用一种带有缺失部分的、微小的、人造的语言来教导人类或机器,以观察它们如何填补这些空白。如果学习者即使在从未见过该模式的情况下也能选出特定的模式,这就表明他们拥有内置的偏好,或者有一种基于世界结构的聪明猜想方式,而不仅仅是基于词汇出现的频率。本文通过使用现代人工智能语言模型作为测试对象,深入探讨了这个谜团。


伟大的词序之谜

在这项研究中,研究人员 Amanda Popadich 和 Shane Steinert-Threlkeld 决定看看计算机程序(即语言模型)是否能完成人类学习者所做的那种“魔术”。他们想知道:机器能否在从未见过任何一个堆叠短语的例子的情况下,学会如何堆叠形容词和数字的“规则”?

他们寻找的具体规则被称为作用域同构性(scope-homomorphism)。这是一个高级术语,意思是一个短语中单词的顺序应该与其意义的顺序相匹配。可以把它想象成俄罗斯套娃。如果你有一个“大的红色的球”,那么“红色”直接描述球,而“大”描述的是“红色的球”。在英语中,我们自然会将较大的、外层的描述(“大”)放在前面,并将更具体的、内层的描述(“红”)放在离名词更近的地方。研究人员想看看他们的 AI 模型是否会自然地偏好这种“套娃式”的顺序,即使它们接受的训练全是单描述短语。

实验:语言饮食

为了测试这一点,团队创建了一个非常严格的训练环境。他们提取了互联网的一大部分(具体来说是 2023 年的维基百科数据)并对其进行了过滤。他们使用计算机程序寻找每一个名词带有两个或更多修饰语(例如“那些两只毛茸茸的狗”)的句子,并将它们拆解开。他们用单独的例子替换了“那些两只毛茸茸的狗”,比如“那些狗”、“两只狗”和“毛茸茸的狗”。

其结果是一种“贫乏刺激”式的饮食。模型被喂食了 1 亿个单词,但它们从未见过一个带有两个修饰语的名词。它们学习了单个的原料,却从未见过最终的蛋糕。随后,研究人员通过让模型在两个版本的句子之间做出选择来测试它们:一个是遵循“套娃逻辑”(作用域同构)的版本,另一个则不是。

他们测试了三种不同规模的 AI 模型:小型(5200 万参数)、中型(1.1 亿)和大型(3.5 亿)。

结果:AI 做对了

研究结果出奇地一致。尽管模型在训练期间从未见过带有多个修饰语的短语,所有三个模型都一致地偏好“套娃式”的顺序。

当研究人员要求模型在“那些两只狗”(逻辑顺序)和“两那些狗”(打乱顺序)之间做出选择时,模型压倒性地选择了逻辑正确的那个。

  • 小型模型在约 76% 的情况下选对了。
  • 中型模型在约 73% 的情况下选对了。
  • 大型模型在约 70% 的情况下选对了。

这表明模型不仅仅是在记忆训练数据;它们泛化出了一个规则。它们发现,当你拥有多个描述时,存在一种特定的、逻辑性的排列方式,即使在没有被告知答案的情况下也是如此。有趣的是,模型的规模并没有显著改变结果;小型、中型和大型模型都表现出了这种偏好,这表明这种能力是这些系统学习过程中的一个稳健特征。

转折:不仅仅是单词配对

研究人员随后提出了一个后续问题:模型是如何弄清楚这些的?一种流行的理论是,学习者只是观察单词在一起出现的频率。例如,也许“红色”通常紧挨着“球”,所以它应该总是比“大”更靠近名词。这通过所谓的**逐点互信息(Pointwise Mutual Information, PMI)**来衡量,这基本上是衡量两个单词之间关联强度的得分。

团队检查了数学计算。他们计算了训练数据中单词的关联得分。他们发现,是的,形容词与名词有很强的关联,而数字和指示代词(如“那些”)的关联度较低。如果模型只是遵循这些关联得分,它们理应能够完美预测单词顺序。

但转折点在于:关联得分未能预测模型的选择。

当研究人员将模型的实际选择与数学预测的结果进行比较时,相关性几乎为零。模型选择了正确的顺序,但它们并不是因为统计单词出现的次数才这么做的。这表明模型正在捕捉一些更深层的东西——也许是对语言运作方式的结构性理解——这超越了简单的词对统计。

这意味着什么

这项研究表明,语言模型可以从“贫乏”的输入中恢复出类似人类的语言泛化能力。就像一个人类儿童可能会在没见过所有可能的组合的情况下,猜出一种新语言的正确词序一样,这些 AI 模型也找到了一个并未在训练数据中明确存在的模式。

然而,作者谨慎地指出,这并不证明 AI 的学习方式与人类完全相同。模型不是有意识的孩子;它们是复杂的统计引擎。但事实是,它们在没有被告知的情况下就发展出了这种偏好,这表明你并不一定需要一个预设的“语言芯片”来学习这些规则。有时,语言的规则可以从学习经验中自然涌现,即使证据是不完整的。

研究人员还注意到 AI 与人类之间的一个微小差异:虽然人类通常在指示代词和形容词(如“那只大狗”)的排序上表现出最强的偏好,但 AI 模型在指示代词和数字(如“那些两只狗”)的排序上表现出最强的偏好。这暗示着,虽然通用的泛化能力是存在的,但偏好的具体细节可能取决于训练数据的细节。

最后,这篇论文为我们理解语言提供了一个酷炫的新工具。通过给 AI 模型喂食缺失信息的“饮食”,我们可以看到它们自己会“猜”出什么,从而帮助我们理解语言规则是硬编码的,还是从世界的模式中学习而来的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →