← 最新论文
💬 NLP

Community size rather than grammatical complexity better predicts Large Language Model accuracy in a novel Wug Test

该研究通过多语言“虚词测试”发现,大语言模型在形态泛化任务中的表现主要受语言社区规模和训练数据丰富度驱动,而非语法复杂性,其类人准确性仅反映了表面上的语言胜任力。

原作者: Nikoleta Pantelidou, Evelina Leivada, Raquel Montero, Paolo Morosi

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikoleta Pantelidou, Evelina Leivada, Raquel Montero, Paolo Morosi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM,比如 ChatGPT)做一场特殊的“语言考试”,目的是看看它们到底是不是真的“懂”语言,还是只是在“背答案”。

为了让你轻松理解,我们可以把这项研究想象成一场关于“造词”的创意大赛

1. 核心实验:给模型出“无中生有”的题

研究人员设计了一个叫"Wug 测试"的经典游戏。

  • 怎么玩:想象你告诉一个孩子:“这是一个叫'Wug'的小怪兽。”然后你给他看两个小怪兽,问:“现在有两个____?”
  • 考什么:孩子必须自己造出复数形式(比如"Wrugs")。如果孩子能造出来,说明他真的掌握了“加 s 变复数”的规则,而不是死记硬背了单词。
  • 这次的研究:研究人员让 6 个不同的 AI 模型和人类一起,用四种语言(英语、西班牙语、加泰罗尼亚语、希腊语)玩这个游戏。他们造了一些现实中不存在的“假词”,看 AI 能不能像人一样,根据规则给这些假词加上正确的后缀。

2. 两个猜测:AI 是靠什么变聪明的?

在测试之前,大家心里有两个主要的猜想,就像在猜运动员赢比赛是靠“天赋”还是靠“训练量”:

  • 猜想 A:语法复杂度(天赋论)

    • 逻辑:如果一种语言的语法很复杂(像希腊语,变化多端),AI 可能很难学会;如果语法简单(像英语,规则少),AI 应该表现更好。
    • 比喻:这就像认为学数学(复杂)比学背乘法表(简单)更难,所以 AI 在简单语言里应该拿高分。
  • 猜想 B:社区规模与数据量(训练量论)

    • 逻辑:AI 是靠吃互联网上的文字长大的。如果一个语言的使用者多、网上资料多(像英语、西班牙语),AI 就“吃得饱”,学得好;如果使用者少、资料少(像加泰罗尼亚语、希腊语),AI 就“吃不饱”,学不好。
    • 比喻:这就像练肌肉。不管动作多简单,如果你每天举重(数据多),肌肉就发达;如果没人给你提供哑铃(数据少),动作再简单你也练不出好身材。

3. 实验结果:谁赢了?

结果非常有趣,直接推翻了“天赋论”,证实了“训练量论”。

  • AI 像人吗

    • 是的。除了一个比较笨的模型(BERT)外,其他 AI 在造词规则上的表现和人类非常接近,甚至在一些语言里比人类还准。这说明它们确实学会了“举一反三”。
  • 到底是“语法”重要,还是“数据”重要

    • 数据量(社区大小)
    • 具体表现
      • 英语和西班牙语(使用者多,网上资料多):AI 表现最好,几乎满分。
      • 加泰罗尼亚语和希腊语(使用者相对少,资料少):AI 表现较差,容易出错。
    • 最打脸的地方
      • 语法复杂度排序:希腊语最复杂,英语最简单。如果按这个逻辑,希腊语 AI 应该最差,英语最好。
      • 但实际结果:希腊语(复杂但资料少)的表现竟然比加泰罗尼亚语(相对简单但资料更少)要好,而西班牙语(资料极多)的表现甚至超过了英语(资料最多但题目里有些陷阱)。
    • 结论:AI 并不是因为“聪明”或“理解”了复杂的语法才做对题,纯粹是因为它在互联网上见过太多类似的例子了。就像你背熟了 1000 道数学题,哪怕题目稍微变个数字,你也能猜出答案,但这不代表你真正理解了数学原理。

4. 一个有趣的插曲:为什么英语没拿第一?

按理说英语资料最多,应该拿第一。但这次测试里,英语的得分反而比西班牙语低。

  • 原因:研究人员故意在英语题目里放了一些“陷阱词”(长得像不规则变化的词),这让 AI 和人一样,容易“想多了”或者“过度联想”,导致犯错。
  • 启示:这反而证明了 AI 和人类很像,都会受到具体题目设计的干扰,而不仅仅是机械地计算概率。

5. 总结:AI 到底是怎么“思考”的?

这篇论文告诉我们一个有点“扎心”的真相:

大语言模型并不是像人类那样,通过理解语言的深层结构(语法逻辑)

  • 比喻
    • 人类像是一个语言学家,他理解规则,所以哪怕遇到从未见过的生僻词,也能根据逻辑推导出来。
    • AI 像是一个超级模仿者,它读过海量的书。如果一本书里某个词出现了 10 万次,它就能完美模仿;如果某个词只出现过 10 次,它可能就懵了。

一句话总结
AI 的“语言能力”很大程度上取决于它“吃”了多少数据(社区大小),而不是它是否真正“理解”了语言的复杂规则。数据越丰富,它表现得越像人;数据越匮乏,它就越容易露馅。这也提醒我们,在开发 AI 时,不仅要关注模型本身,更要关注数据的多样性和公平性,否则那些小语种或冷门语言在 AI 的世界里将永远“吃不饱”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →