← 最新论文
💬 NLP

How communicatively optimal are exact numeral systems? Once more on lexicon size and morphosyntactic complexity

该研究基于对 52 种语言的词形变化可预测性分析,反驳了精确递归数词系统在词汇规模与形态句法复杂度之间实现沟通最优化的观点,指出许多语言的实际效率远低于预期。

原作者: Chundra Cathcart, Arne Rubehn, Katja Bocklage, Luca Ciucci, Kellen Parker van Dam, Alžběta Kučerová, Jekaterina Mažara, Carlo Y. Meloni, David Snee, Johann-Mattis List

发布于 2026-02-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Chundra Cathcart, Arne Rubehn, Katja Bocklage, Luca Ciucci, Kellen Parker van Dam, Alžběta Kučerová, Jekaterina Mažara, Carlo Y. Meloni, David Snee, Johann-Mattis List

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常有趣的问题:世界各地的语言在“数数”这件事上,是否都做到了最聪明、最高效?

简单来说,作者们发现:虽然很多语言确实很“精打细算”,但也有很多语言(特别是印欧语系中的一些语言)在数数时显得有点“笨拙”和“浪费”,并没有达到理论上的最优状态。

为了让你更容易理解,我们可以用几个生活中的比喻来拆解这篇论文的核心内容:

1. 核心矛盾:是“记单词”还是“拼积木”?

想象一下,你要教别人数到 100。你有两种策略:

  • 策略 A(记单词派): 给每一个数字都起一个独特的名字。比如 1 叫“一”,2 叫“二”……99 叫“九十九”。
    • 优点: 说的时候很快,不用动脑子拼凑。
    • 缺点: 你的大脑(词汇表)要记住 99 个完全不同的词,负担很重。
  • 策略 B(拼积木派): 只记几个基础积木(比如 1 到 9,还有 10、20、100)。遇到 25,就用"20"和"5"这两个积木拼起来。
    • 优点: 词汇表很小,只需要记几十个基础块。
    • 缺点: 说话时要多花一点时间“拼”一下,结构稍微复杂点。

以前的研究认为: 全世界的语言都在努力寻找这两个策略之间的完美平衡点(帕累托前沿)。也就是说,语言进化得足够聪明,既不会让你背太多词,也不会让你说话太啰嗦。

2. 这篇论文发现了什么新问题?

作者 Cathcart 和他的团队觉得,以前的研究在测量“复杂度”时,漏掉了一个关键细节:不规则的“怪词”

这就好比我们在比较两辆车的油耗:

  • 以前的研究只看了引擎大小(词汇量)和车身重量(拼积木的层数)。
  • 但作者发现,有些车虽然引擎小、车身轻,但它的轮胎是方形的,或者方向盘是反的(这就是语言中的“不规则变形”)。

举个生动的例子:

  • 德语说"11"是 elf(一个独立的怪词),说"12"是 zwölf(另一个怪词)。
  • 以前的研究可能把 elf 当作一个整体,觉得它只是“一个词”。
  • 这篇论文指出:elf 这个词和"1"(ein)或者"10"(zehn)长得完全不像,它是个死记硬背的例外。学习者必须专门花力气去记这个“怪胎”,这增加了大脑的负担。

作者们重新检查了 52 种语言的数据,把那些“不规则的怪词”(比如英语的 eleven, twelve,或者印地语里那些奇怪的数字)都算作额外的负担。

3. 主要发现:有些语言就是“不听话”

经过重新计算,作者发现世界上的语言分成了两派:

  • 第一派(高效组): 像日本语、法语等。它们非常守规矩,数字要么全是积木拼的,要么规则很透明。它们确实处于“完美平衡点”附近,既省脑子又省嘴皮子。
  • 第二派(低效组): 主要是印欧语系(如英语、德语、波斯语)和印度 - 雅利安语系(如印地语、马尔代夫语等)。
    • 这些语言里充满了“怪词”。比如英语的 11、12,或者印地语里 20 到 99 之间各种奇怪的变体。
    • 结果: 这些语言的词汇表其实很大(因为要记很多怪词),但拼出来的数字结构并没有因此变得更简单。它们既没有省词汇,也没省结构,处于一种“双输”的低效状态。

4. 为什么会有这种“低效”?

这就好比问:“为什么有些车明明可以设计得更省油,却偏偏保留了方形轮胎?”

作者推测了几个原因:

  1. 历史惯性: 这些语言可能已经这样用了上千年。就像我们习惯用某种旧软件,虽然有新版本更好,但大家懒得改。
  2. 听感优势: 也许这些“怪词”虽然难记,但在嘈杂的环境中更容易被听清楚?(比如 eleventwelve 听起来很独特,不容易和别的词混淆)。
  3. 社会因素: 语言不仅仅是为了“效率”进化的,还受到文化、贸易和接触的影响。有时候,为了“独特性”或“传统”,语言会故意保留一些复杂的规则。

5. 总结:语言进化不是只有“最优解”

这篇论文告诉我们一个重要的道理:

语言并不总是像计算机算法那样,追求绝对的“最优解”。

虽然很多语言确实很聪明,但在人类语言的进化史上,“历史遗留问题”和“不规则的怪癖” 同样重要。有些语言之所以看起来“低效”,是因为它们在漫长的历史中,为了其他原因(比如发音习惯、社会认同)保留了那些复杂的规则。

一句话总结:
以前的研究认为所有语言都在努力做“最聪明的数数者”,但这篇论文发现,其实有很多语言是“固执的数数者”——它们带着很多不必要的“怪词”包袱,依然活得好好的,这提醒我们,语言的进化比单纯的数学计算要复杂和有趣得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →