← 最新论文
💬 NLP

Children, but not language models, show accelerating returns in word learning

本文揭示了尽管儿童在词汇学习中表现出加速回报,即随着每一单位语言经验的增加而变得日益高效,但语言模型——即使是接受过针对儿童言语训练的模型——也仅表现出与缩放法则一致的恒定比例回报。

原作者: Michael C. Frank

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael C. Frank

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类语言始于一个缓慢且蹒跚的开端。在出生后的第一年,一个孩子可能只能学会寥寥数个词汇,通常只是熟悉的人或物名称。接着,一些非凡的事情发生了。学习的速度发生了剧烈的转变。在短短几年内,同一个孩子就能习得数百个词汇,从简单的标签转向复杂的句子,其速度之快简直近乎神奇。几十年来,科学家们一直试图理解这种爆发式的机制。他们长期以来一直怀疑,秘密在于儿童如何处理他们每天听到的词汇流。主流观点认为,学习是一个稳定的线性过程:孩子听到的越多,学到的就越多,且速率恒定。如果这是真的,孩子的词汇量增长将如同水滴匀速填满水桶一般。

近年来,被称为语言模型的强大计算机程序成为了研究这一过程的新途径。这些系统通过海量文本进行训练,学习预测句子中的下一个词。由于它们可以在特定的数据量下进行训练,研究人员可以利用它们来测试关于学习机制的理论。然而,一个令人困惑的差距出现了。为了达到哪怕最基础的语言水平,这些计算机模型也需要数万亿词汇的训练数据。相比之下,人类儿童在仅听取几百万词汇后,就能学会最初的数千个词。这种巨大的数据需求差异表明,儿童和机器的学习方式有着本质的不同,但直到现在,还没有人能用清晰的数学描述来解释这种差异究竟是如何随时间演变的。

一位研究人员致力于直接测量这种差异。他专注于词汇量的增长,追踪儿童如何随着时间的推移学习特定词汇,并将该模式与计算机模型学习相同词汇的过程进行对比。研究人员收集了来自数千名儿童的数据,使用了详细的记录,其中父母报告了孩子在不同年龄阶段能说出的词汇。他还利用针对儿童的语音录音训练了计算机模型,以确保计算机接收到的是与幼儿所听到的同类输入。通过对这两组数据进行并排分析,研究人员发现,将学习视为稳步积累的标准观点对于人类来说是不正确的。

研究显示,儿童的学习并非以恒定速率进行。相反,他们的学习能力是在加速的。在开始阶段,一个孩子可能需要在听到一个词数百次后才会说出它。但随着年龄增长和词汇量的扩大,他们学习一个新词所需的暴露次数会大大减少。一个蹒跚学步的孩子可能会在开口说“书”这个词之前听到它数千次,但一个学龄前儿童在动物园里可能只需听到几次“野 goats(ibex)”就会在第二天重复出来。研究人员发现,这种加速是一个真实且可衡量的现象。随着年龄增长,每一份新的语言经验都变得更加珍贵。他们从每一小时对话中获得的收获,比前一小时要多。计算机模型,即使是那些经过针对儿童语音训练的模型,也没有表现出这种加速现象。它们的学习速度是稳定且不变的,无论已经掌握了多少知识,学习一个新词所需的数据量都保持一致。

这种差异解释了为什么儿童能以比机器少得多的数据实现流利表达。计算机模型运作于“收益递减”的原则之上:他们学习的每一个新词,其成本都是相同的训练数据。然而,儿童却能获得“递增收益”。研究人员测试了这种加速仅仅是因为父母随着孩子长大而改变了说话方式,还是因为儿童内部学习能力的改变。数据表明,后者才是原因。儿童的大脑似乎变得越来越擅长从听到的声音中提取意义,这可能是因为他们正在学习利用已知的词汇来推测新词。

这些发现挑战了“语言学习仅仅是随时间积累证据”的观点。相反,这是一个动态的过程。研究人员表明,一个“每个新词的价值随年龄增长而增加”的模型完美契合了儿童的现实世界数据,而一个“价值保持不变”的模型则不符合。这种加速不仅仅是一个微小的细节,它是人类与机器学习之间的一个根本性差异。虽然计算机模型最终学会了这些词汇,但它们是以一种人类儿童所不具备的僵化方式完成的。这项研究表明,人类语言的秘密不仅在于我们接收了多少数据,更在于我们使用这些数据的能力如何随着成长而提升。这一洞察为理解人类认知以及构建未来可能像儿童一样高效学习的人工系统提供了新的方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →