← 最新论文
💬 NLP

Vectors from Larger Language Models Predict Human Reading Time and fMRI Data More Poorly when Dimensionality Expansion is Controlled

这项研究表明,在利用未经训练的大型语言模型控制维度扩张的情况下,经过训练的语言模型向量对人类阅读时间和 fMRI 数据的预测能力呈现出反向缩放特性,且其增加的价值在仅为几十亿参数时便已趋于零。

原作者: Yi-Chien Lin, Hongao Zhu, William Schuler

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Yi-Chien Lin, Hongao Zhu, William Schuler

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

几十年来,科学家们一直观察着计算机学习阅读和写作的速度,这种速度让人感觉几乎具有生物性。这些被称为大语言模型的机器,通过在海量的人类文本库上进行训练,直到它们能够以惊人的准确度预测句子中的下一个词。由于它们处理语言的能力如此出色,研究人员开始怀疑,这些机器不仅仅是在模仿我们,实际上是在镜像我们大脑处理语言的方式。主流的希望在于,随着这些模型变得越来越大、越来越复杂,它们会越来越擅长预测人类阅读一个单词所需的时间,或者当我们听到一个故事时大脑是如何活跃的。这一观点暗示,这些数字大脑的架构可能是人类思维架构的一张地图,这意味着任何无法匹配人类数据的现象,仅仅是需要更多计算能力的问题。

然而,一项来自俄亥俄州立大学和加州大学圣迭戈分校研究人员的新研究,挑战了这一乐观观点。他们发现,当他们仔细控制了这些模型产生的纯粹数据规模时,模型规模与类人性能之间的关系发生了特定的变化:额外的训练收益消失了。训练过程并没有让更大的模型比同等规模的未训练版本表现得显著更好;相反,最大的模型表现并不比同等规模的未训练版本更好。该研究表明,这些庞大系统的所谓成功,很大程度上是一种由其能够获取的信息量巨大而产生的错觉,而非真正的语言理解。当研究人员剥离了这种优势后,使这些模型如此强大的训练过程,相对于完全未经过训练的同类机器而言,似乎并没有提供额外的益处。

要理解他们是如何得出这一结论的,首先必须了解这些模型通常是如何被测试的。研究人员经常将一个故事输入到语言模型中,并将模型的内部状态与人类数据进行比较,例如一个人在特定单词上的停顿时间,或者大脑对一个句子的反应。在之前的研究中,看起来规模更大的模型(拥有更多的内部变量可供使用)能更一致地预测人类行为。这引出了一个被称为“质量-力量”假设的理论:模型越大,它就越像人类的心智。但研究人员怀疑这套逻辑中隐藏着一个缺陷。当一个模型变大时,它不仅变得更聪明,而且还会产生更多的内部信号或向量来进行分析。这就像给一名学生一份题目数量增加了一倍的试卷;即使学生什么都不懂,拥有更多的题目也会让他们有更多的机会通过运气猜对答案。研究人员意识到,之前的研究可能是在测量拥有更多问题的收益,而不是拥有更好大脑的收益。

为了解决这个谜题,团队设计了一系列实验,将规模的影响与智能的影响分离开来。他们收集了来自五个不同语言模型家族的数据,范围从只有几亿参数的小型模型到拥有660亿参数的巨型模型。他们将这些模型与真实的人类数据进行对比,包括人们阅读自然故事时的阅读时间,以及人们听这些故事时的脑电扫描数据。在第一个实验中,他们复制了早期的发现:随着模型的增大,它们对人类行为的预测确实似乎有所提高。这证实了“质量-力量”效应在表面上是可见的。

但随后,他们引入了一个至关重要的控制变量。他们采用了相同的模型,并观察它们在没有任何文本训练之前的情况。这些未训练的模型具有与已训练模型完全相同的规模和结构,但它们本质上是随机噪声,没有任何语言知识。通过将已训练的模型与其未训练的双胞胎进行比较,研究人员可以观察到有多少改进来自于实际的学习,有多少仅仅来自于拥有更大数量的内部信号。他们使用了一种类似于“储库”(reservoir)的方法,即一个巨大的、未经过训练的网络作为一个可以被简单分类器塑造的原始材料来源。如果训练确实使模型变得更像人类,那么训练后的版本应该比未训练的版本表现得显著更好,尤其是在模型规模增长时。

结果令人惊讶。当研究人员控制了内部信号的规模时,训练带来的额外优势消失了。事实上,对于参数量超过数十亿的模型,训练后的版本表现并不比未训练的版本更好。在多个数据集上,训练带来的额外收益降至零。这意味着,早期研究中看到的巨大进步并不是因为更大的模型学习到了更深层的语言理解,而仅仅是因为它们拥有更多的内部维度来拟合数据。研究人员发现,随着模型规模超过某个临界点,训练对模型拟合能力的贡献并没有增加,而是降到了零。模型规模越大,训练过程相对于模型规模本身所提供的预测能力而言,所增加的贡献就越少。

研究还查看了模型中的不同层,检查一些先前研究认为更为重要的中间部分是否表现不同。他们发现了同样的模式:随着模型的增长,训练的贡献在所有层级中都降至零。即使他们调整了统计方法,以排除模型可能仅仅是在达到预测人类数据的极限这一可能性,这一趋势依然成立。研究人员得出结论,这些大型模型之所以在预测人类行为方面取得成功,主要是由于一种统计效应,即拥有更多的变量允许更好的拟合,而非真正反映了人类的认知。

这一发现表明,这些人工系统构建的方式与人类大脑的工作方式之间存在显著的不匹配。使这些模型擅长生成文本的训练过程,并不一定会使它们成为更好的人类阅读或大脑活动的模型。事实上,该研究认为,这些庞大网络的未训练版本(作为复杂随机连接的储库)在预测人类数据方面,可能与那些昂贵的、经过充分训练的版本一样有效。研究人员建议,未来的研究应将这些未训练的模型作为标准基准,以确保归功于训练的任何改进都是真实的,而不仅仅是模型规模的副产品。虽然“越大越好”的想法多年来一直推动着该领域的发展,但这项工作表明,在人类语言处理领域,存在这样一个点:即增加规模和训练并不会让我们更接近理解人类的心智,反而会让我们离它更远。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →