Surprisal from Larger Transformer-based Language Models Predicts fMRI Data More Poorly
这项研究表明,这种反向缩放关系(即规模更大的基于 Transformer 的语言模型对人类句子处理难度的预测准确度反而更低)不仅适用于阅读时间,也同样适用于 fMRI 数据。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图理解人类大脑是如何处理语言的。多年来,科学家们一直使用一个叫做“惊奇度”(surprisal)的概念来推测一个词对人的理解难度。把“惊奇度”想象成一个“震惊计”。如果你正在读一个关于安静图书馆的故事,突然看到“短吻鳄”这个词,你的大脑会感到巨大的冲击(高惊奇度),因为这完全出乎意料。如果你看到“书”这个词,则不会有冲击感(低惊奇度),因为它在预料之中。
长期以来,研究人员一直认为,一个计算机语言模型(比如超先进的AI)越大、越聪明,它的“震惊计”在预测人类阅读句子的时长或大脑反应方面就会表现得越好。
大惊喜
这篇论文颠覆了这个观点。研究人员发现,更大、更强大的AI模型,在预测人类大脑对语言的反应方面,实际上表现得更差。
以下是他们如何发现这一点的过程,通过一些简单的类比来解释:
“专家”与“人类”
想象你有两位天气预报员,试图预测是否会下雨。
- 预报员 A 是一个小型、简单的模型。它见过一些降雨情况,预测得还算合理。
- 预报员 B 是一个庞大的、超级计算机模型,它学习了历史上所有的天气报告。它极其聪明,能够近乎完美地预测实际的天气模式。
研究人员发现,当涉及到预测人类行为(例如一个人对某个词感到多么惊讶)时,预报员 B 实际上不如预报员 A 准确。
为什么呢?因为超级智能的 AI 已经学会了如此完美地预测那些“罕见”的词,以至于它不再会对这些词感到惊讶。但人类对罕见词仍然会感到惊讶。AI 变得在工作中过于“完美”,从而脱离了普通人类大脑的运作方式。这就像一位国际象棋特级大师,可以完美预测比赛中的每一步,却无法预测一个初学者下一步会做什么,因为初学者会做出特级大师不会犯的“错误”。
实验:两种不同的脑部反应
为了证明这不仅仅是一个偶然现象,研究人员在脑部扫描(fMRI 数据)上测试了这个理论,而不仅仅是阅读时间。他们想看看“越大越差”的规则是否也适用于大脑实际的物理活动。
他们使用了 17 个不同规模的 AI 模型(从小型到巨型),并针对两组在听故事或阅读句子时接受脑部扫描的人群进行了测试。
- “自然故事”测试: 人们在接受脑部扫描的同时聆听自然故事。
- “Pereira”测试: 人们在接受脑部扫描的同时阅读短文。
结果:
在两项测试中,都出现了相同的模式。随着 AI 模型变得越来越大、越来越聪明,它们匹配人类大脑反应的能力反而变差了。最大的模型在预测人类大脑会做出什么反应方面表现最差。
这为什么重要(根据论文观点)
论文得出结论,这种“反向缩放”(即模型越大 = 对人类的预测越差)现象不仅仅是人们阅读速度的一个特性。它也发生在脑部的实际电活动中。
作者认为,由于这些庞大的模型是在如此海量的数据上训练的,它们变得太擅长预测罕见词汇,导致它们的“惊奇度”水平相对于真实人类来说过低。
核心启示:
如果你想了解人类大脑是如何处理语言的,你可能并不需要最大、最昂贵的 AI。事实上,一个稍小一点、没那么“完美”的模型,可能反而能更好地映射我们大脑的工作方式。
注:该论文将其研究结果严格限制在这些特定的语言模型和脑部数据集内。它并不声称这适用于其他语言、临床诊断或其他未来的 AI 应用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。