Clozing the Gap: Exploring Why Language Model Surprisal Outperforms Cloze Surprisal
本文认为,语言模型惊讶度在预测加工努力方面优于完形惊讶度,因其具有更高的分辨率、区分语义相似词的能力以及对低频词的准确处理,同时呼吁改进完形方法论并进一步研究人类预测敏感性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试猜测句子中的下一个词。有时答案显而易见,有时则完全出乎意料。心理学家长期以来一直使用一种名为“完形填空任务”(Cloze Task)的游戏来衡量词语的可预测性。在这个游戏中,你向受试者展示一个缺失最后一个词的句子(例如,“猫坐在……上”),并请他们填空。如果大多数人都回答“垫子”,那么这个词的可预测性就很高;如果他们给出了许多不同的答案,那么这个词就难以预测。
几十年来,这种人类游戏一直是理解我们大脑如何处理语言的金标准。但最近,一位新的竞争者进入了赛场:语言模型(LMs),就像生成这段解释背后的 AI 一样。这些计算机在数十亿个句子上进行训练,能够计算出下一个词出现的精确数学概率。
重大发现:
该论文发现,在预测人类阅读单词的速度时,计算机的数学计算(语言模型的概率) 比 人类游戏(完形填空任务) 能做出更准确的预测。计算机的预测与我们眼睛在单词上停留的时间完美吻合,而人类游戏则显得笨拙且不够准确。
但作者提出了一个关键问题:计算机之所以胜出,是因为它更聪明,还是仅仅因为它在玩不同的游戏?
为了找出答案,研究人员进行了三项“实验”,试图让计算机按照人类的规则来玩。他们测试了计算机可能胜出的三个原因:
1. “像素分辨率”测试(假设 1)
隐喻: 想象人类游戏是一张低分辨率的像素化照片。你可以看到人脸的大致轮廓,但看不到雀斑。然而,计算机则是一张 4K 超高清照片,每一个微小的细节都清晰可见。
实验: 研究人员迫使计算机仅查看有限数量的样本,就像人类游戏通常只询问 40 到 90 人一样。他们将计算机的高清数学计算“像素化”,以匹配低分辨率的人类数据。
结果: 当计算机的视野被模糊化以匹配人类游戏时,它就不再是更好的预测者了。 这表明,计算机之所以胜出,部分原因是它拥有更高的“分辨率”——它能够区分出人类游戏因样本量不足而忽略的细微差别。
2. “双胞胎兄弟”测试(假设 2)
隐喻: 想象句子是“他坐在……上”,可能的答案是“沙发”和“软椅”。对人类来说,它们是双胞胎;意思相同。如果人类猜了“沙发”,他们很可能也想到了“软椅”。但计算机将它们视为两个完全不同的陌生人,并给出不同的分数。
实验: 研究人员要求计算机将相似的词归为一组。如果“沙发”和“软椅”在同一组,计算机就必须给它们相同的分数。
结果: 当计算机被迫将相似的词视为一个整体团队时,其预测能力下降了。 这意味着,计算机的优势来自于它能够对人类视为相同的词语做出极其精细的区分。
3. “生僻词”测试(假设 3)
隐喻: 想象一个句子,下一个词是“目瞪口呆”。在人类游戏中,没人能猜出这个生僻词,因为他们不常听到它。但计算机阅读了整个互联网,确切知道那个生僻词出现的概率。
实验: 研究人员要求计算机忽略所有生僻词,只猜测常见词,就像人类参与者不会猜测他们从未见过的词一样。
结果: 当计算机被迫忽略生僻词时,它在预测阅读时间方面表现变差。 这表明,计算机更擅长处理人类在游戏中根本无法产生的生僻词“长尾”部分。
结论:呼吁更好的工具
该论文得出结论:计算机并不一定是在像人类一样“思考”;它只是一个更好的测量工具,因为它具有更高的分辨率,能发现细微差别,并能很好地处理生僻词。
然而,作者警告我们不要直接抛弃人类游戏。他们认为,人类游戏之所以“分辨率低”,是因为为每个句子获取数千个答案既昂贵又缓慢。
核心启示:
我们需要升级人类实验。不再仅仅是让人们猜测一次下一个词,我们需要新的方法来测量人类的预测能力,使其像计算机的数学计算一样敏感和详尽。在我们做到这一点之前,我们无法百分之百确定计算机是在预测人类如何思考,还是仅仅因为它是一个极其出色的计算器,却因错误的原因恰好与我们的阅读速度相匹配。
简而言之: 计算机目前是用以测量阅读速度的更好标尺,但它测量的可能是人类实际上并未注意到的东西。我们需要为人类制造一把更好的标尺,看看他们是否真的以与计算机相同的方式看待世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。