← 最新论文
💬 NLP

Why are language models less surprised than humans? Testing the Parse Multiplicity Mismatch Hypothesis

本文检验了语言模型在句法歧义中低估人类处理难度的假设,即这种低估源于其能够维持比人类更多的并行句法分析,但研究发现,虽然减少分析路径的多样性确实增强了预测的花园路径效应,却未能完全解释人类阅读时间差异的幅度。

原作者: William Timkey, Brian Dillon, Tal Linzen

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: William Timkey, Brian Dillon, Tal Linzen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在读一个故事,突然遇到一个会欺骗你大脑的句子。这被称为“花园路径”句。

这里有一个例子:"The girl fed the lamb was upset because she asked for beef."(那个被喂的女孩因为想要牛肉而心烦意乱。)

当你第一次读到"The girl fed the lamb"时,你的大脑会自然地假设是那个女孩在喂小羊。这是最常见的理解方式。但当你读到"was"这个词时,你的大脑突然意识到自己错了!这句话的实际意思是那个女孩被喂了(有人喂了她),而她因为牛肉的事感到心烦。那种困惑和重读的时刻需要时间。心理学家将这种现象称为“花园路径效应”。

核心问题
科学家们构建了强大的计算机程序,称为“语言模型”(就像正在生成这段文字的模型),它们非常擅长预测句子中的下一个词。一种名为“惊讶度理论”(Surprisal Theory)的假说认为,一个词越难预测,人类阅读它所需的时间就越长。

问题出在哪里?当科学家在花园路径句子上测试这些计算机时,发现它们表现得过于冷静。它们似乎对这种诡计不够惊讶。它们预测的困惑程度微乎其微,但人类实际上会经历巨大的心理“踉跄”。

假说:“手电筒”理论
这篇论文的作者不禁要问:为什么计算机如此冷静?

他们推测,这可能是因为计算机太聪明了。当计算机读到"The girl fed the lamb"时,它可能同时在脑海中持有数十种不同的解释。它在想:“也许她在喂小羊。也许是小羊在喂她。也许这是另一种小羊。”因为它同时审视所有这些可能性,所以"was"这个词并不会带来冲击感;它只是它早已考虑过的众多选项之一。

相比之下,人类可能就像黑暗房间里的手电筒。我们一次只能照亮一两条路径。我们笃信“女孩在喂食”这个想法。当我们遇到"was"时,我们的手电筒照错了方向,我们必须转身寻找新路径。这种转身需要时间和努力。

作者将这一现象称为“解析多重性不匹配假说”(Parse Multiplicity Mismatch Hypothesis)。简单来说:计算机之所以不那么惊讶,是因为它们同时审视了太多可能性,而人类被迫只选择其中一个。

实验:调暗手电筒
为了验证这一点,研究人员使用了一种特殊的计算机模型,可以精确设定它要查看多少条“路径”。他们让模型以不同的设置通过花园路径句子:

  • 高多重性:计算机同时查看 1,000 种不同的解释(就像一盏超亮、宽泛的手电筒)。
  • 低多重性:计算机被迫只查看 1 或 2 种解释(就像一盏昏暗、狭窄的手电筒)。

结果

  1. 他们部分正确:当他们强迫计算机查看更少的路径(更窄的手电筒)时,它确实变得更加惊讶了。计算机预测中的“踉跄”变大了。
  2. 但他们大部分错了:即使他们强迫计算机只查看一条路径(错误的那条,就像人类一样),计算机的惊讶程度与人类的反应相比仍然微乎其微

计算机的“踉跄”仍然比人类的踉跄小约 40 倍。

结论
该论文得出结论,仅仅让计算机“变笨”或强迫它们查看更少的选项并不能解决问题。计算机与人类处理语言方式之间的差距太大,无法仅用它们一次性能在脑海中持有多少想法来解释。

作者提出,人类大脑可能拥有一个计算机所没有的额外步骤:一个特定的“重新分析”机制。当人类陷入困境时,我们不仅仅是感到一点惊讶;我们会主动推翻旧的理解并重建新的理解。目前的计算机模型,即使受到限制,似乎也没有那个“推翻并重建”的按钮。它们只是继续猜测,而且猜得太容易了。

一言以蔽之
研究人员试图探究计算机对棘手句子的惊讶程度较低,是否是因为它们“思考过多”(持有太多想法)。他们发现,即使强迫计算机“少思考”,与人类相比,计算机仍然过于冷静。这意味着人类与计算机阅读之间的差异,不仅仅在于我们能同时处理多少想法,更在于我们如何处理错误这一更深层的机制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →