← 最新论文
💬 NLP

Human-Like Anaphor Resolution in Large Language Models

本研究评估了五种开源权重的大型语言模型,以确定它们是否表现出类人的指代消解模式,研究发现虽然某些模型在对话结构和距离方面的敏感性与人类相似,但它们缺乏与之相当的对语义干扰效应的敏感性。

原作者: Keane Zhang, Varshini Chinta, Raj Sanjay Shah, Sashank Varma

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Keane Zhang, Varshini Chinta, Raj Sanjay Shah, Sashank Varma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在读一本推理小说。作者在第一章介绍了一个名叫“面包师”的角色。十页之后,故事再次提到了“他”。你的大脑并不仅仅是在猜测这个“他”是谁;它会瞬间回溯到记忆中,抓取面包师的形象,并将两者连接起来。这种脑内的魔术被称为指代消解(anaphor resolution)。这就是我们如何在故事展开的过程中,持续追踪所谈论的对象或事物的机制。

科学家们长期以来一直在研究人类是如何做到这一点的。他们知道,如果面包师是故事的核心焦点(话题性),你就能更快地找到他。如果“他”紧跟在面包师之后出现,这很容易。但如果“他”出现在一段漫长且混乱的间隔之后,或者附近有另一个面包师让你感到困惑,你的大脑就会陷入停顿。现在,轮到**大语言模型(LLMs)**登场了。这些是经过海量文本训练的超级智能计算机程序,它们可以写故事、回答问题,并像人类一样聊天。但这里有一个大问题:这些 AI 大脑在解决这些谜题时,是真的像人类大脑一样在“思考”,还是仅仅基于模式进行极其高明的“猜测”?本论文深入探讨了这个谜团,旨在观察 AI 与人类是否处于相同的精神波长之上。


伟大的 AI 记忆测试

研究人员决定让五种不同的 AI 模型——GPT-2-XL、Llama-3.1-8B、Pythia-12B、Mistral-7B 和 Mistral-24B——通过一系列专门为人类设计的记忆游戏。他们想看看 AI 是否会像人类读者一样感到疲劳、困惑或减速。

为了衡量这一点,他们使用了两个聪明的技巧。首先,他们观察了惊异度(surprisal)。你可以把它理解为 AI 的“脑汗”。当计算机读到一个它没预料到的词时,它的“惊异度”就会上升。在人类身上,高惊异度通常意味着我们会停顿更久来进行思考。因此,如果 AI 在人类感到卡壳的时刻也变得“出汗”(高惊异度),那么这便是一个好迹象,说明它们的处理方式与人类相似。其次,他们向 AI 提出了理解类问题,例如“谁踢了椅子?”,以观察它们是否真的记住了正确的人。

记忆游戏

团队运行了三个不同的实验,每个实验都测试了人类记忆的一个特定规则:

1. “焦点”与“距离”测试
想象一个聚光灯。如果一个角色处于聚光灯下(故事标题提到了他们),人类能轻易找到他们。如果他们在黑暗中,则会变得困难。此外,如果角色距离仅一句话之遥,很容易;如果距离十句话之遥,则会变难。

  • 结果: 大多数 AI 模型在这里的表现与人类一致!当角色被标题强调且距离较近时,AI 的“脑汗”较低,且回答正确。当角色被隐藏且距离较远时,AI 会感到困惑。就好像 AI 的注意力跨度也会像我们一样伸缩。

2. “空间与时间”测试
这更加复杂。想象故事发生在一座巨大的城堡里。如果角色从厨房移动到隔壁房间(短距离),或者从厨房移动到塔楼(长距离),这会有影响吗?如果他们等待了 10 分钟还是 2 小时呢?当空间或时间的间隔巨大时,人类会变慢并犯更多错误。

  • 结果: 结果褒贬不一。一些模型,如 Llama-3.1-8B 和 Mistral-7B,似乎感受到了距离和时间的重量,在间隔较长时变得更加“出汗”。而其他模型似乎并不怎么在意时间或空间的间隔。这表明,虽然一些 AI 开始理解故事时间线的“感觉”,但另一些 AI 则似乎直接跳过了它。

3. “干扰线索”测试
这是最难的部分。想象故事提到了一个“金属椅子”。稍后,它提到了“金属家具”。这很简单。但如果故事在之前还提到了一个“木制书桌”(另一种类型的家具)呢?人类会感到困惑,因为“家具”既可以指那把椅子,也可以指那张书桌。如果错误的项是该类别的一个非常典型的例子(比如书桌属于家具),会减慢我们的反应速度。

  • 结果: 这是 AI 表现得最不像人类的地方。当研究人员加入一个具有干扰性的“干扰项”时,AI 模型并没有像人类那样变得迟钝或困惑。它们似乎轻快地绕过了这种困惑。这表明,虽然 AI 可以追踪事物在故事中的“位置”,但它们并不完全理解在我们试图挑选正确记忆时,大脑中发生的那些混乱且重叠的竞争过程。

结论:部分匹配

那么,最终得分如何?论文指出,这些 AI 模型是选择性地具有类人特征的。它们擅长理解故事的结构(例如单词距离或标题内容)如何影响记忆。如果你让故事变长或隐藏角色,AI 会变得有些“出汗”,就像一个疲惫的读者一样。

然而,它们并不是人类思维的完美克隆。当涉及到混乱的语义处理(即类似的词汇在记忆中争夺注意力)时,AI 并不会像人类那样踉跄。它们似乎缺乏那种在必须在两个非常相似的记忆之间做出选择时,大脑产生的特定“心理摩擦力”。

作者谨慎地指出,这并非一个“已解决”的问题。这项研究使用的故事数量相对较少(16 到 19 个),因此其结果更像是强有力的暗示,而非绝对的证明。此外,AI 在问题上的整体准确率有时相当低,这意味着它们可能是在为错误的原因而做出正确的猜测。但其核心启示是令人兴奋的:这些数字大脑开始展现出与人类大脑相同的难度模式,至少在涉及故事的距离和焦点时是如此。它们不仅仅是单词匹配机器;它们正开始显现出构建“情境模型”(situation model)的初步迹象——即像我们一样,拥有一个关于故事世界的心理地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →