← 最新论文
💻 computer science

Do we carry the false belief that LLMs have a theory of mind?

尽管大型语言模型在心理理论评估中经常获得高分,但本研究表明,它们依赖的是成本效益高的启发式策略而非真正的心理状态追踪,这表明它们缺乏稳健的心理理论能力。

原作者: Nicholas Griffen

发布于 2026-09-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicholas Griffen

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类拥有一种独特的认知超能力,让我们能够在这个社交世界中航行:这种能力让我们理解到,他人拥有属于他们自己的思想,其中充满了可能与我们不同的想法、信念和欲望。心理学家将这种能力称为“心智理论”(theory of mind)。它是这样一种心理机制:它让我们意识到,即使我们知道某个物体已经被移动到了不同的位置,一位朋友可能仍会在上次看到该物体的地点寻找它。这项技能不仅仅关乎聪明,它更是同理心、沟通和协作的基础。几十年来,研究人员一直使用一个简单的故事——通常涉及两个名叫萨莉(Sally)和安妮(Anne)的角色——来测试儿童是否已经发展出了这种能力。在故事中,萨莉把一个玩具藏在一个篮子里,然后离开了房间。在她离开期间,安妮把玩具移到了一个盒子里。当萨莉回来时,问题很简单:她会在哪里寻找她的玩具?一个具备发育成熟的心智理论的孩子知道萨莉会在篮子里寻找,因为那是她认为玩具所在的地方,尽管现实中玩具已经在盒子里面了。

最近,一种新型的智能出现在我们的日常生活中:大型语言模型。这些是经过海量文本训练的计算机程序,它们能够以模仿人类对话的流利度进行写作、聊天和解决问题。由于这些模型可以讨论复杂的话题并表现出对语境的理解,许多研究人员和观察者开始怀疑,它们是否也拥有心智理论。如果一台机器能够正确预测一个虚构角色的信念,那么它是真的理解了“信念”这一概念,还是仅仅根据它之前见过的模式进行猜测?随着这些工具越来越多地融入我们的社交和职业生活,这个问题变得紧迫起来,我们需要确定它们是真正的社交伙伴,还是仅仅是非常复杂的模仿者。

最近的一项研究试图通过使用经典的萨莉-安妮情景及其若干变体,对五种最先进的语言模型进行测试,以此来回答这个问题。由巴黎大学(Université Paris Cité)的尼古拉斯·格里芬(Nicholas Griffen)领导的研究小组并没有简单地向模型提出标准问题。相反,他们设计了一系列挑战,旨在观察模型是否能够处理那些需要真正推理而非仅仅依靠记忆的微妙细节。他们测试了来自主要公司的模型,包括 GPT-5.5 Luna、Claude Sonnet 5、Gemini 3.1 Pro、Grok 4.5 和 Mistral Medium 3.5。为了确保结果公平,研究人员为每次测试都创建了全新的、独特的版本的故事,通过改变名字、物体和具体细节,使得模型无法简单地从其训练数据中回忆出答案。他们还引入了棘手的转折,例如让容器变成透明的,以便角色可以看到玩具,或者改变描述物体放置位置的词汇,以观察模型能否根据新的视觉或语言信息调整其推理。

结果描绘出了一个在某些领域能力极强但在另一些领域存在根本性局限的系统。当模型面对标准版本的故事时,它们的表现非常出色,大多数几乎每次都能答对。事实上,在所有不同类型的问题中取平均值后,模型的得分远高于随机猜测的水平。表现最好的 Gemini 3.1 Pro 在整体测试中的正确率达到了 84%。这种成功表明,这些模型已经从它们阅读的海量文本中学习到了“错误信念”任务的一般模式。它们可以识别故事的结构,并提供人类在教科书式场景中会给出的答案。

然而,研究表明这种成功是脆弱的。当研究人员引入需要模型运用常识或整合视觉信息的变体时,其表现大幅下降。在一个变体中,故事描述容器是透明的,这意味着回到房间的角色实际上可以看到玩具在新的位置。在现实世界的情境中,一个人会理解因为角色能看到玩具,所以他不再持有错误的信念;他知道真相。然而,这些模型在很大程度上失败了。只有一款模型,即 Gemini 3.1 Pro,能在这些问题中获得超过一半的正确率。其他模型仍然坚持认为角色会在旧的、空的位置寻找,忽略了角色能看到玩具这一事实。

当研究人员改变用于描述玩具位置的介词时,难度变得更加显著。在标准故事中,玩具被放在盒子“里”(in)。在测试中,研究人员描述玩具被放在盒子“上”(on)或水桶“下”(underneath)。当故事暗示由于物体是放在容器上方而非隐藏在内部而导致其具有可见性时,每一款模型都完全失败了,得分率为零。它们无法推断出物体的可见性改变了角色的心智状态。同样,当故事涉及角色被明确告知玩具被移动到了哪里,或者当问题询问一个角色认为另一个角色会做什么时,模型们也陷入了困境。它们往往会退回到简单的、僵化的模式,而不是随着故事的发展动态地追踪每个角色的心理状态。

研究人员还观察了模型如何处理角色的性别。他们发现,当故事中的两个角色性别相同时,模型的表现略好;当他们性别不同时,表现略差。这表明模型可能正在利用性别作为一种捷径来追踪谁是谁,而不是真正理解每个人的角色和行为。当通过使用两个性别相同的角色来移除这种捷径时,模型似乎更多地依赖于事件的顺序,这反而帮助它们更频繁地答对。这表明它们的推理并不像人类推理那样稳健,人类的推理并不依赖于此类表层线索来理解情境。

这项研究的核心发现是,虽然这些语言模型可以模仿心智理论测试中的正确答案,但它们似乎并不具备像人类那样理解心理状态的底层能力。它们难以将“角色能看到什么”、“角色知道什么”以及“角色相信什么”这几点联系起来。这些模型似乎是在使用“启发式算法”(heuristics),即心理捷径,根据它们训练数据中最常见的模式来猜测答案。当故事偏离了标准模式,加入了视觉细节或改变了空间关系时,这些捷径就失效了。研究人员认为,这是因为这些模型仅接受文本训练。它们从未见过玩具被移动,从未体验过寻找东西的感觉,也从未需要依靠自己的眼睛来更新对世界的认知。由于缺乏这种具身经验(embodied experience),它们无法真正领悟什么是与现实不符的信念。

最终,这项研究是对“仅仅因为一台机器能像人类一样说话,就假设它像人类一样思考”这一观念的警示。这些模型可以产生看起来像是拥有心智理论的答案,但当接受需要对感知和信念有真正理解的情景测试时,它们便暴露了自己的局限性。它们擅长重复所读到的内容,但尚未具备人类那种能够驾驭复杂社交世界的灵活且具备常识的推理能力。随着这些工具变得越来越普遍,重要的是要记住,它们表现出的智能是其所摄取数据的反映,而不是它们已经发展出了属于自己的心智。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →