← 最新论文
💬 NLP

Beyond Sally-Anne: Evaluating Theory of Mind in LLMs using Epistemic Schelling Points

本文介绍了认识不对称谢林任务(Epistemic Asymmetry Schelling Task, EAST),这是一种基于对话的新型基准测试,它揭示了大语言模型在功能性心智理论和认识追踪能力方面存在的显著差距,证明了即使是前沿模型,在面对动态社会协调任务时也表现得十分吃力,尽管它们在传统的静态测试中表现优异。

原作者: Roberta Rocca, Sami Boukortt, Geoff Keeling, Winnie Street

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Roberta Rocca, Sami Boukortt, Geoff Keeling, Winnie Street

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正和一位朋友通过短信玩一场高风险的“秘密单词”游戏。你们不能互相交谈,但你们必须从四个单词中选出完全相同的那个词才能获胜。其中的转折在于,你们两人都有各自秘密的“身份”(比如裁缝或外科医生),而你需要根据对方对你的了解,来猜测对方会选择哪个词。

这就是谷歌研究人员的一项新研究的设定,他们想看看大型语言模型(LLM)——即聊天机器人背后的超级智能AI大脑——是否真的能够“思考”他人正在思考什么。这种能力被称为心理理论(Theory of Mind)

旧方法:“萨莉-安妮”陷阱

长期以来,科学家们一直使用一个经典的谜题——“萨莉-安妮任务”来测试AI的心理理论。这就像是一个故事书测验:“萨莉把一个球放进盒子里然后离开了。安妮把球移到了篮子里。萨莉会去哪里找?”

研究人员认为,这种旧的方法有点像玩家已经背熟了关卡套路的电子游戏大Boss。因为AI模型是在海量的互联网文本上训练出来的,它们很可能已经见过这个谜题成千上万次了。它们可能只是根据故事的模式在进行猜测,而不是因为它们真正理解萨莉的视角与安妮不同。这就像是一只鹦鹉在重复它在电影里听到的短语;它听起来很聪明,但它并不理解这些词的含义。

新游戏:EAST(“读心术”协调游戏)

为了解决这个问题,团队发明了一个名为 EAST(认识论不对称谢林任务)的新游戏。它不再是一个故事书,而是一个实时的协调挑战。

它是这样运作的:

  1. 设定: 两名AI智能体被配对在一起。每人获得一个秘密职业(如“定制裁缝”或“普通外科医生”)。
  2. 列表: 他们会看到四个单词。其中两个单词与各自的职业相关(例如,裁缝对应“织物”,外科医生对应“手术刀”);一个单词是两者的结合(例如,“缝合线”);还有一个是随机单词(例如,“自行车”)。
  3. 目标: 他们必须在不交谈的情况下选择同一个单词。
  4. 转折: 游戏的“谁知道什么”的规则会发生变化。
    • 对称模式: 双方都知道对方的职业。
    • 不对称模式: 其中一人知道另一人的职业,但另一人不知道第一个人的职业。
    • 零知识模式: 双方都不知道对方的职业。

为了获胜,AI必须完成一项极其困难的任务:它必须抑制自己最喜欢的那个词,并去猜测对方在想什么,同时还要考虑到对方所知道(或不知道)的信息。

游戏揭示了什么

当研究人员使用14个不同的AI模型(从微小的10亿参数模型到庞大的最先进“前沿”模型)进行这项游戏时,结果给人们带来了一次现实的警示。

1. 只有“大”模型才真正掌握了精髓
只有那些最庞大、最先进的模型(如前沿级的Gemini 3.1 Pro)才能持续稳定地获胜。它们能够成功应对复杂的“不对称”和“零知识”轮次。而那些较小的、性能较弱的模型呢?它们大多失败了。它们把这个游戏当作一个简单的词汇联想测试,只顾着选自己的职业相关词并碰运气。

2. “读心术”故障
研究人员观察了AI的“大脑”(推理步骤)内部,以寻找失败的原因。他们发现了一种特定的错误类型:认识论追踪错误(Epistemic Tracking Errors)

想象一下,你正在猜你的朋友午饭会吃什么。你知道他喜欢披萨。但你也知道,他并不知道你喜欢披萨。如果你因为自己喜欢披萨而选择了“披萨”,你就犯了一个错误。你忘记了你的朋友并不知道你的口味。

AI模型也确实如此。它们经常将自己的私有知识与对方所知道的知识混淆。

  • 不对称轮次中,那个“知道”对方职业的AI未能意识到对方对其自身职业是“盲目”的。它基于自己的秘密身份选择了单词,认为对方也会猜到它。
  • 零知识轮次中,模型无法处理这种“真空状态”。它们无法想象一个双方都毫无线索的世界,于是它们直接抓取了自己最喜欢的单词。

3. “大声思考”的技巧
研究人员尝试通过要求AI“逐步思考”(一种称为思维链的方法)来帮助它们。对于最聪明的模型来说,这有助于它们停止随机猜测并开始使用真正的逻辑。但对于较弱的模型来说,仅仅要求它们思考并不能解决问题;它们仍然会在“谁知道什么”的问题上感到困惑。

核心结论

论文表明,虽然AI模型在回答测试题方面变得非常出色,但它们在稳健的社会推理方面仍然面临困难。它们可以模仿社交互动的“措辞”,但往往无法真正追踪他人的心理状态,尤其是当“谁知道什么”的规则变得复杂时。

作者并不是说AI“坏掉了”或者它永远无法理解人类。他们是说,目前,在保持“我所知道的”与“你所知道的”之间清晰的心理边界方面,仍然是一个主要的瓶颈。直到AI能够可靠地停止将其自身的秘密投射到他人身上,否则它可能还没准备好进入人类那种混乱且不可预测的真实对话世界。

简而言之:AI足够聪明可以玩这个游戏,但它仍在学习如何不再认为整个世界都装在它自己的脑袋里。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →