想象一下,你正在尝试教机器人如何理解人类的思维。你想知道这个机器人能否推断出另一个人在想什么,即使那个人的想法是错误的。这种能力被称为心理理论(Theory of Mind, ToM)。
长期以来,科学家们使用一个经典的儿童故事“萨莉 - 安妮”(Sally-Anne)来测试机器人(大型语言模型或 LLM)。在这个故事中,萨莉把玩具藏起来,离开房间,然后安妮把玩具移走了。当萨莉回来时,她会去哪里找?人类知道萨莉会去原来的地方找,因为她不知道玩具被移动了。但是,如果你对这个故事做一点点微小的改动,这些机器人往往会感到困惑,这表明它们可能只是在死记硬背故事,而不是真正理解角色的内心。
为了解决这个问题,本文的作者们构建了一个名为StorySim的新工具。你可以把 StorySim 想象成一套可编程的乐高积木,专门用于构建故事。
乐高积木(StorySim)
研究人员没有亲手编写故事,也没有要求另一个 AI 来编写(因为这可能会意外地复制机器人已经见过的内容),而是使用了一种“故事板”。
- 故事板: 这是一份严格的蓝图。它规定:“角色 A 在第 1 分钟进入 1 号房间。角色 B 在第 2 分钟进入 2 号房间。”它精确控制着谁在何时看到了什么。
- 构建者: 系统会自动填充故事的其余部分,确保规则永远不会被破坏。因为这些故事是利用这些蓝图从头构建的,所以机器人以前从未见过它们。这就像每次玩游戏时,都在搭建一个全新的谜题。
测试:思维 vs. 地图
研究人员利用这套乐高积木,对不同的 AI 模型运行了三种不同类型的测试:
- “思维”测试(心理理论): 他们问道:“鲍勃认为安妮在哪里?”要回答这个问题,机器人必须忽略事实真相,转而追踪鲍勃看到了什么以及他相信什么。
- “地图”测试(世界建模): 他们问道:“安妮实际上去了哪里?”这只需要机器人记住故事的既定事实,就像在地图上追踪一个移动物体一样。
- “物体”测试: 他们问了同样的“地图”问题,但故事的主角不是人,而是无生命的物体(比如一个被移动的球)。这用来检查机器人是否对人物的处理方式与对物体不同。
他们的发现
结果有些令人惊讶,就像发现一个数学考试得满分的学生却在逻辑谜题上表现挣扎一样:
- 机器人在“地图”上比在“思维”上更擅长: 大多数 AI 模型在追踪事物实际去向(世界建模)方面,远胜于猜测角色认为发生了什么(心理理论)。它们能跟上情节的发展,但在设身处地进入角色内心方面却显得吃力。
- 人物 vs. 物体: 机器人在追踪人物的移动方面略胜于追踪物体。似乎这些模型被“诱导”去更多地关注人类角色,这可能是由于它们在训练时接触了大量人类对话。
- “近期”陷阱: 研究人员担心机器人是通过猜测最后一次看到某人的地方来作弊的。他们通过让故事中的“谎言”发生在很久以前来测试这一点。令人惊讶的是,机器人似乎并没有像预期的那样轻易落入这种“猜测最新事件”的简单陷阱。
- “初次见面”的习惯: 当机器人确实答错“思维”测试时,它们往往犯一个特定的错误:它们会猜角色第一次见面的地点,而不是他们最后一次见到彼此的地点。这就像一个学生记得开学第一天的情况,却忘记了昨天发生了什么。
大局观
这篇论文得出结论,尽管现代 AI 在推理方面变得越来越聪明,但它仍然难以真正理解他人的“心理状态”。它可以完美地跟随故事中的事件,但当被要求想象角色在想什么(尤其是当这种想法是错误的)时,它往往会失败。
作者们构建 StorySim 并不是为了给机器人打最终成绩,而是为了提供一个公平、新鲜的测试,使它们无法通过死记硬背旧答案来作弊。他们希望这个工具能帮助未来的研究人员构建出能够真正理解人类视角的 AI,而不仅仅是复述事实。
以下是 Getachew 和 Saparov 所著论文《语言模型可能无法理解你:通过故事提示评估心理理论》的详细技术总结。
1. 问题陈述
大型语言模型(LLM)在推理任务(数学、编程、逻辑)中已展现出显著进步,但其**心理理论(Theory of Mind, ToM)**能力——即推断他人心理状态、信念和视角的能力——仍不确定。
- 数据污染: 现有的 ToM 基准测试(如萨利 - 安妮测试、TOMI)很可能存在于现代 LLM 的预训练数据中。因此,模型可能是在“记忆”答案而非真正进行推理,导致性能指标虚高。
- 缺乏控制: 先前的合成基准测试通常依赖 LLM 自行生成故事,这引入了不一致性,使得难以隔离特定变量(例如角色视角与事件时序)。
- 差距: 亟需一个稳健且无污染的框架,以评估 LLM 是否真能建模心理状态,还是仅仅依赖启发式方法(如近因偏差)和记忆。
2. 方法论:StorySim 框架
作者引入了StorySim,这是一个可编程的合成框架,旨在生成新颖故事以评估 ToM 和**世界建模(World Modeling, WM)**能力。
核心组件
- 故事板(STORYBOARD): 一种高层符号规范,定义为 D=(C,ϕ,G,E,n),其中:
- C:角色集合。
- G:表示位置和连通性的有向图。
- E:一组确定性、带时间戳的关键事件(例如“角色 A 在 t=5 时移动到房间 2")。
- n:事件总数。
- ϕ:动作类型(例如
enter(进入)、move(移动))。
- 生成过程:
- 符号生成: StorySim 生成严格遵循故事板约束的事件序列。它在确保逻辑一致性(例如角色只能移动到相邻位置)的同时,随机填充非确定性细节。
- 翻译: 使用模板将事件转换为自然语言。
- 改写(可选): 故事可进一步由 LLM(GPT-4o-mini)进行改写,以增加语言的自然度,尽管核心逻辑仍锚定在符号故事板上。
- 新颖性: 由于故事是算法生成的,具有特定约束和随机变化,任何生成故事出现在预训练数据中的概率“微乎其微”。
实验设计
作者设计了三种特定的提示类型以隔离不同的认知能力:
- ToM 提示: 询问角色关于另一人位置的信念(例如“鲍勃认为爱丽丝在哪里?”)。这测试了建模与事实不同的视角的能力。
- WM-人类提示: 询问基于观察到的事件的角色客观位置(例如“当鲍勃在房间里时,爱丽丝去了哪里?”)。这测试了无需换位思考的世界建模能力。
- WM-无生命提示: 与 WM-人类提示类似,但使用由外部力量移动的无生命物体。这测试了模型的推理是否对代理的“有生命”性质敏感。
操纵的关键变量:
- 误导距离: 角色(S1)最后一次看到另一角色(T)移动与 T 最终位置之间的时间步数。这测试了近因偏差(预测最近的位置而非最后一次观察到的位置)。
- ToM 阶数: 一阶(A 认为 B 在 X)与二阶(A 认为 B 认为 C 在 X)。
- 角色数量: 改变角色数量以测试超越简单、熟悉故事结构的泛化能力。
3. 主要贡献
- StorySim 框架: 一个完全可控的合成基准,消除了数据污染风险,并允许精确操纵叙事变量(视角、时序、图结构)。
- 解耦 ToM 与 WM: 该研究提供了一种独立于一般世界建模来评估 ToM 的方法,揭示模型通常在追踪物理事件(WM)方面表现出色,但在追踪心理状态(ToM)方面失败。
- 启发式识别: 该框架成功识别了特定的失败模式,例如**“首次共同位置启发式”(预测角色首次相遇的地点而非当前位置)和近因偏差**。
- 综合基准测试: 论文在零样本和少样本设置下评估了广泛的模型系列(GPT-4、GPT-5.4、Llama 3.1/3.2/3.3、R1、Qwen)。
4. 主要结果
- ToM 与 WM 的差异: 大多数模型在**世界建模(WM)任务上的准确率高于心理理论(ToM)**任务。这表明 LLM 在追踪物理状态方面优于模拟他人的主观视角。
- “人类”效应: 模型在涉及人类主体的 WM 任务中表现显著优于涉及无生命物体的任务,表明“代理”的存在触发了不同(且更准确)的推理路径。
- 模型规模相关性:
- 在Llama 3.1系列中,模型规模(参数量)与 ToM 性能之间存在明显的正相关。
- DeepSeek R1 显示出最高的整体 ToM 准确率,以及 ToM 与 WM 性能之间最小的差距。
- GPT-5.4 在 WM 方面表现出色,但在 ToM 方面挣扎,突显了原始推理能力并不自动等同于社会推理能力。
- 萨利 - 安妮测试失败: 当在标准萨利 - 安妮设置下测试时,模型达到了 100% 的准确率。然而,当在随机生成的同等长度故事上测试时,准确率显著下降(例如降至约 75-87%),证实了由于数据污染,经典测试是衡量真实 ToM 的不良指标。
- 对启发式的依赖:
- 近因偏差: 研究发现没有显著证据表明模型将依赖近因偏差(预测最后已知位置)作为主要失败模式;在变化的“误导距离”下,性能保持稳定。
- 首次共同位置启发式: 一种主导的错误模式是预测角色首次相遇的地点,而不是追踪其实际移动。
- 上下文长度问题: 重推理模型(如 R1)经常因生成长思维链时上下文长度不足而失败,导致“提示拒绝”或产生幻觉错误。
- 复杂性: 增加故事中的角色数量并未显著降低顶级模型的 ToM 性能,表明其在处理复杂社交图方面具有鲁棒性。
5. 意义与未来工作
- 重新定义基准: 论文认为,该领域必须从静态的、可能受污染的 dataset(如萨利 - 安妮测试)转向动态的合成基准(如 StorySim),以真正评估 LLM 的能力。
- 安全影响: 缺乏稳健的 ToM 是一个关键的安全隐患。如果 LLM 无法理解用户具有不同的视角或隐藏意图,它可能无法检测有害场景或操纵用户。
- 未来方向: 作者建议使用 StorySim 探索更复杂的场景,包括反事实推理、目标归因和偏好建模。他们还强调需要改进模型的上下文处理能力,以支持复杂 ToM 任务所需的更深层次的推理链。
总之,该论文表明,虽然 LLM 正在进步,但它们在实现心理理论所需的特定认知飞跃方面仍然挣扎,往往依赖启发式方法或无法区分客观世界状态与主观信念。StorySim 提供了必要的工具,以严格衡量并提升这些能力。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。