Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action
本文引入了非对话式心理理论(NCP-ToM)框架,用以评估大语言模型在通过行动而非对话来诱导特定信念状态方面的表现,并发现虽然 GPT-5 在此类任务上的成功率超过了人类,但其在不同语境下的鲁棒性仍然较低,并且与人类一样,在诱导错误信念方面比诱导正确信念更具难度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是使用简单语言和日常类比对该论文进行的解释。
核心理念:“无声傀儡师”测试
想象你正在玩一场国际象棋,但你的目标不是通过将军来击败国王,而是要让你的对手“相信”一些并非真实的事情,或者让他们“知道”一些真实的事情,而你全程无需说出一个字。你不能与他们交谈;你只能通过移动物体或将东西藏进箱子里来达成目的。
这篇论文介绍了一种测试人工智能(大型语言模型或 LLM)的新方法,称为 NCP-ToM(非对话式规划心理理论)。
- 心理理论 (Theory of Mind, ToM): 这是人类理解他人想法或信念的能力。
- 非对话式 (Non-Conversational): AI 不被允许进行聊天、说服或解释。它必须通过行动来改变他人的信念。
研究人员想要观察 AI 智能体是否可以扮演“无声傀儡师”的角色——通过移动物品来布置世界,从而让其他角色产生特定的信念。
实验设置:数字版的“捉迷藏”游戏
为了进行这项测试,研究人员基于一个经典的心理学测试——萨莉-安测试 (Sally-Anne test),构建了一个数字游乐场。
- 经典测试: 在原始版本中,你观看一段视频:萨莉把一个弹珠放进篮子里然后离开了。安妮把弹珠移到了盒子里。随后你会收到问题:“萨莉认为弹珠在哪里?”(答案是篮子,因为她没看到移动的过程)。这是一个问答式 (Question & Answer) 测试。你只需观察并猜测。
- 新测试 (NCP-ExploreToM): 在这篇论文中,AI 不仅仅是在观察;它就在游戏内部。AI 被赋予一个目标,例如:“让萨莉相信弹珠在篮子里,尽管实际上弹珠在盒子里。”
- AI 的任务: AI 必须找出实现这一目标的步骤。它可能需要:
- 让萨莉离开房间。
- 将弹珠移到盒子里。
- 让萨莉留在房间外,这样她就不会看到交换过程。
- 把萨莉带回来。
如果 AI 执行正确,萨莉就会产生“错误信念”(她认为弹珠在篮子里)。如果 AI 失败,萨莉可能会看到交换过程并知晓真相。
谁参与了游戏?
研究人员测试了:
- 六个顶尖 AI 模型: 包括 GPT-5、Gemini 2.5 Pro 以及各种版本的 Claude。
- 40 名人类参与者: 在电脑上玩同样游戏的真实人类。
他们运行了 600 个不同的场景(任务),具有不同的难度等级、不同的场景(如医院、酒店或婚礼)以及不同的目标类型(让某人相信真实的事物 vs. 让某人相信虚假的事物)。
结果:计分板
以下是他们在比较玩家时的结果:
1. “错误信念”挑战难度极大
就像人类一样,AI 模型发现让某人产生错误信念(让他们相信不真实的事)比帮助某人拥有正确信念(让他们知道真相)要困难得多。
- 类比: 给某人看一张猫的照片让他们知道有只猫(正确信念)很容易;但隐藏起猫并让他们以为那是只狗(错误信念)则很难。
- 为什么这很重要: 论文指出这是一个“积极信号”。这表明 AI 可能更擅长执行有益的任务(教学、协助),而不是欺骗性的任务(误导他人)。
2. “GPT-5”带来的惊喜
最新的模型 GPT-5 是其中的佼佼者。
- 它解决了约 80% 的任务。
- 它是唯一一个表现优于人类参与者的模型。
- 然而,人类的表现更为稳定。AI 的表现会根据“场景”(例如,在政府大楼场景中表现出色,但在婚礼场景中表现较差)而大幅波动。人类无论在什么环境下都表现得很稳定。
3. “规划”差距
研究人员比较了两种测试方式:
- “测验” (Q&A): “这里有一个故事。萨莉在想什么?”
- “行动” (Agentic): “这里有一个目标。去执行它。”
通常,人们认为“行动”测试比“测验”难得多。对于大多数 AI 模型来说确实如此。但对于 GPT-5 来说,这个差距消失了。它在“行动”测试中的表现几乎与“测验”一样好。这表明对于最聪明的模型来说,实际进行规划正变得和仅仅谈论规划一样容易。
4. 复杂度削弱表现
随着任务变得更加复杂(例如需要同时追踪多个人的信念,或者让三个不同的人相信三件不同的事),所有人的得分都下降了。这就像尝试同时抛接更多的球;最终你一定会掉球。
这意味着什么?(根据论文内容)
论文以几个关键结论结尾,严格遵循其研究发现:
- AI 正在擅长“无声说服”: 现代 AI 可以规划一系列物理动作来改变其他角色的信念,而无需说一个字。
- 安全检查: AI 在处理“错误信念”(欺骗)方面比处理“正确信念”(真实)更吃力,这对安全性来说是个好消息。这表明它们并非天生倾向于通过行动来撒谎或操纵,尽管它们在被要求时确实可以做到。
- “语境”问题: AI 仍然有些脆弱。如果把故事从“医院”改为“婚礼”,AI 可能会感到困惑。人类则不会被这些变化所困扰。
- “测验陷阱”: 我们不能仅仅假设如果一个 AI 擅长回答关于故事的问题,它就一定擅长通过行动来演绎那个故事。对于最顶尖的模型(如 GPT-5),“测验比行动容易”这一旧规则可能不再适用。
总结
这篇论文表明,AI 正在从一个回答问题的“聊天机器人”进化为一个能够规划并采取行动来塑造现实的“智能体”。虽然最聪明的 AI 目前可以在这些特定的逻辑谜题上胜过人类,但它仍然缺乏在不同现实场景中保持一致性的能力。研究人员警告说,虽然这种能力对于作为得力助手很有用,但也意味着我们需要谨慎评估 AI 的安全性,因为旧的测试方法(仅仅提问)可能不再足够了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。