← 最新论文
🤖 AI

OmniToM: Benchmarking Theory of Mind in LLMs via Explicit Belief Modeling

本文介绍了 OmniToM,这是一个新基准,它通过要求对行动者的信念结构进行显式的、多维度的建模,而非仅仅依赖最终问答表现,来评估大语言模型的心理理论能力,从而揭示出当前模型在将叙事事实转化为准确心理状态表征所需的特定推理方面存在困难。

原作者: Adam Bawatneh, Sagar Sapkota, Amrit Singh Bedi, Santu Karmaker, Mubarak Shah

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Adam Bawatneh, Sagar Sapkota, Amrit Singh Bedi, Santu Karmaker, Mubarak Shah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一场魔术表演。魔术师让一个球从盒子里消失,然后出现在篮子里。针对人工智能(大型语言模型)的标准测试通常只会问:“球在哪里?”如果人工智能回答“在篮子里”,它就会获得一颗金星。

但问题在于:人工智能可能只是猜对了答案,而实际上并没有理解这个故事。它可能不知道看到了球的移动,没有看到,或者每个人认为正在发生什么。这就像一个背下了答案钥匙却不懂数学的学生。

OmniToM 是一项新的“考试”,旨在防止人工智能通过猜测作弊。它不再仅仅询问最终答案,而是迫使人工智能通过构建每个角色思想的详细“心智地图”来展示其推理过程。

以下是该论文如何利用简单的类比进行分解:

1. 问题:思维的“黑箱”

目前的测试就像只根据学生的最终作文成绩来评分。如果作文写得好,你并不知道学生是否真正理解了角色的情感,还是仅仅使用了华丽的辞藻来显得聪明。

  • 论文主张:现有的测试(称为“端点问答”)只检查最终答案。它们无法看出人工智能是否真的在追踪谁知道什么、谁在撒谎,或者谁弄错了。

2. 解决方案:“心智地图”(OmniToM)

研究人员建立了一个名为 OmniToM 的新基准。他们不再问“球在哪里?”,而是要求人工智能绘制出每个人大脑的地图。

这就像电影的导演剧本。导演不仅仅关心剧情;他们关心每个演员在每一刻相信什么。

  • 任务:人工智能必须阅读故事,并列出“信念命题”。这些是微小、简单的句子,例如:“鲍勃认为球在盒子里”或“爱丽丝知道球在篮子里”。

3. 两阶段考试

OmniToM 分两个截然不同的阶段测试人工智能,就像一场两部分的面试:

第一阶段:侦探(信念提取)

  • 工作:人工智能阅读故事,必须找出每个角色持有的每一个想法。
  • 挑战:仅仅说“鲍勃很伤心”是不够的。人工智能必须根据鲍勃看到、听到或记得的内容,弄清楚为什么鲍勃很伤心。
  • 结果:论文发现,人工智能在寻找事实(例如“球在篮子里”)方面表现尚可,但在将这些事实归因于正确的人脑方面却存在困难。它们经常忘记鲍勃没有看到球移动,因此他不应该知道球在篮子里。

第二阶段:图书管理员(信念标注)

  • 工作:一旦人工智能列出了这些想法,它就必须用 7 维的“条形码”给它们打上标签。
  • 类比:想象一位图书管理员在整理书籍。他们不仅仅是把书放在架子上;他们还会给书打上标签,包括:
    • 层级:这是一个简单的想法(“我饿了”)还是一个复杂的想法(“我认为觉得我饿了”)?
    • 真实性:这个想法实际上是真的,还是角色弄错了?
    • 获取途径:角色是亲眼看到了这件事,还是仅仅猜测的?
    • 来源:他们是听别人说的、回忆起来的,还是想象出来的?
  • 结果:人工智能在简单标签(如“这是真的吗?”)方面表现惊人地好,但在“获取途径”标签上却表现糟糕。它们难以记住谁有权访问哪些信息。

4. 重大发现:“信息瓶颈”

该论文最重要的发现是,当前的人工智能模型存在一个特定的“盲点”。

  • 隐喻:想象一群人在房间里。一个人离开了,另一个人移动了一个秘密物体。人工智能可以完美地描述房间。但当被问及“离开的那个人认为房间里有什么?”时,人工智能就会感到困惑。
  • 主张:人工智能的失败并非因为它无法阅读故事,而是因为它无法追踪谁知道什么。它难以区分“实际发生的事情”与“特定角色认为正在发生的事情”。

5. 构建方法

为了进行这项测试,研究人员选取了 895 个现有故事,并让人类(以及智能人工智能助手)标注了超过 22,000 个具体想法。

  • 过程:他们使用了一个“校准”系统。人类检查一小批数据,教人工智能如何正确标注,然后人工智能协助标注其余部分,人类再进行双重检查。这确保了“黄金标准”答案的准确性。

总结

OmniToM 是一种测试人工智能的新方法,它阻止了人工智能仅仅猜测正确答案。它迫使人工智能构建每个人思想、信念和知识的详细地图。论文表明,虽然人工智能在阅读方面正在进步,但它仍然难以理解“谁知道什么”这一复杂的社会游戏,而这正是人类社交智能的核心。

关于局限性的说明:论文明确指出,这项测试仅适用于基于文本的故事。它并不声称人工智能能够理解现实世界的社会情境、面对面互动中的情绪,或复杂的现实生活场景。它严格来说是一种用于衡量人工智能在书面叙事中追踪信念能力的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →