← 最新论文
🤖 AI

Overcoming Multi-step Complexity in Multimodal Theory-of-Mind Reasoning: A Scalable Bayesian Planner

本文提出了一种可扩展的贝叶斯心智理论规划器,该规划器利用从弱到强的控制机制,使较小的语言模型能够引导较大的模型将复杂的多模态推理分解为逐步的贝叶斯更新,从而在推断人类心理状态方面实现了最先进的准确率。

原作者: Chunhui Zhang, Zhongyu Ouyang, Kwonjoon Lee, Nakul Agarwal, Sean Dae Houlihan, Soroush Vosoughi, Shao-Yuan Lo

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Chunhui Zhang, Zhongyu Ouyang, Kwonjoon Lee, Nakul Agarwal, Sean Dae Houlihan, Soroush Vosoughi, Shao-Yuan Lo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图弄清楚你的朋友在想什么。你看到他们走进厨房,打开冰箱,露出困惑的表情,然后走向食品储藏室。你可能会猜测:“他们肯定在找零食,但他们以为饼干在冰箱里。”这种根据他人的行为来推测其隐藏的想法、信念和目标的的能力,被称为心智理论(Theory of Mind, ToM)

本文介绍了一种让计算机进行此类思考的新方法,特别是在它们需要同时观看视频和阅读描述时。

以下是他们解决方案的分解,使用了简单的类比:

问题:复杂思考的“脑雾”

作者发现,当被要求解决关于人们想法的复杂多步骤谜题时,当前的人工智能模型会感到困惑。

  • 小型 AI 模型(就像一个聪明的青少年)擅长处理简单任务,但当故事变长或变复杂时会迷失方向。它们会忘记细节。
  • 巨型 AI 模型(就像一个天才教授)拥有庞大的世界知识库,但训练成本高昂,有时会被自己浩瀚的知识分散注意力,无法专注于谜题的具体逻辑。
  • “规划”陷阱:当你要求 AI 规划一系列长步骤(例如“首先他们打开冰箱,然后意识到牛奶没了,所以他们走向食品储藏室”)时,AI 往往会迷失方向。它需要执行的步骤越多,其准确性就越差。

解决方案:“由弱到强”的团队合作

作者创建了一个他们称为可扩展贝叶斯规划器(Scalable Bayesian Planner)的系统。可以将其想象为两个人之间的伙伴关系:一位专家实习生和一位饱经世故的专家

  1. 专家实习生(小模型):

    • 这是一个较小的 AI 模型(例如 80 亿参数),专门针对数千种“读心”场景进行了训练。
    • 它就像一名初级侦探,研究过许多人们寻找物品的案例。它确切地知道如何寻找关于某人想要什么的线索。
    • 然而,它对现实世界了解不多(例如“冰箱”实际上长什么样,或者厨房是如何运作的)。
  2. 饱经世故的专家(大模型):

    • 这是一个庞大的 AI 模型(高达 4050 亿参数)。
    • 它了解世界的一切。它知道冰箱是什么,葡萄酒尝起来是什么味道,以及人们通常如何行为。
    • 但是,它并没有专门针对解决这些“读心”谜题所需的“侦探逻辑”进行训练。
  3. 魔法技巧(由弱到强的控制):

    • 团队没有尝试重新训练庞大的专家(这太昂贵且困难),而是利用实习生来指导专家
    • 想象一下,专家正在试图解开一个谜语。实习生低声说道:“嘿,在这种特定类型的谜语中,人们通常会先查看食品储藏室,而不是冰箱。”
    • 专家听从了这个低语,调整了它的思考,并利用其庞大的知识正确解开了谜语。
    • 论文称其为**“贝叶斯规划器”**。简单来说,这是一种基于数学的信念更新方式:“我原本以为他们在找 X,但既然我看到他们做了 Y,我应该将我的猜测更新为 Z。”

实际运作方式

该系统观察一个人在房子(例如“詹姆斯”)里移动的视频。

  1. 符号翻译:首先,计算机将视频和文本转换为简单的列表事实(例如,“詹姆斯在厨房里”,“葡萄酒在柜子里”)。
  2. 团队协作:小型专用模型分析步骤并告诉大型模型:“基于詹姆斯的行为,他想要葡萄酒的概率很高。”
  3. 专家决策:大型模型接收这个提示,将其结合其对人类行为的大量知识,并对詹姆斯的目标做出最终猜测。

结果

该论文在名为"VirtualHome"(一个数字公寓)的模拟器上测试了这种方法,甚至还在虚构的场景(如“古埃及”或“外太空”)中进行测试,以观察 AI 是否具有泛化能力。

  • 更高的准确性:与现有最佳方法相比,他们的方法将准确性提高了4.6%
  • 稳定性:即使他们将“实习生”变小(从 80 亿参数减少到 40 亿参数),系统仍然运作良好。这证明你不需要一个巨大的“实习生”来指导“专家”。
  • 新标准:他们声称,这为 AI 模型如何在复杂、变化的环境中理解人类心理状态设定了新标准。

为什么这很重要(根据论文观点)

作者认为,你不需要花费数百万美元重新训练巨型 AI 模型来提高其社会推理能力。相反,你可以训练一个微小、廉价的“专家”模型,让它来引导巨型模型。这使得 AI 能够更可靠地理解人类的思想和意图,即使是在它从未见过的情况下。

简而言之:他们建立了一个系统,让一个小型、专业的侦探教导一个庞大、知识渊博的百科全书如何解开谜团,从而组成一个更聪明的侦探团队。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →