← 最新论文
🤖 AI

MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning

该论文引入了 MultivationBench,这是一个基于心理学框架的新基准,用于评估多模态大语言模型在故事驱动的视觉叙事中进行序列动机推理的能力,并揭示了当前模型尽管具备静态识别能力,但在动态语境下仍难以保持一致的推理能力。

原作者: Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在看一部电影,但你不仅仅是在看发生了什么,而是在试图猜测角色们为什么要这样做。这就是“社交智能”的核心——这是人类拥有一种超能力,让我们能够理解行为背后隐藏的情感和目标。科学家们称之为“动机推理”(motivation reasoning)。这不仅仅是看到某人拿起电话;而是要弄清楚他们是在寻求帮助、查看时间,还是在看一张已故亲人的照片。通常,我们不会仅凭一张静止的照片就做出这种推测。我们会观察故事的展开,随着时间的推移收集线索。如果一个角色在第一场戏中看起来很悲伤,然后在第二场戏中看到了一张照片,我们对他们动机的猜测就会发生改变。这篇论文深入探讨了最新的、超级智能的计算机大脑(被称为多模态大语言模型,Multimodal Large Language Models)是否也能进行这种“故事侦探工作”。虽然这些计算机非常擅长观察一张图片并描述它,或者阅读一个故事并回答问题,但这项研究提出了一个更难的问题:它们能否像人类一样,追踪一个角色在整个故事展开过程中不断变化的情感?

这项研究的研究人员(由香港科技大学和亚马逊的一个团队领导)决定构建一个巨大的测试。他们创建了一个名为 MultivationBench 的东西。把它想象成一个包含 1,000 个短视觉故事的庞大图书馆,这些故事像是电影片段和社交媒体帖子的结合体,包含了 4,000 多个特定的角色行为瞬间。但这不仅仅是对“发生了什么”的测试;它是对“为什么发生”的测试。为了使测试公平且具有科学性,该团队使用了两本著名的心理学规则书:马斯洛需求层次理论(Maslow's Hierarchy of Needs,它将人类欲望从基本的生存需求如食物和安全,到更高的目标如爱与自我实现进行分类)和 雷斯 16 种基本欲望理论(Reiss's 16 Basic Desires,它关注特定的个人驱动力,如好奇心、荣誉或家庭)。

团队要求计算机模型逐帧观看这些故事。在每一步,模型都必须仅根据到目前为止所看到的内容来猜测角色的动机。难点在于?随着故事的进行,新信息会出现,从而完全改变之前行为的原因。例如,一个角色伸手去拿手机,起初看起来他们只是在查看消息(一种“认知型”需求)。但随后,故事揭示了他们是在派对上感到孤独时在看家人的照片,这意味着真正的理由实际上是关于“爱与归属感”。计算机必须足够聪明,能够说:“等等,我之前错了;现在我知道真正的理由了。”

结果给技术界带来了一次警醒。论文发现,虽然这些先进的 AI 模型在处理短小、简单的故事时表现尚可,但当故事变长时,它们就会陷入挣扎。在测试的 1,000 个故事中,模型很少能从头到尾保持其推理的一致性。事实上,当被要求在整个故事中准确猜对每一个动机时,最好的模型成功率也低于 1%。这项研究表明,这些 AI 大脑就像是那些擅长背诵事实但极不擅长理解情节走向的学生。它们往往会卡在看到的第一个事物上,并且无法在有新证据出现时更新自己的思维。它们经常会“幻觉”出一些听起来合理但并不受故事支持的理由,或者忽略了那些需要跨越整个叙事进行逻辑连接的更深层、更复杂的的情感原因。

研究人员还将 AI 与真实的人类进行了比较。人类(由研究生组成)在处理任务时表现得明显更好,尤其是在故事较长且复杂的情况下。这一差距表明,尽管 AI 在视觉和阅读方面正在进步,但它仍然缺乏理解动机如何随时间转移和演变的“社交大脑”。论文总结道,我们距离拥有能够真正理解故事中人类行为背后那复杂、多变的动机的计算机还很远。这提醒我们,理解人们“为什么”这样做,比仅仅知道他们“做了什么”要难得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →