← 最新论文
💻 computer science

From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs

本文介绍了 SFI-Bench,这是一个包含 1500 多个专家标注问题的视频基准测试,用于评估多模态大语言模型在结构化空间与功能推理方面的能力,揭示了它们目前无法有效将空间记忆与功能推理相结合以实现具身智能的现状。

原作者: Le Zhang, Jihan Yang, Soundarya Krishnan, Jimit Majmudar, Xiou Ge, Prasoon Puri, Prathamesh Nandkishor Saraf, Shruti Bhargava, Dhivya Piraviperumal, Yinan Ling, Cindy Pan, Hong Yu, Aishwarya Agrawal
发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Le Zhang, Jihan Yang, Soundarya Krishnan, Jimit Majmudar, Xiou Ge, Prasoon Puri, Prathamesh Nandkishor Saraf, Shruti Bhargava, Dhivya Piraviperumal, Yinan Ling, Cindy Pan, Hong Yu, Aishwarya Agrawal, Bo-Hsiang Tseng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在你家中导航。你可能会认为最难的部分是教它识别椅子或咖啡杯。但根据这篇论文,那实际上是最简单的部分。真正的挑战在于教机器人两件更难的事情:所有物品彼此之间的位置关系**,以及所有物品的实际用途

研究人员创建了一个名为SFI-Bench(空间 - 功能智能基准)的新测试,以检验当今最智能的 AI 模型是否能做到这些。你可以把它想象成 AI 的“驾照考试”,只不过 AI 不需要驾驶汽车,而是需要导航一段房间的视频,并回答关于该视频的棘手问题。

以下是他们发现的要点,使用了简单的类比:

1. 两大核心技能:地图与说明书

该论文认为,真正的智能需要两种互补的技能,他们称之为“物品在哪里”和“物品有什么用”。

  • “在哪里”(空间推理): 这就像在脑海中构建一张心理地图。它不仅仅是看到一张沙发,而是知道沙发在电视的左边,上面有三个靠垫,并且如果你走过沙发,就会撞到墙。
    • 测试: AI 会观看一段房间视频,并被问及诸如“离门最远的那个沙发上有几个蓝色靠垫?”或“如果我从厨房走到卧室,我会先经过什么物体?”之类的问题。
  • “有什么用”(功能推理): 这就像理解用户手册。它知道遥控器是用于电视的,而不是烤面包机,并且知道确切按哪些按钮来取消洗衣机的洗涤周期。
    • 测试: AI 看到一个奇怪的装置,必须弄清楚“这是做什么的?”或者“我的眼镜从洗碗机里拿出来时带上了彩虹色的污渍,这是怎么回事,我该如何修复?”

2. 结果:擅长“看”,拙于“想”

研究人员在 SFI-Bench 上测试了许多世界上最先进的 AI 模型(如 GPT-5、Gemini 和开源模型)。以下是结论:

  • “眼睛”是睁开的: AI 模型在简单感知方面表现出色。如果你问“视频里有猫吗?”,它们几乎每次都能答对。
  • “大脑”却卡住了: 当问题变得更难时,这些模型就 struggled 了。
    • 记忆鸿沟: 想象一下,走过一个房间后试图记住它。AI 经常忘记它从哪里开始。如果你让它将视频开头和结尾的某个点联系起来,它经常会迷路,或者将物体“瞬移”到错误的位置。
    • “过度思考”陷阱: 研究人员发现,当他们告诉 AI“更努力地思考”(即给它更多时间来生成冗长的推理链)时,它并没有变得更聪明。事实上,它往往变得更。它开始编造事实,或者被自己冗长的解释搞糊涂了。这就像一个学生在考试中不停地写啊写,直到不小心擦掉了正确答案。
    • “说明书”问题: 对于“有什么用”类的问题,除非允许 AI 使用搜索引擎查找现实世界的说明书,否则它通常会失败。如果没有这种外部帮助,AI 就只是在猜测,往往依赖于不符合具体情境的常识(例如,假设任何遥控器都适用于任何电视)。

3. 令人惊讶的发现

  • 时间并不重要: 人类通过随时间移动来构建心理地图。如果你打乱视频帧的顺序,让它们乱序播放,人类会完全迷失。令人惊讶的是,AI 并不太在意;它只是同时查看所有图片并试图猜测。它似乎不像我们那样理解时间的“流动”。
  • 图片胜过文字: 研究人员尝试用文字描述房间来代替视频喂给 AI。AI 的表现显著下降。事实证明,即使你用文字完美地描述了一个房间,AI 仍然需要观看视频才能构建正确的心理地图。
  • 更大并不总是更好: 有时,更小、更高效的模型表现得和巨大的模型一样好,前提是它们没有陷入冗长且不必要的推理链中。

核心结论

该论文得出结论:虽然 AI 在“看见”世界方面变得越来越擅长,但在“理解”世界方面仍然挣扎。它能识别烤面包机,但它并没有真正理解烤面包机如何融入厨房,或者如果它坏了该如何修理。

要构建真正智能的代理(机器人或代表我们行动的软件),我们需要超越仅仅教它们识别物体。我们需要教它们构建连贯的心理地图,记住物品随时间的位置,并根据现实世界的知识(而非仅仅是猜测)来知道如何使用工具。目前,它们就像一个能拍下地标建筑精彩照片的游客,却不知道如何到达那里,也不知道到达后该做什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →