想象一下,你正在教一个机器人如何在你家中导航。你可能会认为最难的部分是教它识别椅子或咖啡杯。但根据这篇论文,那实际上是最简单的部分。真正的挑战在于教机器人两件更难的事情:所有物品彼此之间的位置关系**,以及所有物品的实际用途。
研究人员创建了一个名为SFI-Bench(空间 - 功能智能基准)的新测试,以检验当今最智能的 AI 模型是否能做到这些。你可以把它想象成 AI 的“驾照考试”,只不过 AI 不需要驾驶汽车,而是需要导航一段房间的视频,并回答关于该视频的棘手问题。
以下是他们发现的要点,使用了简单的类比:
1. 两大核心技能:地图与说明书
该论文认为,真正的智能需要两种互补的技能,他们称之为“物品在哪里”和“物品有什么用”。
- “在哪里”(空间推理): 这就像在脑海中构建一张心理地图。它不仅仅是看到一张沙发,而是知道沙发在电视的左边,上面有三个靠垫,并且如果你走过沙发,就会撞到墙。
- 测试: AI 会观看一段房间视频,并被问及诸如“离门最远的那个沙发上有几个蓝色靠垫?”或“如果我从厨房走到卧室,我会先经过什么物体?”之类的问题。
- “有什么用”(功能推理): 这就像理解用户手册。它知道遥控器是用于电视的,而不是烤面包机,并且知道确切按哪些按钮来取消洗衣机的洗涤周期。
- 测试: AI 看到一个奇怪的装置,必须弄清楚“这是做什么的?”或者“我的眼镜从洗碗机里拿出来时带上了彩虹色的污渍,这是怎么回事,我该如何修复?”
2. 结果:擅长“看”,拙于“想”
研究人员在 SFI-Bench 上测试了许多世界上最先进的 AI 模型(如 GPT-5、Gemini 和开源模型)。以下是结论:
- “眼睛”是睁开的: AI 模型在简单感知方面表现出色。如果你问“视频里有猫吗?”,它们几乎每次都能答对。
- “大脑”却卡住了: 当问题变得更难时,这些模型就 struggled 了。
- 记忆鸿沟: 想象一下,走过一个房间后试图记住它。AI 经常忘记它从哪里开始。如果你让它将视频开头和结尾的某个点联系起来,它经常会迷路,或者将物体“瞬移”到错误的位置。
- “过度思考”陷阱: 研究人员发现,当他们告诉 AI“更努力地思考”(即给它更多时间来生成冗长的推理链)时,它并没有变得更聪明。事实上,它往往变得更笨。它开始编造事实,或者被自己冗长的解释搞糊涂了。这就像一个学生在考试中不停地写啊写,直到不小心擦掉了正确答案。
- “说明书”问题: 对于“有什么用”类的问题,除非允许 AI 使用搜索引擎查找现实世界的说明书,否则它通常会失败。如果没有这种外部帮助,AI 就只是在猜测,往往依赖于不符合具体情境的常识(例如,假设任何遥控器都适用于任何电视)。
3. 令人惊讶的发现
- 时间并不重要: 人类通过随时间移动来构建心理地图。如果你打乱视频帧的顺序,让它们乱序播放,人类会完全迷失。令人惊讶的是,AI 并不太在意;它只是同时查看所有图片并试图猜测。它似乎不像我们那样理解时间的“流动”。
- 图片胜过文字: 研究人员尝试用文字描述房间来代替视频喂给 AI。AI 的表现显著下降。事实证明,即使你用文字完美地描述了一个房间,AI 仍然需要观看视频才能构建正确的心理地图。
- 更大并不总是更好: 有时,更小、更高效的模型表现得和巨大的模型一样好,前提是它们没有陷入冗长且不必要的推理链中。
核心结论
该论文得出结论:虽然 AI 在“看见”世界方面变得越来越擅长,但在“理解”世界方面仍然挣扎。它能识别烤面包机,但它并没有真正理解烤面包机如何融入厨房,或者如果它坏了该如何修理。
要构建真正智能的代理(机器人或代表我们行动的软件),我们需要超越仅仅教它们识别物体。我们需要教它们构建连贯的心理地图,记住物品随时间的位置,并根据现实世界的知识(而非仅仅是猜测)来知道如何使用工具。目前,它们就像一个能拍下地标建筑精彩照片的游客,却不知道如何到达那里,也不知道到达后该做什么。
技术摘要:从“物在何处”到“物有何用”(SFI-Bench)
问题陈述
当前的多模态大语言模型(MLLM)在低级几何感知和事实回忆方面已展现出显著进展。然而,现有基准测试大多未能评估实现具身、代理智能所需的高阶认知能力。具体而言,在评估模型能否从识别“物在何处”(空间布局)跨越到理解“物有何用”(功能可供性与情境依赖的效用)方面存在差距。虽然 VSI-Bench 等先前工作测试了几何感知,但它们未能充分探究连贯认知地图的构建、物体可供性的推断,或外部知识在目标导向推理中的整合。
方法论
SFI-Bench 基准测试
作者引入了空间 - 功能智能基准(SFI-Bench),这是一个基于视频的评估套件,旨在系统性地衡量 MLLM 的高级推理能力。
- 数据集构成:SFI-Bench 包含 1,555 道由专家标注的选择题,源自 134 个真实世界的以自我为中心(egocentric)的室内视频扫描(来源于 ARKitScenes 和 ScanNet++)。这些视频涵盖了多样化的住宅、专业和工业环境。
- 任务分类:该基准测试在六个核心任务中评估两个互补的认知维度:
- 结构化空间推理:
- 全局与条件计数:要求对属性和关系进行逻辑推断(例如,计算同一品牌瓶子的最大数量),而非简单的枚举。
- 跨视角多跳路径推理:测试整合跨时间和视角的空间证据以推断单帧中不可见关系的能力。
- 布局推断:评估全局场景布局的构建以及对遮挡关系的推理,其中被引用的物体从未同时出现。
- 功能推理:
- 功能关联:测试基于设计或情境推断物体间可供性关系的能力(例如,将遥控器与特定电视关联)。
- 操作规划:要求确定如何操作设备,通常需要从外部知识(例如,用户手册)中检索信息。
- 因果假设与故障排除:评估结合场景理解与外部知识源来诊断问题的能力。
数据构建流程
该数据集通过三阶段流程构建:
- 自动生成:使用 Gemini-2.5-Pro 从视频中提取细粒度元数据(物体、属性、空间关系、功能角色),随后利用特定任务模板将其转换为候选问题。
- 人工验证:专家标注员(受过训练的机器学习工程师)验证问题,根据视觉证据验证答案,并优化选项以确保认知复杂度。
- 质量过滤:通过自动化和人工检查,剔除无需视觉 grounding 即可解答的问题。对于基于知识的任务,答案源自专家检索的手册。
评估设置
作者评估了广泛的专有模型(例如 GPT-5、Gemini-3、o4-mini)和开源模型(例如 Qwen3-VL、InternVL、LLaVA-Video)。
- 设置:评估在零样本(zero-shot)设置下进行。
- 工具使用:对于需要外部知识的功能性任务(操作规划、故障排除),允许具备网络搜索能力的模型检索信息,而其他模型则进行离线评估。
- 指标:性能通过多选题的答案准确率进行衡量。
主要结果
模型性能
- 专有模型与开源模型:专有模型通常优于开源模型。在专有系统中,启用推理的变体(例如 Gemini-3.1-Pro、GPT-5.4-High)显示出显著提升,其中 Gemini-3.1-Pro 取得了最高的平均准确率(73.8%)。
- 空间与功能:虽然领先模型在空间认知地图构建(例如布局推断)方面表现出强大能力,但在功能推理任务上存在显著困难。
- 瓶颈:全局条件计数成为所有模型的主要瓶颈,揭示了组合推理和逻辑推理方面的持续局限性。
- 工具使用依赖性:对于基于知识的任务,配备网络搜索的模型(例如 GPT-5)显著优于其离线对应版本。然而,作者指出工具使用会引入噪声;推理能力较弱的模型在使用搜索工具时的表现往往不如不使用工具时,这表明强大的推理能力是有效使用工具的前提。
推理机制分析
- 推理长度与质量:研究发现,更长的推理链并不与更高的准确率相关。事实上,模型经常产生不必要的长链,从而引入语义漂移。“过度思考”会导致错误,特别是在功能关联任务中。
- 模型规模:较大规模的模型(例如 235B 参数)倾向于生成更短、更有效的推理链,而较小规模的模型(例如 8B)则依赖冗长但浅层的推理。
- 时间依赖性:打乱视频帧顺序对模型性能影响甚微,表明当前的 MLLM 依赖聚合的视觉证据而非时间连贯的动态来形成空间表征。
- 视觉 grounding:当模型接收结构化文本描述而非原始视频时,性能显著下降,突显了直接视觉 grounding 对于认知地图构建的关键性。
主要贡献
- SFI-Bench:引入了一个全面的基准测试,将评估重点从感知识别转向结构化的空间和功能推理。
- 诊断洞察:识别了最先进 MLLM 中的特定失败模式,包括视觉感知错误、空间不一致性(例如物体的“瞬移”)以及可供性的过度泛化。
- 推理动态:发现有效的推理定义为与感知证据的一致性,而非推理链的长度;并且当前的开源推理模型(RLVR 训练)未能将数学推理能力迁移到空间 - 功能领域。
- 知识整合:强调了外部知识获取对于代理任务的关键作用,表明仅靠参数化记忆不足以应对操作和故障排除场景。
意义
该论文认为,实现真正具身、代理智能需要超越以感知为导向的模型,转向具备整合的空间 - 功能认知能力的系统。作者提出,SFI-Bench 可作为衡量这一方向进展的诊断工具。研究结果表明,未来的进步必须专注于:
- 构建和维护在时间上一致的连贯认知地图。
- 开发稳健的组合推理以避免语义漂移。
- 无缝整合视觉感知与动态外部知识源,以支持现实环境中有目的的行动。
这项工作强调,虽然当前的 MLLM 在局部感知方面表现出色,但在维持全局空间记忆和 grounding 可供性方面仍然脆弱,这代表了多模态 AI 研究的一个关键前沿。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。