SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization
本文介绍了 SceneFunRI,这是一个包含 855 个实例的新基准,用于评估视觉 - 语言模型利用任务指令和常识推理不可见、被遮挡的功能性物体位置的能力,结果表明当前最先进的模型在此能力上存在显著不足。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你走进一个房间,有人问你:“床边的床头柜在哪里?”你环顾四周,但床头柜完全被一个大衣柜挡住了。你根本看不见它。然而,你凭借常识知道床头柜通常放在床边,而你能看见床。于是,你在脑海中“填补空白”,指向衣柜后面那个床头柜“必定”所在的位置。
这篇论文 SceneFunRI 正是关于教导计算机掌握这种确切的心理技巧。
问题:“不可见”的挑战
当前的 AI 模型(特别是视觉 - 语言模型,或称 VLMs)就像只相信亲眼所见线索的侦探。如果线索被墙挡住,它们往往会放弃或随机猜测。当物体完全不可见时,它们难以运用“常识”来推断其位置。
研究人员创建了一个名为 SceneFunRI(推理不可见)的新测试。
- 设置:他们选取了 855 个真实世界的场景,其中特定物体(如台灯或抽屉)完全被遮挡,无法看见。
- 任务:AI 会收到一张房间图片和一条指令,例如:“打开床右侧床头柜的抽屉。”
- 目标:AI 必须从未见过该床头柜的情况下,仅凭可见的床及其对房间常规布局的知识,指出不可见床头柜的位置。
结果:AI 仍是一名新手侦探
研究人员在此任务上测试了多种不同的 AI 模型。结果令人谦卑:
- 最佳 AI:即使是最聪明的模型(Gemini 3 Flash),也仅在约 15% 的情况下将位置判断得“足够接近”。
- 人类基线:相比之下,人类的正确率约为 66%。
- 差距:这表明,虽然 AI 擅长识别其“面前”的事物,但在想象障碍物“背后”的事物方面却表现糟糕。
他们如何尝试帮助 AI(“提示”实验)
研究人员尝试了三种不同的方法来“指导”AI 做得更好,类似于老师帮助学生:
- 强力指令:告诉 AI,“忽略你所看到的;专注于‘应该’存在什么。”
- 结果:这略有帮助。这就像告诉学生:“不要只看图片;要思考背后的故事。”
- 常识提示:向 AI 提供具体事实,例如“插座通常在角落”。
- 结果:这帮助不大。这就像给学生一张事实清单,却没有教他们如何将其应用到特定房间。AI 知道这个事实,但无法将其转化为地图上的具体位置。
- “排除法”(SPoE):这是最具创意的方法。与其让 AI 立即猜测确切位置,不如教它玩“热与冷”的游戏。
- 工作原理:AI 被展示整个房间。然后,它被问及:“物体在左半部分还是右半部分?”它排除物体“不可能”存在的那一半。接着,它再将剩余的一半再次分割。
- 结果:这出乎意料地有效。通过逐步排除不可能的区域,AI 更接近了正确位置。这就像通过逐一检查每个房间来寻找丢失的钥匙,而不是直接猜测确切的抽屉。
主要结论
该论文总结道,当前的 AI 模型对“不可见”的世界是“盲目”的。它们擅长描述所见之物,但尚未学会构建对“未见”之物的心理地图。
研究人员发现,AI 实际上更擅长排除错误猜测(如在地图上划掉不可能的房间),而不是直接猜测正确位置。要让 AI 在现实世界中真正变得智能,我们需要教导它适应不确定性,并在视觉证据缺失时,运用逻辑来填补空白。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。