← 最新论文
💻 computer science

SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification

本文介绍了 SEER,一种针对冻结视觉语言模型的免训练推理时接口,它通过构建具有明确主语/宾语角色和互补几何上下文的特定查询证据视图,从而显著改善了空间关系分类,并减少了由模糊全局视图或错误实例选择导致的错误。

原作者: Feixiang Liu, Likun Wang, Qiang Qiu, Hui Xu, Huawei Shen, Xueqi Cheng

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Feixiang Liu, Likun Wang, Qiang Qiu, Hui Xu, Huawei Shen, Xueqi Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个拼图问题,其中两个碎片需要完美地契合在一起。在人工智能的世界里,存在着一种被称为“视觉语言模型”(Vision-Language Models, VLMs)的“超级聪明的大脑”——它们能够观察一张图片并阅读关于它的问题。它们非常擅长识别物体;如果你给它们看一张猫和狗的照片,它们能分辨出谁是谁。但棘手的部分在于:当你问“猫是在狗的左边吗?”时,它们有时会感到困惑。它们可能正确识别了动物,却搞混了它们的位置,或者根据它们在书本中读到的知识进行猜测,而不是根据实际看到的画面。这就像一个学生虽然知道“左”和“右”的定义,但在看地图时却总是指错方向。科学家们非常关注修复这个问题,因为如果这些 AI 大脑无法理解空间关系,它们就无法在自动驾驶、机器人导航或安全阅读复杂图表等方面为我们提供帮助。

于是,出现了 SEER,这是一种针对这些 AI 大脑的巧妙新技巧,它不需要教它们任何新知识。把 SEER 想象成一个“聚光灯与标签”系统。SEER 不会让 AI 盯着整个杂乱的画面进行猜测,而是首先静静地找到问题所询问的那两个特定事物(比如猫和狗)。然后,它会为这两个物体创建一个专门的、放大的视图。它会在主体周围画一个红框,在客体周围画一个蓝框,并清晰地标记为“主体(Subject)”和“客体(Object)”。在这一步中,它会隐藏可能的答案(如“左”或“右”),这样 AI 就不会依赖选项来决定看向哪里。通过迫使 AI 专注于一个干净、有标签的、仅包含这两个物体的视图,SEER 帮助 AI 做出了更准确的判断。研究人员发现,这种简单的“重新聚焦并标记”的方法让 AI 在处理空间关系时表现得更好,在不同测试中的准确率平均提升了约 4%。

问题所在:AI 的“巨大模糊”

想象你身处一个挤满了人的拥挤房间,有人问:“戴红帽子的人是站在穿蓝衬衫的人的左边吗?”如果你只是瞥一眼整个房间,你可能会出错。也许你看到了远左边的红帽子和远右边的蓝衬衫,但问题中提到的那两个人其实正站在中间靠得很近的位置。

目前的 AI 模型经常犯同样的错误。它们能看到物体,但会在图像的“全局视图”中迷失。它们可能会依赖于它们“认为”通常发生的情况(例如“猫通常在左边”),而不是实际检查图片中的特定位置。这被称为“幻觉”或“未能将答案锚定(grounding)”在正确的视觉证据上。论文指出,问题不在于 AI 不理解“左”或“右”,而在于它看错了图片的部分,或者被过多的背景噪音干扰了。

解决方案:SEER 的“自我锚定”手电筒

来自中国科学院计算技术研究所的作者们提出了一个名为 SEER(Self-grounded Evidence for Entity-Relation Reasoning,即用于实体关系推理的自我锚定证据)的方法。这就像是给 AI 一个手电筒和一对荧光笔,但有一个非常严格的规则:先不要看答案选项。

以下是 SEER 的工作步骤:

  1. “盲搜”阶段: 当 AI 接收到类似“杯子在书的左边吗?”的问题时,SEER 首先要求 AI 在图像中找到杯子和书。至关重要的一点是,在搜索过程中它会隐藏可能的答案(左、右、上、下)。这可以防止 AI 依赖“左”这个词,然后仅仅在图像左侧寻找一个杯子,而不顾书实际在哪里。
  2. “放大”视图: 一旦 AI 找到了杯子和书,SEER 会裁剪出一张仅包含这两个物体的精简图片。它会在杯子(主体)周围画一个红框,在书(客体)周围画一个蓝框,并清晰地标记它们。
  3. “角色明确”检查: 现在,AI 观察这张干净的放大图。它看到:“好吧,红框是杯子,蓝框是书。那么,红框是在蓝框的左边吗?”由于背景已经消失且角色已被标记,AI 就不太容易产生混淆。
  4. “双重检查”(可选): 有时,AI 可能仍会犹豫不决。SEER 有一个巧妙的技巧叫做“互惠一致性(reciprocal consistency)”。它会交换角色:“好,现在假设书是主体,杯子是客体。那么,书是在杯子的右边吗?”如果 AI 的回答在两个方向上都能自洽(如果 A 在 B 的左边,那么 B 必然在 A 的右边),它就会确认答案。如果答案相互矛盾,它就知道出错了并重新尝试。

实验结果显示

研究人员在几个不同的数据集(即大量的图片-问题对集合)上测试了这种方法。他们使用了“冻结”测试集,这意味着他们在开始实验之前就选定了测试问题,因此无法通过微调方法来通过死记硬背来获取高分。

  • 重大胜利: 在一个名为 GQA-Train900(包含 900 张独特图像)的测试集上,SEER 比起仅观察全图,将 AI 的准确率提升了 +3.94%。这听起来可能很小,但在 AI 基准测试领域,近 4% 的提升是一个巨大的飞跃。这意味着 AI 在 1000 个问题中多答对了近 40 个。
  • 不同模型,同样成功: 他们在不同类型的 AI 大脑(如 Qwen3 和 InternVL3.5)上进行了测试。每一个都变得更强了。例如,在另一个名为 EmbSpatial 的测试中,一个模型的准确率大幅提升了 +11.79%
  • 为什么有效: 研究人员进行了专门的测试以找出原因。他们发现,神奇之处不仅仅在于“放大”(裁剪图像),更在于标签。当他们裁剪了图像但没有标记哪个是主体、哪个是客体时,AI 的提升并不明显。清晰的“红框 = 主体”和“蓝框 = 客体”标签才是关键。这迫使 AI 去关注特定物体的角色。
  • 未解决的问题: 该方法并非完美。它在处理“在……之上(on)”这个词时遇到了一些困难(例如“杯子在桌子上”),因为仅凭视觉很难区分“在……之上(on)”和单纯的“在……上方(above)”,这涉及到 3D 深度感。此外,当 AI 需要在二选一问题中猜测“正确”或“错误”时,该方法帮助不大,这表明该技巧在有具体选项可供选择时效果最好。

总结

SEER 证明了,要解决问题,你不一定需要构建一个更大、更聪明或更昂贵的 AI。有时,你只需要改变向 AI 展示问题的方式。通过在搜索过程中隐藏答案选项,然后呈现一个干净、有标签的仅包含相关物体的视图,AI 就可以停止猜测,开始真正地观察。

作者们谨慎地指出,这并不是一个能解决所有空间问题的“万灵药”。AI 本身仍然需要具备首先找到这些物体的能力。但一旦物体被找到,SEER 就像一个得力的向导,确保 AI 以正确的方式观察正确的事物。这提醒我们,在追求更智能 AI 的竞赛中,有时最好的升级其实是一个更好的交互界面。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →