← 最新论文
🤖 AI

When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

本文介绍了一个针对大型视觉语言模型(LVLMs)交互式视觉定位的基准测试,揭示了当前模型在性能上显著低于人类基准,在未提供初始描述时难以进行主动信息寻求,并且在置信度与准确性之间表现出较差的校准。

原作者: Zhengxiang Wang, Owen Rambow

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengxiang Wang, Owen Rambow

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,有一种特定的技能被称为“视觉定位”(visual grounding)。这是指计算机能够观察一张图片,并指向人类所谈论的那个确切物体。如果你说,“找到那个红色的球”,系统必须在许多其他球中定位到那个特定的球。多年来,科学家们通过给计算机一个完美、详细的描述,并要求它寻找匹配项,来测试这项技能。这就像是递给某人一张完整的地图,然后要求他们在其中找到隐藏的宝藏。计算机已经非常擅长这项单步任务,当指令清晰且完整时,其表现往往能达到或超过人类水平。

然而,现实生活很少如此简单。当人类彼此交谈时,描述往往是模糊、不完整甚至错误的。我们不会递给彼此完美的地图;相反,我们共同构建理解。我们会通过提问来填补缺失的信息,例如:“它是在左边吗?”或者“它有把手吗?”本研究探讨了当我们要求人工智能做同样的事情时会发生什么:即让它观察一张图片,意识到自己信息不足,然后提出正确的问题来寻找目标。研究人员想要观察这些智能计算机系统是否能够处理人类对话中这种杂乱、往复的过程,还是会在指令没有被“捧在银盘上”呈献给它们时失败。

团队建立了一个受控实验来测试这种交互能力。他们创建了一个包含两个角色的游戏:一个是知道目标物体的“导演”(Director),另一个是必须找到该物体的“匹配者”(Matcher)。他们使用了四种不同的视觉世界来进行游戏:由狗、篮子和被称为“叠纸拼图”(tangrams)的抽象形状组成的集合。在游戏中,匹配者看到的是由许多可能物品组成的网格,而导演看到的仅是正确的目标。研究人员在四种不同的条件下测试了匹配者,以观察它如何处理信息。在第一种条件下,匹配者被给予了一个完整、完美的描述,并且必须在不说话的情况下找到物体。在第二种条件下,它被给予了一个完整的描述,但允许通过追问问题来核实自己的工作。在第三种条件下,它从一个非常模糊的线索开始,比如“它是一个篮子”,然后必须通过提问来确定是哪一个。在最后一种也是最困难的条件下,匹配者完全没有任何描述,必须从零开始通过提问来在脑海中构建目标的图像。

他们使用八种不同的“大型视觉语言模型”(large vision-language models)进行了这场游戏,这些是目前最先进的能够看懂并理解文字的人工智能类型。结果非常明确,且有些令人惊讶。即使在被给予完美描述的情况下,这些模型的表现也难以达到人类玩家的水平。而当任务需要交互时,这种差距变得更加巨大。当模型必须通过提问来寻找目标时,它们的表现显著下降。它们在最难的任务上表现尤为糟糕,即必须从没有任何信息开始并引导对话本身。虽然它们可以提问,但经常问错问题,或者无法有效地利用收到的答案来缩小选择范围。

研究还观察了模型对自身答案的信心程度。研究人员发现,模型往往过度自信。即使在实际出错时,它们也会报告自己找到了正确物体的极高确定性。这种缺乏自我意识的情况在模型必须通过提问来寻找目标时最为明显。它们似乎认为自己已经掌握了足够的信息,而实际上并非如此。有趣的是,如果允许模型通过追问来完善描述,它们确实表现出了一定的改进能力,但这种帮助是有限的。如果有人指出错误,它们可以纠正错误,但它们并不擅长主动寻求所需的信息以避免错误发生。

为了确保这些发现是可靠的,研究人员进行了几项后续测试。他们检查了如果描述是由计算机而非人类编写、如果迫使模型在回答前进行更深入思考、或者如果它们与同一个伙伴多次进行游戏,结果是否会发生变化。在每种情况下,模式都保持一致。模型在处理计算机生成的描述时表现得更好,但在处理任务的交互部分时仍然挣扎。他们还发现,虽然模型在玩了几次游戏后可以略有进步,但它们从未赶上人类的表现。从零开始进行对话并建立共同理解的难度仍然是一个主要障碍。一项后续研究确实测试了模型处理面部图像的能力,但主游戏侧重于狗、篮子和叠纸拼图。

研究人员得出结论,虽然这些人工智能系统在将清晰描述与图片进行匹配方面表现出色,但它们尚未准备好应对现实世界的沟通。它们缺乏识别自己何时缺失信息以及如何通过提问来获取信息的这种能力。它们也不擅长判断自己对答案的把握程度。这表明,要让机器人或人工智能助手真正与人类协作,它们不仅需要学习如何观察,还需要学习如何交谈、如何寻求帮助,以及如何意识到自己不知道答案。在它们能够做到这些之前,它们仍将局限于那些指令完美的任务,而人类参照中那种复杂的、交互式的本质,仍是它们尚未解决的挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →