VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch
本文介绍了 VistaHop,这是一个全新的基准测试和评估环境,旨在评估多模态大推理模型在执行用于视觉深度搜索(Visual DeepSearch)的复杂多跳视觉推理和迭代图像检查方面的能力,结果表明当前的先进模型在这些任务上仍然面临显著困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一名侦探来破解一起谜案。在过去,大多数针对人工智能(AI)的“侦探测试”都像是简单的谜语:你给 AI 看一张照片,然后问:“汽车是什么颜色的?”AI 只需要看一眼,猜出颜色,然后就结束了。
但现实世界的调查要难得多。有时候,为了破案,你需要放大鞋子上一个微小的标志,查阅该品牌的历史,找出其工厂的位置,检查那里的天气,然后将所有这些线索串联起来,从而判断谁曾出现在现场。
这篇名为 VistaHop 的论文,旨在构建一个更严苛的测试,以观察 AI 侦探是否真的具备这种深度、多步骤的工作能力。
问题所在:“一瞥即过”的陷阱
作者认为,目前的 AI 测试太简单了。它们就像是给侦探一张照片并问:“图片里有狗吗?”AI 只要扫一眼就会回答“有”。
真正的“视觉深度搜索”(Visual DeepSearch)则完全不同。它要求 AI 能够:
- 仔细观察: 放大图像中的特定部分(例如路牌上的微小文字)。
- 反复跳转: 意识到自己遗漏了线索,再次放大,并观察图片的另一个部分。
- 串联线索: 将它在照片中看到的内容与外部知识(如查询数据库)结合起来,并跨越多个步骤进行处理。
作者指出,现有的测试之所以失败,是因为它们让 AI 通过利用文本线索或在没有真正“看到”细节的情况下进行猜测来“作弊”。
解决方案:VistaHop(“障碍赛”)
为了解决这个问题,团队创建了 VistaHop,这是一个设计得像复杂障碍赛一样的全新基准测试(test suite)。
- 设置: 他们收集了 300 张高质量的照片(例如繁忙的城市街道或博物馆)。
- 任务: 他们设计了 350 个问题,迫使 AI 进行一段漫长的旅程。
- 示例: “观察右下角的橙色集装箱。找到上面的公司标志。查出那家公司是什么时候成立的。现在,找出其总部所在的城市。那个城市是在哪一年建立的?用这两个年份进行相减。”
- 规则: AI 不能仅仅靠猜测。它必须证明自己确实观察了图像的特定部分,找到了标志,并遵循了线索链。如果它试图仅通过问题的文本内容(而不看图像)来回答,测试会识别并拒绝该答案。
他们还构建了 VistaArena,一个可以观察 AI 训练的“健身房”。它允许 AI 使用各种工具,比如放大镜(用于裁剪/放大图像)、搜索引擎(用于查找事实)和计算器。
结果:AI 仍是个新手
作者让目前最智能的 AI 模型(如 SenseNova、GPT-5 和 Gemini)通过了这个障碍赛。
结论是? AI 表现得非常吃力。
- 即便是最优秀的模型,在第一次尝试时也仅能答对约 24% 的问题。
- 当 AI 被迫只能观察图像而不能使用搜索工具时,正确率甚至低于 8%。
- 虽然允许 AI 使用工具(缩放和搜索)后表现有所提升,但当“线索链”变得过长,或者需要观察照片中多个不同位置时,它仍然经常失败。
核心启示
论文总结道,虽然 AI 在“看”图片方面正变得越来越好,但在成为一名持久的调查员方面仍然非常糟糕。它往往过快地放弃,容易遗漏微小细节,或者忘记回到图像中重新检查。
作者开发 VistaHop 并非为了推销产品,而是为了向世界展示:如果我们希望 AI 真正理解复杂的视觉谜团,我们需要更好的测试方法和更好的训练方法。他们公开了数据和代码,以便其他研究人员可以尝试构建更优秀的“侦探”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。