InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
本文介绍了 InterLV-Search,这是一个针对交错多模态代理搜索的综合基准与评估框架,它凸显了现有系统在动态整合文本与视觉证据以应对主动搜寻、受控离线及开放网络搜索场景方面存在的显著局限。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图解开一个复杂的谜团,比如根据一系列线索寻找特定的人。
旧方法(现有基准测试):
大多数当前的 AI“侦探”都是这样训练的:你给它们一张嫌疑人的照片,然后问“这是谁?”或“他们的帽子是什么颜色?”。AI 查看照片并作答。如果照片信息不足,AI 可能会在互联网上搜索关于此人的文字,但它将照片仅视为起点或最终答案。它很少利用在调查中途发现的照片来改变其方向。这就像一名侦探查看了一张犯罪现场照片,然后只是阅读了一篇报纸文章,却从未意识到报纸第 3 页上发现的一张新照片实际上将他们引向了完全不同的城市。
新方法(InterLV-Search):
这篇名为"InterLV-Search"的论文作者建立了一个新的训练场(基准测试),以测试 AI 是否能完成一项更困难的任务:交错多模态代理搜索。
将其想象成一名侦探,必须不断在查看地图(文本)和查看照片(图像)之间切换,以破解案件。
- 转折点: AI 发现一张照片,查看后意识到:“哦!照片中这栋建筑上的标志告诉我,我需要搜索一个特定的品牌名称。”随后它搜索该品牌,找到一张新汽车照片,看到车牌,而那个车牌又指示它去搜索一个特定的城市。
- 目标: 照片不仅仅是答案;照片是方向盘。它告诉 AI 下一步该驶向何方。
三个难度等级
该论文在三个等级上测试 AI,就像难度递增的电子游戏:
等级 1:“寻找图片”挑战。
- 任务: AI 被给予一段文字描述,例如“找到包含这艘海盗船的游戏”。它必须弄清楚这艘船是什么,搜索它,找到图片,然后回答关于该图片的问题(例如,“这艘船使用什么引擎?”)。
- 比喻: 你被给予一个关于隐藏物体的谜语。你必须先找到该物体,然后才能回答谜语。
等级 2:“受控迷宫”挑战。
- 任务: AI 处于一个封闭房间(受控的离线数据库)中,拥有一张地图。它从一个文字线索开始,找到一张图片,该图片提供新线索,接着找到另一张图片,如此循环。
- 比喻: 想象一场寻宝游戏,找到一张红门的图片会引导你到一个关于蓝色汽车的文字线索,进而引导你找到一张黄鸟的图片。AI 必须利用门的图片来决定去寻找那辆车。如果它忽略图片而只是继续阅读文字,它就会迷路。
等级 3:“狂野互联网”挑战。
- 任务: 现在 AI 置身于真实、混乱的互联网中。它必须搜索线索,找到照片,意识到某些照片是虚假的或无关的,比较不同的路径(例如,“这部电影是 60 分钟还是 90 分钟?”),并选择正确的路径继续前进。
- 比喻: 这就像一名侦探试图利用整个互联网破案。他们必须筛选数百万个网站,其中一些网站照片质量差,一些网站日期错误,他们必须根据在图像中看到的内容来决定遵循哪条路径。
他们发现了什么?
作者使用这项新测试对许多最聪明的 AI 模型(如 GPT-5、Gemini 和 Claude)进行了测试。
- 结果: 目前的 AI 模型在此方面非常糟糕。即使是最好的模型,答对的答案也不到 50%。
- 问题: AI 模型擅长阅读文本,也擅长查看单张图片。但是,当搜索中途发现的照片需要改变整个搜索计划时,它们难以将点连成线。它们经常在应该查看照片时却陷入寻找文字的困境,或者将照片仅视为“最终检查”而非“新线索”。
工具包(InterLV-Agent)
为了确保所有人都在相同的规则下游戏,作者构建了一个标准的“游戏控制器”,称为InterLV-Agent。该工具允许 AI 使用网络浏览器、搜索图片、裁剪图片,并保留一个关于其迄今为止发现内容的“笔记本”(记忆)。这确保了当我们说 AI 失败时,是因为它无法解决谜题,而不是因为它没有合适的工具。
总结
简而言之,这篇论文指出:“我们为 AI 侦探构建了一个更难的新测试。我们发现,虽然 AI 正变得越来越聪明,但它仍然无法有效地利用在搜索过程中发现的照片来改变主意并找到下一个线索。这就像一名侦探能够阅读地图并查看照片,却无法理解照片实际上指示他们走另一条路。”
作者已发布该测试和工具,以便其他研究人员尝试构建更擅长这种“交错”式思维的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。