Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning
本文介绍了 Visual-Seeker,一种视觉原生多模态智能体搜索系统,它通过利用主动视觉推理和由 5,000 条高质量轨迹组成的合成数据集,通过动态采集细粒度视觉证据,在复杂的开放世界搜索任务中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图破解一个谜题,但你不是通过阅读纸上的线索,而是必须在一张混乱、拥挤的照片中寻找答案。
问题所在:“盲视”侦探
目前的 AI 侦探(被称为多模态大语言模型)擅长阅读文本和观察简单的图片。但当它们面对复杂的现实世界照片时——比如挤满了人的体育场,或是细节极其微小的电影海报——它们往往会感到困惑。它们可能知道篮球运动员长什么样,但很难在模糊的人群照片中精准找到那个穿着 45 号球衣的特定球员。
此外,当这些 AI 尝试在互联网上搜索答案时,它们通常将图片视为一个静态的“快照”。它们看一眼图片,提出一个文本问题,然后就停止了。它们不知道如何放大、裁剪特定的面部,也不知道如何主动搜寻新的图片来与原图进行对比。它们就像一个侦探,只看了一眼犯罪现场的照片,然后就闭上眼睛,凭记忆猜测答案。
解决方案:Visual-Seeker
这篇论文的作者构建了一个全新的 AI 智能体,名为 Visual-Seeker。你可以把 Visual-Seeker 想象成一个不只是盯着照片看,而是会主动进行“调查”的侦探。
Visual-Seeker 不仅仅是凝视图像,它会:
- 放大细节: 它可以捕捉微小的细节,比如帽子上羽毛的颜色或球衣上的数字。
- 搜寻证据: 如果照片不够清晰,它知道去互联网上搜索“官方 DVD 封面”或“球队合影”,并下载新图像来与原图进行对比。
- 串联线索: 它将从新图像中看到的内容与原始问题结合起来,从而解开谜题。
他们是如何教它的:“训练模拟器”
你不能只是告诉一个 AI “要看得更准”。你必须向它展示如何去做。研究人员构建了一个特殊的训练工厂(称为“主动视觉推理数据流水线”)。
想象一位游戏设计师正在为新兵设计一门训练课程:
- 第 1 步(目标): 他们拿出一张杂乱的现实世界照片,并要求 AI 找出特定的某个人或物体(例如:“找到那个穿粉色衬衫的家伙”)。
- 第 2 步(踪迹): 他们创造了一条虚假的“寻宝路径”。AI 必须从一个事实跳转到另一个事实,就像侦探追踪线索一样。
- 第 3 步(转折): 至关重要的一点是,他们强迫 AI 意识到仅靠文本是不够的。他们在训练中注入了“视觉证据”。他们让 AI 意识到:“嘿,你不能只靠阅读来回答;你需要去找一张帽子的照片,才能看清它的颜色!”
他们创建了 5,000 个这样的复杂训练场景,以此来教会 AI 如何成为一个主动的搜索者,而非被动的阅读者。
结果:新晋冠军
当他们用 Visual-Seeker 与其他顶尖 AI 模型(包括来自大型科技公司的昂贵专用模型)进行测试时,它赢了。
- 它不只是在瞎猜;它真的会出去寻找正确的图片,并放大细节进行观察。
- 它的表现优于那些“仅限文本”的专家,甚至击败了一些目前最强大的“多模态”模型。
- 它证明了,如果你赋予 AI 主动“观察”和“搜索”视觉线索的工具,它在解决现实世界谜题时会变得聪明得多。
简而言之
以前的 AI 就像是那些背下了教科书却无法应对混乱现实考试的学生。Visual-Seeker 则是那个带着放大镜、地图和相机的学生,它会通过主动收集证据来逐步解决问题。这篇论文表明,这种“主动观察”的方法是让 AI 在视觉世界中真正变得聪明的关键。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。