← 最新论文
🤖 AI

Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning

本文介绍了 Visual-Seeker,一种视觉原生多模态智能体搜索系统,它通过利用主动视觉推理和由 5,000 条高质量轨迹组成的合成数据集,通过动态采集细粒度视觉证据,在复杂的开放世界搜索任务中实现了最先进的性能。

原作者: Zhengbo Zhang, Changtao Miao, Jinbo Su, Zhaowen Zhou, Chunxia Zhang, Xukai Wang, Ruiqi Liu, Kaiyuan Zheng, Jiansheng Cai, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengbo Zhang, Changtao Miao, Jinbo Su, Zhaowen Zhou, Chunxia Zhang, Xukai Wang, Ruiqi Liu, Kaiyuan Zheng, Jiansheng Cai, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图破解一个谜题,但你不是通过阅读纸上的线索,而是必须在一张混乱、拥挤的照片中寻找答案。

问题所在:“盲视”侦探
目前的 AI 侦探(被称为多模态大语言模型)擅长阅读文本和观察简单的图片。但当它们面对复杂的现实世界照片时——比如挤满了人的体育场,或是细节极其微小的电影海报——它们往往会感到困惑。它们可能知道篮球运动员长什么样,但很难在模糊的人群照片中精准找到那个穿着 45 号球衣的特定球员。

此外,当这些 AI 尝试在互联网上搜索答案时,它们通常将图片视为一个静态的“快照”。它们看一眼图片,提出一个文本问题,然后就停止了。它们不知道如何放大、裁剪特定的面部,也不知道如何主动搜寻新的图片来与原图进行对比。它们就像一个侦探,只看了一眼犯罪现场的照片,然后就闭上眼睛,凭记忆猜测答案。

解决方案:Visual-Seeker
这篇论文的作者构建了一个全新的 AI 智能体,名为 Visual-Seeker。你可以把 Visual-Seeker 想象成一个不只是盯着照片看,而是会主动进行“调查”的侦探。

Visual-Seeker 不仅仅是凝视图像,它会:

  1. 放大细节: 它可以捕捉微小的细节,比如帽子上羽毛的颜色或球衣上的数字。
  2. 搜寻证据: 如果照片不够清晰,它知道去互联网上搜索“官方 DVD 封面”或“球队合影”,并下载新图像来与原图进行对比。
  3. 串联线索: 它将从新图像中看到的内容与原始问题结合起来,从而解开谜题。

他们是如何教它的:“训练模拟器”
你不能只是告诉一个 AI “要看得更准”。你必须向它展示如何去做。研究人员构建了一个特殊的训练工厂(称为“主动视觉推理数据流水线”)。

想象一位游戏设计师正在为新兵设计一门训练课程:

  • 第 1 步(目标): 他们拿出一张杂乱的现实世界照片,并要求 AI 找出特定的某个人或物体(例如:“找到那个穿粉色衬衫的家伙”)。
  • 第 2 步(踪迹): 他们创造了一条虚假的“寻宝路径”。AI 必须从一个事实跳转到另一个事实,就像侦探追踪线索一样。
  • 第 3 步(转折): 至关重要的一点是,他们强迫 AI 意识到仅靠文本是不够的。他们在训练中注入了“视觉证据”。他们让 AI 意识到:“嘿,你不能只靠阅读来回答;你需要去找一张帽子的照片,才能看清它的颜色!”

他们创建了 5,000 个这样的复杂训练场景,以此来教会 AI 如何成为一个主动的搜索者,而非被动的阅读者。

结果:新晋冠军
当他们用 Visual-Seeker 与其他顶尖 AI 模型(包括来自大型科技公司的昂贵专用模型)进行测试时,它赢了。

  • 它不只是在瞎猜;它真的会出去寻找正确的图片,并放大细节进行观察。
  • 它的表现优于那些“仅限文本”的专家,甚至击败了一些目前最强大的“多模态”模型。
  • 它证明了,如果你赋予 AI 主动“观察”和“搜索”视觉线索的工具,它在解决现实世界谜题时会变得聪明得多。

简而言之
以前的 AI 就像是那些背下了教科书却无法应对混乱现实考试的学生。Visual-Seeker 则是那个带着放大镜、地图和相机的学生,它会通过主动收集证据来逐步解决问题。这篇论文表明,这种“主动观察”的方法是让 AI 在视觉世界中真正变得聪明的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →