From Web to Pixels: Bringing Agentic Search into Visual Perception
本文提出了“感知深度研究”这一新的开放世界视觉感知挑战,要求先通过外部知识识别物体再进行定位,并借助 WebEye 基准测试和 Pixel-Searcher 智能体框架加以解决,该框架在基于搜索的接地、分割和视觉问答任务中展现了最先进的开源性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在玩“威利在哪里?”(或“沃利在哪里?”)的游戏,但规则有所改变。
在经典游戏中,你观察一张拥挤的图片,根据威利的样貌找到他:一件红白条纹衬衫、一顶帽子和一副眼镜。你不需要知道威利“是谁”;你只需要识别出视觉模式。
本文认为,大多数当前的人工智能视觉系统仍被困在经典游戏的玩法中。 它们非常擅长寻找看起来像“红色汽车”或“穿蓝色衬衫的人”的物体。但当问题不在于某物“看起来”像什么,而在于基于图片中无法看见的事实判断它“是谁”时,它们就会陷入困境。
新挑战:“神秘嘉宾”
作者们引入了一种名为**感知深度研究(Perception Deep Research)**的更困难的新游戏版本。
想象一张拥挤派对的合影。问题不再是“找出穿红色衬衫的人”。相反,问题是:
“找出在 2026 年 1 月,在该护肤品牌被一家公司以 27 亿美元收购后,成为该品牌全球大使的人。”
你无法仅通过查看照片来解决这个问题。照片并未显示收购的价格标签或大使任命的日期。要找到正确的人,人工智能必须:
- 进行网络搜索: 搜索互联网,查明是哪个品牌被收购、在哪个月份被收购,以及大使是谁。
- 解开谜团: 意识到“啊,照片中名叫‘温特(Winter)’的人就是我们要找的目标。”
- 定位像素: 最后,回到照片,在温特周围画出一个方框。
本文将这一过程称为**“从网络到像素(From Web to Pixels)”**。它关乎将互联网上的事实与图像中的特定位置联系起来。
他们构建的工具
为了测试人工智能能否做到这一点,团队主要构建了两样东西:
1. WebEyes(测试赛道)
将其想象为人工智能的专用障碍赛道。它包含 120 张复杂图像和数百个棘手问题。
- 规则改变: 每个问题都要求人工智能在猜测图像中该看哪里之前,先查阅隐藏的事实(例如名人的近期角色、产品的发布日期或角色的背景故事)。
- 目标: 人工智能不仅要回答问题,还必须指出图片中与答案完全匹配的具体人物或物体。
2. Pixel-Searcher(智能侦探)
这是作者们创建的用于参加测试的新人工智能代理。它不仅仅是盯着图像猜测,而是像一位手持放大镜和笔记本电脑的侦探那样行动。
- 第一步:搜索。 它将问题分解。“大使是谁?”“交易发生在何时?”它搜索网络并阅读结果。
- 第二步:推理。 它将线索串联起来。“好的,交易发生在 1 月,大使是温特。”
- 第三步:搜寻。 它回到图像中。它寻找一个“看起来”像温特的人(可能会检查搜索中提到的特定服装或特征),并在其周围画出一个方框。
他们的发现
研究人员将 Pixel-Searcher 与其他智能人工智能模型进行了测试。以下是裁决结果:
- 旧的人工智能模型: 当面对这些“神秘嘉宾”问题时,标准的人工智能模型会感到困惑。它们试图仅根据在图片中看到的内容或从训练中已经“知道”的内容来猜测。由于无法找到隐藏的事实,它们经常选错人。
- Pixel-Searcher: 在开源模型中,这一新代理的表现最佳。通过实际搜索网络并推理线索,它成功找到正确目标的频率要高得多。
它仍然存在的困难:
论文指出,人工智能的失败并非因为它无法在人物周围画出完美的方框。它在更早的阶段就失败了:
- 搜索失误: 它有时会搜索错误的信息或遗漏关键事实。
- 身份误判: 它得出了正确的事实,但在照片中认错了人(例如,它知道大使是“温特”,但它指向了照片中另一个名叫温特的错误人物)。
- 绑定困难: 它难以将“事实”(温特)与“视觉”(照片中的人)联系起来。
宏观视角
论文得出结论:为了让人工智能真正理解世界,它不能仅仅是一个能看见形状的“相机”。它需要成为一个能够查阅信息、解决谜题,并利用这些知识在图片中指出正确事物的“研究员”。他们将这一新领域称为感知深度研究(Perception Deep Research),并提供了工具(WebEyes 和 Pixel-Searcher),以帮助其他科学家构建更优秀的“侦探”型人工智能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。