← 最新论文
🤖 AI

SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation

SearchEyes 引入了一个基于类型化知识图谱构建的统一模拟搜索世界,该世界通过感知-知识链(Perception-Knowledge Chains)和跳跃锚定策略优化(Hop-Anchored Policy Optimization)将数据、环境和奖励信号进行整合,从而使多模态搜索智能体在不依赖外部引擎或独立奖励模型的情况下,实现最先进的多跳推理性能。

原作者: Zhengbo Jiao, Yiming Cheng, Yilei Jiang, Kaituo Feng, Rui Huang, Tianyi Jiang, Juanxi Tian, Jiapeng li, Qunzhong Wang, Tailai Chen, Qianshan Wei, Chuan Xiao, Shanyu Rong, Yangfu Li, Yanhan Zhou, Yunpu
发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengbo Jiao, Yiming Cheng, Yilei Jiang, Kaituo Feng, Rui Huang, Tianyi Jiang, Juanxi Tian, Jiapeng li, Qunzhong Wang, Tailai Chen, Qianshan Wei, Chuan Xiao, Shanyu Rong, Yangfu Li, Yanhan Zhou, Yunpu Ma, Yifan Zhang, Xiangyu Yue

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明的机器人如何破解复杂的谜题。这个机器人需要观察一张图片,阅读一些文档,然后将这些线索串联起来找到答案。这就是论文中所说的“多模态搜索智能体”(multimodal search agent)。

然而,作者们发现,我们通常教导这些机器人的方式是存在缺陷的。这就像是试图通过给一个人地图、一辆车和一场驾驶测试来教他开车,却确保这三者完全不匹配:

  • 地图(训练数据): 你给了他们问题和答案的列表,但却把“如何做”的具体步骤给扔掉了。
  • 车(环境): 你让他们在一条真实且不可预测的公共道路(实际的互联网)上驾驶,那里的红绿灯可能会变,或者路段可能会消失。
  • 测试(奖励): 你只在最后才告诉他们“做得好”或“做得不好”。如果机器人在第1步犯了错,但在第10步靠运气得到了答案,它依然会得到一个“做得好”的评价。它们永远无法学会到底是在哪里出了错。

SearchEyes 通过构建一个完美的、自包含的模拟系统解决了这个问题,在这个系统中,地图、车和测试都是根据同一个蓝图构建的。

以下是他们是如何实现的,使用了简单的类比:

1. 蓝图:“类型化”知识图谱

他们没有使用混乱的真实互联网,而是构建了一个巨大的、有组织的知识库,称为知识图谱。你可以把它想象成一个庞大的世界信息家族树,但有着严格的规则:

  • 每个人物(实体)都有照片、传记和关系列表。
  • 他们只保留那些同时拥有三要素(照片、传记和连接关系)的“名人”,以便机器人可以练习观察图片以及阅读文本。

2. 训练课程:“感知-知识链”(PKC)

为了训练机器人,他们并没有随机编写问题。他们使用了一种特殊的配方,叫做感知-知识链(Perception-Knowledge Chains, PKC)

  • 类比: 想象一场寻宝游戏,你必须在观察照片和阅读线索之间交替进行。
    • 第1步(感知): “看这张男人的照片。他是谁?”(机器人必须通过图像识别出这个人)。
    • 第2步(知识): “现在,查一下他曾效力过哪支球队。”(机器人必须进行文本搜索)。
    • 第3步(感知): “找到那支球队主场球场的照片。”
  • 神奇之处: 系统会自动生成这些问题,但在后台保留了一份“作弊条”(即事实的精确路径)。这确保了机器人必须走完这条长长的、多步骤的路径来解开谜题,而不是直接猜出答案。

3. 驾驶模拟器:“自包含的搜索世界”

在现实世界中,如果你向搜索引擎询问某事,搜索结果明天可能会发生变化。但在 SearchEyes 的世界里,“搜索引擎”实际上只是他们构建的图书馆中一个巨大的、预加载的数据库。

  • 优势: 它是100%可复现的。如果机器人搜索“C罗”,它总是会得到完全相同的排名前5的结果。这消除了真实互联网的混乱,让机器人可以在不被断开的链接或变化的网站干扰的情况下,学习搜索的逻辑。

4. 教练:“跳跃锚定”反馈(HaPO)

这是最重要的创新。在常规训练中,教练只在最后说“你答对了!”

  • 问题: 如果机器人走了10步才到达终点,教练并不知道哪一步是精彩的表现,哪一步是靠运气猜对的。
  • SearchEyes 的解决方案: 因为他们保留了“作弊条”(事实的精确路径),所以他们可以像一位全程观察每一步的教练一样:
    • “在第3步找到球场照片做得真棒!”
    • “哎呀,你在第2步选错了球队。让我们再试一次。”
  • 隐喻: 这不是用一个总分来评判整场考试,而是为考试中的每一个问题都给出评分。这有助于机器人更快地学习,因为它们清楚地知道在哪里可以改进。

结果

当他们用这种新方法(称为 SearchEyes)在六个涉及图片和文本的不同高难度测试中进行测试时:

  • 它击败了所有尝试做同样事情的开源机器人。
  • 他们的较小规模机器人(270亿个“脑细胞”)表现得比大型科技公司那些更庞大、更昂贵的机器人还要好。
  • 它证明了,通过提供结构化的、循序渐进的训练世界和精确的反馈,你不需要一台巨大的超级计算机就能获得卓越的结果。

简而言之: SearchEyes 停止了通过将机器人扔进混乱的真实互联网来教学。相反,他们构建了一个完美的、受控的训练健身房,在这里,机器人练习特定的技能,每一步动作都会得到评分,并能以惊人的效率学习如何破解复杂的视觉谜题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →