← 最新论文
💬 NLP

WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models

本文介绍了 WebAggregator,这是一个数据合成流程,通过一个精心策划的 1 万条监督微调数据集,将深度研究智能体从以检索为主转向以组成为核心的推理,从而使一个 32B 模型在基准测试中超越顶级系统,并证明对于下一代研究智能体而言,主要瓶颈在于组合式推理而非检索。

原作者: Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文WebAggregator的解读,采用通俗易懂的语言和富有创意的类比。

核心难题:“谷歌搜索员”与“侦探”的对立

想象你正在招聘一名研究助理。

  • 旧模式(当前 AI 智能体): 你问他们:“谁获得了 2024 年的奖项?”他们立刻打开浏览器,将问题输入 Google,找到列表,并指出排名第一的名字。这是信息检索。这很快,但就像鹦鹉学舌。如果答案需要连接来自三个不同网站的三个不同事实来解开谜题,这只“鹦鹉”就会陷入混乱。
  • 新目标(深度研究): 你问:“在所有面积超过 200 万平方公里的国家中,2010 年至 2020 年间哪一个国家的经济波动最大?”要回答这个问题,智能体不能仅仅“找到”答案。它必须:
    1. 找到大国列表。
    2. 查找每个国家的经济数据。
    3. 进行复杂的数学计算以得出“波动性”。
    4. 比较结果。
      这是组合推理。这就像侦探拼凑线索以解开谜团,而不仅仅是阅读标题。

该论文认为,当前的 AI 智能体非常擅长充当“谷歌搜索员”,但极不擅长充当“侦探”。它们过度依赖找到正确的链接,而不足于深入思考所发现的内容。

解决方案:WebAggregator(“训练健身房”)

为了解决这个问题,研究人员构建了一个名为WebAggregator的系统。不要将其视为一种新的 AI,而应将其视为一个专门的训练营,旨在将“谷歌搜索员”转变为“侦探”。

该系统分为两个主要阶段,就像两人团队共同编制一份高难度试卷:

  1. 主动探索者(拾荒者):
    想象一个机器人被派往一座巨大的图书馆,只带有一本书。它的任务是打开那本书,找到对另一本书的引用,前往那本书,找到一张照片,下载一个文件,并点击一个隐藏的按钮。它从整个网络收集了大量分散且杂乱的信息。

    • 在论文中: 该智能体访问真实网站,下载文件,并导航复杂页面以收集原始数据。
  2. 组合逻辑提议者(谜题大师):
    一旦“拾荒者”收集了数据堆,“谜题大师”就会审视这些数据并说:“好吧,基于这一堆混乱信息,让我们创建一个无法仅通过查看单页就能回答的问题。”

    • 他们使用一套严格的规则(12 种逻辑类型),强制问题需要数学计算、筛选、比较和时间旅行(时间推理)。
    • 示例: 他们不问“中国的 GDP 是多少?”,而是问“计算过去十年中国 GDP 增长率与其城市化率相比的标准差。”

成果:新数据集与更智能的 AI

团队利用该系统创建了WebAggregatorQA,这是一个包含约 10,000 个极难问题的数据集。随后,他们利用这些问题训练了一个新的 AI 模型(称为WebAggregator)。

以下是他们测试该新模型时的结果:

  • “检索陷阱”: 研究人员将这些难题测试了顶级 AI 模型(如 GPT-4.1 和 Claude-3.7)。即使他们向模型提供了解决问题所需的所有正确网站和文档,模型仍然失败了。

    • 隐喻: 这就像给一名学生一本教科书,其中标出了确切答案,但他们仍然无法解决数学题,因为他们不懂如何进行计算。
    • 发现: 瓶颈不在于找到信息,而在于对其进行推理
  • 转变: 当他们在 WebAggregator 数据集上训练模型时,智能体的行为发生了改变:

    • 之前: 他们疯狂地点击按钮和打开链接(高工具使用率,低思考)。
    • 之后: 他们点击更少的按钮,但花更多时间进行“思考”(内部推理)以连接线索。
    • 表现: 新的WebAggregator-32B模型在这些高难度推理任务中击败了现有最佳模型,证明了通过“侦探工作”进行训练能使 AI 更聪明。

结语

该论文得出结论,为了让 AI 真正成为能够进行科学发现的“深度研究”智能体,我们需要停止关注其搜索网络的能力有多强。相反,我们需要关注其将分散的信息片段拼接起来以形成逻辑结论的能力有多强。

简而言之: 该论文建立了一个健身房,让 AI 智能体利用真实网络数据练习解决复杂谜题。其结果是一个智能体,它不再是一个 frantic 的网络冲浪者,而更像是一位深思熟虑、逻辑严密的研究人员。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →