← 最新论文
🤖 AI

From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution

本文介绍了一个包含 31 个主题、500 个自动生成任务的可验证深度研究基准,该基准通过一个迭代的“探索者-形式化者-挑战者”流水线构建,将简单问题转化为以有向无环图表示的复杂查询,并设有可追踪的检查点,以实现细粒度且符合人类对齐标准的评估。

原作者: Can Wang, Haoran Chen, Haowen Gao, Hao Ding, Zhaoyang Liu, Zhiying Tu

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Can Wang, Haoran Chen, Haowen Gao, Hao Ding, Zhaoyang Liu, Zhiying Tu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术总结:从简单问答到深度研究

问题陈述

深度研究任务要求 AI 智能体超越简单的事实检索,转向整合领域知识、执行多步推理并生成高质量的开放式响应。然而,为这些任务构建可靠的基准测试具有挑战性。现有的基准测试通常依赖于昂贵的专家编写或预先存在的材料,这限制了其可扩展性。相反,全自动构建方法往往难以确保一致且可追溯的验证,并且往往缺乏进行细粒度评估所需的特定任务知识。目前的自动方法要么进行相对比较(基于报告相似度的排名),要么生成的评估准则缺乏可靠性和专业质量保证。本文解决的核心挑战是如何在不依赖人工专家编写的情况下,构建一个多样化的专业深度研究任务集,并配备可靠且有据可查的准则。

方法论

本文介绍了一种以迭代式“探索者—形式化器—挑战者”循环为核心的全自动基捷构建流水线。该流水线通过逐步将简单的查询转化为复杂的深度研究任务。

1. 任务表示

任务的核心结构表示是有向无环图 (DAG)

  • 节点: 代表原子研究步骤,分为证据型(检索可追溯的事实)或分析型(进行推理或比较)。
  • 边: 代表步骤之间的逻辑依赖关系。
  • 检查点: 每个节点包含源自智能体与环境交互的可验证检查点。
    这种结构使得求解过程是显式的、可分解且可追溯的。

2. 构建流水线

该流水线通过三个角色迭代,将简单查询 q1q_1 演变为深度研究任务 qTq_T

  • 探索者 (Explorer): 在开放环境中利用工具(如搜索、网页抓取)解决当前查询。它产生一条包含探索信息、证据和分析的轨迹。这一步旨在挖掘长尾、稀疏的知识,这些知识只有在搜索意图被细化时才会被发现。
  • 形式化器 (Formalizer): 解析探索者的轨迹,以更新任务 DAG (GG) 并推导出相应的验证准则集 (RR)。
    • 它将轨迹组织成一个 DAG,确保该图足以回答查询且保持极简(移除无关节点并合并语义等价的节点)。
    • 它为每个节点生成基于所发现特定证据的点对点准则。
    • 它根据 DAG 结构为节点分配权重(将权重从叶子节点传播到根节点),以反映不同研究步骤的相对重要性。
  • 挑战者 (Challenger): 识别轨迹中已探索但未使用的、且在逻辑上仍与任务相关的线索。它利用这些“未使用”的方向来生成下一轮更难的查询 (qt+1q_{t+1}),从而有效地扩展任务的范围(宽度)或推理深度。至关重要的是,它会掩盖特定的检查点,以防止新查询泄露解题路径。

停止准则: 当 DAG 结构(节点和边)连续两轮保持不变时,演化停止,这表明任务已达到饱和点,即不再有进一步的相关知识可以被整合。

3. 查询设计

从最终收敛的任务中,生成三种不同的查询形式,以探测互补的能力:

  • 带提示查询 (qThq^h_T): 包含分析维度和约束条件的完整复杂查询。测试在丰富线索下的信息处理能力。
  • 无提示查询 (qToq^o_T): 从复杂查询中衍生出的简洁、日常化的问题,去除了约束条件。测试在隐藏约束下的分解与规划能力。
  • 指定主题查询 (qTaq^a_T): 一个陈述性的研究标题。测试在没有明确问题框架的情况下,在定向主题下的论证构建能力。

核心贡献

  1. 一个可验证的基准测试: 作者构建了一个包含 500 个深度研究任务的基准测试,涵盖 31 个主题和 10 个主要类别。每个任务都配有基于事实的点对点准则以及上述三种查询形式。
  2. 全自动构建流水线: 他们引入了一种新型流水线,通过迭代将简单查询扩展为原子步骤的 DAG。这种方法使得查询、任务结构和准则能够共同演进,无需人工编写或预先编写的专家材料。
  3. 细粒度评估: 该基准测试证明,其准则能够实现稳定、符合人类认知且细粒度的评估,比二元判断或相对排名更能有效区分模型性能。

实验结果

实验在 10 个流行模型(包括 GPT-5.6、Claude Sonnet 5、DeepSeek-V4-Pro 及各类 Qwen 版本)下进行,分为两种设置:智能体模式(使用工具)和模型模式(仅限内部知识)。

  • 判别力: 该基准测试能清晰地判别不同能力的模型。更强的模型(如 GPT-5.6 Terra)在所有查询类型下均持续优于较弱的模型。
  • 能力梯度: 分数呈现连续分布而非聚集,表明其准则提供了细粒度的等级满意度。
  • 工具的影响: 去除工具导致所有模型和查询类型的性能显著下降(平均下降 0.14),证实了这些任务编码了预训练数据中不存在的长尾信息。
  • 查询类型敏感性: 模型在不同查询类型中表现出不同的强项。例如,在较弱的提示(qToq^o_T)下,性能差距向分析推理转移,揭示了较小的模型在分解宏大目标和整合证据方面更为困难。
  • 人类对齐: 对 100 个采样任务的人类评审显示出高质量(无“差评”)以及评审者之间的高度一致性。此外,LLM 进行的自动化评判与人类评分显示出高相关性(Pearson r0.90r \approx 0.90),验证了所生成准则的可靠性。

意义

本文声称其主要意义在于解决了深度研究基准的需求与在没有人类专家的情况下难以可靠构建之间的矛盾。通过展示一种迭代的、由智能体驱动的过程可以生成带有可追溯、可验证准则的任务,这项工作为评估下一代 AI 智能体提供了一条可扩展的路径。该基准测试提供了一个稳定、细粒度的指标,用于评估深度研究能力,揭示了当前模型中的特定弱点(例如,在没有明确引导的情况下无法发现隐藏目标或整合证据),而这些弱点是现有基准测试无法捕捉到的。作者认为,使用前沿模型进行流水线构建的成本是为社区建立可靠资源所必须的投资。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →