DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research Agents
该论文介绍了 DeepSearchQA,这是一个涵盖 17 个领域的 900 个提示词基准测试,旨在评估深度研究智能体在复杂、多步骤信息寻求任务中的表现,并揭示了即使是尖端模型在系统化信息整理、实体解析和停止标准方面也难以平衡召回率与精确度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一名研究助理来为你寻找信息。过去,我们大多用简单的问题来测试这些助手,比如“法国的首都是哪里?”如果他们答对了,就算通过;如果答错了,就算失败。这就像是一场选择题考试:容易评分,但它无法告诉我们这个助手是否能够处理一个真正的、复杂的研究项目。
论文 "DeepSearchQA" 引入了一种全新的、难度更高的测试,旨在观察 AI 智能体是否能像真正的研究员一样工作,而不仅仅是百科知识机器人。
以下是他们所做的工作以及他们的发现,使用了简单的类比:
1. 问题所在:“大海捞针” vs. “整堆干草”
旧的测试要求 AI 在干草堆中寻找一根特定的针(例如,“法国的首都是哪里?”)。
- 问题在于: 现实生活并不像那样。有时你需要知道干草堆里的每一根针,或者列出干草的所有不同类型。
- 新的挑战: DeepSearchQA 会提出这样的问题:“列出所有销量超过 1 亿台、非便携式、拥有 32 位 CPU,且其母公司在 2010 年资产超过 1.7 万亿美元的游戏机。”
- 目标: AI 不能只靠猜测一个答案。它必须构建一个完整且完美的列表。如果它漏掉了一项,那就是不完整的;如果它增加了一个虚假项,那就是不准确的。
2. 测试的三项硬技能
要通过这项新测试,AI 智能体需要掌握三项旧测试忽略了的困难技能:
- 技能 1:图书管理员(系统性整理)
想象一下,你需要写一份报告,但信息散落在 50 个不同的网站上,没有一个网站拥有完整的故事。AI 必须访问所有这些网站,阅读它们,并将碎片拼接成一个总清单。它不能仅仅依赖它找到的第一个网站。 - 技能 2:侦探(实体消解)
想象你在寻找“苹果(Apple)”。一个网站说“苹果公司(Apple Inc.)”,另一个说“苹果电脑(Apple Computer)”,第三个说“史蒂夫·乔布斯创立的公司”。人类知道这些都是同一家公司。AI 则经常会感到困惑,并将其列为三家不同的公司。这项测试检查 AI 是否能意识到它们是同一个东西并去除重复项。 - 技能 3:停止信号(关于停止的推理)
这是最难的部分。在普通的搜索中,当你找到答案时,你就停止了。但在“深度研究”任务中,没有终点线。AI 必须知道何时停止搜索。- 过早停止: 它在找到所有答案之前就停止了(检索不足)。
- 过晚停止: 它不停地搜索,并开始编造答案来填补列表(过度检索/回避行为)。这就像一位厨师不断往汤里加料,直到汤的味道变得糟糕,只为了确保自己没有漏掉任何东西。
3. 测试:900 个真实场景
研究人员创建了一个名为 DeepSearchQA 的基准测试,包含 17 个不同领域(如医疗、金融、历史和游戏)的 900 个难题。
- 规则: 答案基于静态事实(如 2020 年的人口普查数据),因此在测试运行期间不会发生变化。
- 评分: 他们不在乎 AI 是如何找到答案的(它采取的路径)。他们只关心最终的列表。它是否 100% 正确地得到了这个列表?
- 完美: 列表完全正确。
- 部分正确: 它对了一些,但漏掉了一些。
- 幻觉: 它得到了正确的项,但也增加了虚假的项以显得详尽。
4. 他们的发现:“最后一英里”问题
他们测试了目前最智能的 AI 模型(如 Google 的 Gemini Deep Research 和 OpenAI 的 GPT-5 Pro)。结果如下:
- 好消息: 最优秀的 AI 智能体正变得非常擅长此道。顶尖模型能做到约 66% 的列表完全正确。这比旧模型有了巨大的飞跃。
- 坏消息: 即便是最好的模型也在“最后一英里”问题上挣扎。
- 差距: 一个 AI 可能会找到 90% 的正确答案(高召回率),但却无法停止,从而在列表中加入了 5 个错误的答案。这会毁掉整个分数。
- “回避陷阱”: 当 AI 不确定是否已经完成时,它会尝试通过列出它能想到的所有事物来表现得稳妥,包括那些它不确定的事物。这就像一个学生为了拿部分分数而在考试中瞎猜,但在这种情况下,这反而降低了他们的成绩。
- “阶梯式”下跌: 如果你使用较小、较便宜的 AI 模型,性能并不会只是小幅下降,而是会直接崩溃。这些复杂的任务需要一定的“脑力”来进行搜索规划。一旦低于某个阈值,AI 就会立刻迷失方向,什么也找不到。
5. 结论
论文认为我们正处于一个转折点。我们已经从询问 AI “答案是什么?”转向了“你能掌握整个主题吗?”
目前的 AI 模型足够聪明,可以找到那根针,但它们仍在学习如何绘制整堆干草的地图而不至于迷失方向或编造内容。DeepSearchQA 是一个帮助研究人员解决这一特定问题的工具:教导 AI 何时停止搜索,以及如何做到完美彻底而不显得草率。
简而言之: 我们正在教 AI 从一名百科知识冠军,成长为一名专业的调研员,能够处理复杂的、多步骤的调查,且不会掉链子。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。