Can Deep Research Agents Retrieve and Organize? Evaluating the Synthesis Gap with Expert Taxonomies
本文介绍了 TaxoBench,这是一个证明了当前的深度研究智能体在检索核心论文以及将其组织成连贯分类体系方面,均显著落后于人类专家,从而揭示了其在检索准确性和层级结构综合能力方面的明显瓶颈的基准测试。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图为一座庞大且混乱的图书馆编写一本终极指南书。你不仅需要找到这些书,还需要弄清楚如何将它们在书架上进行编排,以便读者能够理解该领域的脉络。这就是“综述”(survey)的任务——它是一种总结我们对特定主题已知信息的学术论文。多年来,科学家们一直希望人工智能(AI)能自动完成这项繁重的体力活。他们构想出了“深度研究智能体”(Deep Research Agents)——超级聪明的 AI 机器人,它们可以搜寻互联网,找到每一篇重要的论文,然后将它们排列成一张完美的、逻辑严密的知识图谱。
但问题在于:找到一本书很容易;而组织好这些书却很难。为了测试这些 AI 机器人是否真的准备好胜任这项工作,我们需要测试两项特定的技能。首先是检索(Retrieval):AI 能否找到与人类专家选择的完全相同的书籍?如果 AI 遗漏了最重要的论文,那么这本指南书就毫无价值。其次是组织(Organization):一旦 AI 拿到了这些书,它能否构建一个“分类法”(taxonomy)?把分类法想象成思想的家族树。它不仅仅是一个列表,而是一个具有层级结构的体系,从顶端的中心主题出发,分支到大类,再到小类,一直延伸到单篇论文。一个好的分类法能帮你看到思想是如何连接的。如果 AI 只是把论文堆成一堆乱七八糟的资料,或者创建一个令人困惑的扁平列表,那么它并没有真正完成任务。
这篇题为《深度研究智能体能否检索并组织?》(Can Deep Research Agents Retrieve and Organize?)的论文,对世界上七个最先进的 AI 研究智能体进行了测试。研究人员构建了一个特殊的挑战赛——TaxoBench,它使用 72 篇由人类专家撰写的真实、高质量的综述作为“金标准”。他们要求这些 AI 智能体要么从零开始寻找论文,要么在第二次测试中,将一组预选的论文组织成树状结构。结果给 AI 界带来了一次现实的警示。
研究发现,虽然这些 AI 智能体在交流和写作方面变得越来越好,但在研究的基础环节仍然挣扎。当被要求寻找专家使用的核心论文时,表现最好的 AI 智能体也仅找到了大约 20.92% 的论文。这意味着它遗漏了图书馆中近 80% 的重要书籍。其他智能体的表现甚至更糟,有些找到的核心论文甚至不足 5%。这就像是请一位导游向你介绍一座城市的十大地标,而他们最终只指出了两三个,其余的都漏掉了。
第二个测试部分甚至更具启发性。即使研究人员给了 AI 智能体一份“完美”的论文清单(这样就不必担心寻找问题),这些智能体仍然无法像人类专家那样进行组织。人类专家构建的是深层的、多层级的树状结构,平均深度为 4.86 层(就像一棵拥有树干、大树枝、小树枝和细枝的树)。然而,AI 智能体构建的结构却很浅且扁平,平均深度仅为 3 层左右。它们缺失了中间的组织层级。
当研究人员尝试通过给出具体指令来强迫 AI 构建更深的树时,AI 并没有变得更聪明,反而变得更混乱了。它开始将树拆解成无数个单篇论文的小分支,创造出一种由孤立细枝组成的“森林”,而不是一个有结构的树。这被称为“过度细分”(over-segmentation)。AI 太害怕将事物归类在一起,以至于它几乎把每篇论文都放进了自己微小且孤独的类别中。
论文得出结论,在目前的 AI 所能做到的与人类专家所能做到的之间,存在着巨大的“合成差距”(synthesis gap)。目前的 AI 仍处于一个“底线”水平,其组织能力仅仅比随机猜测好一点点。尽管 AI 模型正在变得更加强大,但它们尚未填补这一差距。研究人员建议,在我们信任 AI 来撰写科学指南之前,我们需要解决两个独立的问题:一是教它们如何找到正确的证据,二是教它们如何构建一个深层的、逻辑严密的结构来承载这些证据。在此之前,人类专家仍然是唯一能够绘制知识版图的人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。