← 最新论文
🤖 AI

Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents

本文通过区分检索失败与利用失败来诊断长程搜索智能体,揭示了回答准确度与检索证据质量的相关性强于其与搜索投入的相关性,并指出改进查询构建、证据选择以及自适应停止标准是构建更优深度研究系统的关键。

原作者: Qi Liu, Jiaxin Mao, Fengbin Zhu, Tat-Seng Chua

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Qi Liu, Jiaxin Mao, Fengbin Zhu, Tat-Seng Chua

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探。在人工智能的世界里,有一些专门为此设计的特殊“深度搜索”智能体。它们并不只是根据已知知识进行猜测,而是扮演着数字侦探的角色:提出问题、阅读答案、再提出更多问题,并将线索拼凑在一起,直到解开谜题。这个过程被称为“长程搜索”(long-horizon search),因为它可能需要许多步骤或“轮次”才能从第一个问题走到最终的解决方案。长期以来,人们一直认为,如果一个智能体更加努力——提问更多、阅读文档更多——它就会变得更聪明并解决更多的谜题。这看起来合乎逻辑:更多的投入应该带来更好的结果。但是,就像一个即便在第一个花园里已经找到了宝藏,却仍在错误的花园里不停挖掘的人类侦探一样,这些 AI 智能体也可能在浪费精力。研究人员想要回答的核心问题是:努力工作真的会让这些 AI 侦探变得更聪明吗,还是它们只是在原地打转?

这篇论文深入研究了六种不同 AI 智能体的“搜索轨迹”,以弄清楚它们究竟是如何思考、搜索以及有时失败的。研究人员不仅关注最终答案;他们还观察了智能体采取的每一个步骤,就像逐页审查侦探的笔记本一样。他们使用了一个名为 BrowseComp-Plus 的特殊测试,其中每个问题都有一个已知的“金标准”答案和一组包含真相的特定文档。通过将智能体找到的内容与这些已知真相进行对比,他们发现了一个令人惊讶的事实:努力工作并不意味着变得更聪明。 事实上,那些提问最多、阅读文本最多的智能体,往往是答错问题的那些。

研究发现,成功搜索的秘诀不在于工作的“量”,而在于所获线索的“质”。研究人员将失败分为两类:“检索差距”(retrieval gaps)和“利用差距”(utilization gaps)。检索差距就像是一个侦探因为问错了问题,导致永远找不到关键证据;而利用差距则是指侦探找到了证据,但由于误读了证据而导致得出错误答案。论文表明,对于大多数智能体而言,问题出在检索差距上——它们根本没有找到正确的文档。

这是最生动的发现之处:证据要么出现得很早,要么根本不出现。 研究人员发现,如果一个智能体注定要找到“金标准”证据(即解开问题的关键),它通常会在搜索的前几步中就找到它。如果智能体到那时还没找到,那么它也很难找到了。然而,许多智能体在寻找不到线索后仍会继续搜索很长时间。这产生了一个“浪费尾部”(wasted tail)——一段漫长且乏味的搜索过程,在此期间,智能体只是在阅读同样的信息或寻找死胡同,在没有任何进展的情况下白白消耗时间和计算内存。

论文还观察了智能体是如何提问的。有些智能体就像闯进瓷器店的公牛,反复询问同一个问题,或者只是对查询语句进行微小且无意义的修改。然而,最聪明的智能体却是自律的。它们不会重复自己。它们会尝试不同的角度(转向),但一旦获得足够证据就会立即停止。解决一个谜题并不需要搜索 30 次,只要那 10 次搜索能精准命中,它们就足够了。

简而言之,这项研究表明,更优秀的 AI 侦探的未来不在于让它们搜索得更久或阅读得更多。而在于教会它们如何提出更好的问题,在获得足够信息时停止搜索,并且不要在已经失败的问题上浪费时间。胜出的智能体不是那些工作最努力的,而是那些工作最聪明、能快速找到大海捞针中的那根针,并准确知道何时停止挖掘的智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →