← 最新论文
💻 computer science

Clarify-Then-Search: A Clarification Benchmark for Deep Search with End-to-End Nugget Restoration

本文介绍了“先澄清后搜索”(Clarify-Then-Search),这是一个基于真实百度数据构建的基准测试,旨在评估由大语言模型生成的澄清问题如何通过恢复缺失的查询约束来提升深度搜索性能,证明了此类交互能显著提高端到端的效用,同时也揭示了诸如过度询问无法回答的位置问题等常见的失败模式。

原作者: Deqiang Huang, Jingbo Zhou, Xinjiang Lu, Tong Xu, Hua Wu, Enhong Chen

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Deqiang Huang, Jingbo Zhou, Xinjiang Lu, Tong Xu, Hua Wu, Enhong Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在浩瀚的数字信息领域,搜索引擎已经从简单的关键词匹配器演变为能够进行深度调查的复杂助手。这些系统通常被称为深度搜索智能体(deep search agents),它们不仅仅是返回一个链接列表,而是会主动浏览网页,从多个来源收集证据,并针对用户的提问合成一个全面的答案。然而,这些强大的工具有一个致命的弱点:当人类的需求模糊不清时,它们会表现得力不从心。如果用户询问“最好的大学”,系统并不知道是指工程学最好的、欧洲最好的,还是特定预算下最好的。由于缺乏这些缺失的细节,搜索可能会偏离航向,在无关信息上浪费时间,并交付一个感觉不完整或错误的最终答案。解决方案似乎显而易见:计算机应该请求澄清。但构建一个知道该问什么、以及如何利用答案来改进搜索的系统,一直难以测试。直到现在,研究人员仍然缺乏一种可靠的方法来衡量一次澄清性的提问究竟是真正帮助了搜索引擎找到更好的信息,还是仅仅是毫无意义的礼貌寒暄。

来自中国科学技术大学和百度的一组研究人员创建了一个新的试验场来解决这个问题。他们引入了一个名为“先澄清后搜索”(Clarify-Then-Search)的基准测试,这是一个旨在观察在搜索之前提问是否真的能带来更好结果的严谨实验。该团队从百度的真实搜索查询开始。对于每个测试用例,他们首先将原始数据融合并归一化为一个清晰、具体的意图查询(即“fused_query”),例如“欧洲最适合人工智能硕士学位的大学”。然后,他们通过删除时间、地域或范围等关键约束条件,故意模糊了这个意图,从而创建了系统所看到的模糊请求(即“blurred_query”)。这为每个测试用例创建了一个配对的数据集:系统必须处理的模糊查询,以及代表用户真实目标的清晰意图。

为了确保测试公平且不受操纵,研究人员设置了一个严格的两阶段交互过程。首先,一个“澄清者”(Clarifier)模型仅查看模糊查询并生成一组问题来询问用户。接着,一个“用户回答者”(User Answerer)模型(它已知晓真实的、清晰的意图)会对这些问题进行回答。至关重要的是,用户回答者被编程为保持诚实:如果真实意图中不包含所请求的具体信息,它必须回答“未知”。它不能为了表现得乐于助人而编造细节。最后,一个“重写者”(Rewriter)模型获取原始的模糊查询和收到的答案,以创建一个新的、改进后的搜索查询。这个重写后的查询随后被输入到一个固定的深度搜索系统 WebDancer 中,由它去寻找实际的信息。研究人员随后将最终答案与基于清晰意图查询构建的“黄金参考”(golden reference)进行对比,以观察有多少正确信息被成功恢复。

结果显示,虽然提问有所帮助,但它并非万能灵药。当系统被允许只提一个问题时,测试的所有模型表现都比完全不提问时要好。表现最好的模型 GPT-5.2 成功恢复了显著更多的有用信息。然而,这项研究揭示了这些系统思维方式中的一个持久缺陷。许多模型(尤其是那些在其他领域表现出色的模型)都有一个强烈的倾向,即询问地理位置或区域,例如“您想找哪个城市?”在本次测试的严格条件下,由于真实意图往往并未指定具体位置,这些问题经常导致“未知”的回答。这意味着系统浪费了一轮对话去询问一个它无法得到答案的问题,导致重写后的查询与原始查询一样模糊。研究人员发现,这种“仅限区域”的偏差是导致某些交互无法改善搜索的主要原因,即便这些问题听起来自然且相关。

将允许的问题数量从一个增加到两个或三个通常会提高结果,但收益很大程度上取决于模型的策略。虽然 GPT-5.2 在单轮提问中领先,但另一个模型 ERNIE-4.5-Turbo-128K 在允许提问三次时占据了榜首。这表明,有些系统擅长挑选一个高价值的问题,而另一些系统则擅长进行持续的对话,从而逐步挖掘出缺失的细节。研究还表明,仅仅增加轮数并不保证成功;如果额外的提问继续针对用户意图中不存在的信息,系统就会持续撞向死胡同。最有效的系统是那些能够避免这些低产出问题,并成功引导出至少一个具体、可用信息的系统。

这项工作为衡量澄清在深度搜索中的真实价值提供了一种清晰、可复现的方法。它超越了仅仅检查一个问题是否听起来礼貌或相关,而是专注于该问题是否确实能导向更好的最终答案。研究结果表明,对于深度搜索系统要变得真正可靠,它们不仅要学会提问,还要学会问对问题。它们需要识别何时提问很可能产生答案,以及何时最好利用已有的信息直接进行搜索。通过暴露这些特定的失败模式,该基准测试为构建不仅更聪明、而且更高效的搜索智能体提供了路线图,确保每一次交互都能让用户离他们寻求的真相更近一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →