← 最新论文
🤖 AI

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

本文指出基于置信度的投票在多轮搜索智能体中会因检索文档导致的“复制膨胀”而失效,并提出了检索锚定投票(RGV),一种通过根据生成结果与检索源之间的词汇重叠度进行评分的方法,从而在多个基准测试中实现了显著的准确率提升。

原作者: Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,大型语言模型已经变得擅长通过复杂的问题进行推理。为了使这些系统更加可靠,研究人员经常要求它们针对同一个问题生成多个可能的答案,然后对其中最好的一个进行投票。对于简单的任务,出现了一个聪明的技巧:系统根据模型在写作时感到多么“自信”来为每个答案加权。如果模型在生成文字时具有高度的确定性,那么该答案获得的权重就更高。当模型在真空中工作,仅依赖其内部训练时,这种方法效果很好。然而,新一代的 AI 智能体正在改变游戏规则。这些智能体不仅是在思考,它们还在搜索。它们就像数字研究员一样,从互联网中抓取外部文档来回答问题,阅读这些文档,然后根据这些新信息编写最终的响应。这种从孤立思考到主动搜索的转变,为我们判断其答案质量的方式制造了一个盲点。

来自美国和亚洲大学的一个研究小组发现,旧的衡量信心的方法在这种新环境下表现得极其糟糕。他们发现,当 AI 智能体复制它刚刚检索到的文档中的文本时,模型的内部信心计会发生紊乱。系统看到了复制的词汇,并且因为这些词就在其直接记忆中,它会变得人为地确定自己正在做正确的事情。这产生了一种虚假的安全感。模型可能会复制一篇误导性文章中的错误事实,但其内部信号却在呐喊着它是正确的。研究人员将这种现象称为“复制膨胀”(copy inflation)。这就像一名学生在写论文时被允许查看答案解析一样;复制答案的行为让他们感到非常有信心,即使他们所看的解析是错误的。这种膨胀抹平了优劣答案之间的差异,导致投票系统坍塌为一种简单的次数计数,而不是一种对最可靠答案的智能选择。

为了解决这个问题,研究人员提出了一种完全看向模型思维之外的投票新方法。他们不再询问模型感觉有多确定,而是提议检查最终答案与智能体找到的实际文档的匹配程度。他们称之为“检索锚定投票”(Retrieval-Grounded Voting)。这个过程非常直观:在智能体完成工作后,系统会将最终答案中的词汇与智能体检索到的文档文本进行对比。如果答案是直接基于所找到的证据构建的,它就会获得高分。如果答案比较模糊,或者依赖于并未出现在源材料中的词汇,它就会获得低分。这种方法绕过了模型受污染的内部信号。它不需要模型重新评估自身,也不需要额外的计算能力来生成新的想法。它只是检查答案与证据之间的关系,而这种联系是独立于模型的信心而存在的。

该团队在涉及复杂搜索任务的四个不同基准测试和五种不同的语言大模型上测试了这个想法。结果是一致且显著的。新方法始终优于传统的基于置信度的投票,将准确率提高了多达 5.4 个百分点。在最困难的情况下,这种改进更为显著,即正确答案仅出现在极少数尝试中。在这些困难场景下,新方法的准确率比旧方法高出 35%。这至关重要,因为这意味着即使大多数尝试都是错误的,只要正确的尝试能够妥善锚定在检索到的证据上,系统就能找到正确答案。研究人员还发现,这种新方法极其高效。它几乎不增加处理成本,在标准计算机处理器上每条答案的处理时间不到一毫秒,而其他试图解决置信度问题的方案通常需要昂贵的额外计算或额外的模型调用。

研究还表明,复制膨胀问题并非罕见的故障,而是这些搜索智能体工作的基本特征。研究人员测量到,在许多情况下,智能体编写的大部分文字都是直接从检索到的文档中复制的。这种高频率的复制正是导致模型内部信心信号变得不可靠的原因。通过将重心转向外部证据,研究人员表明,判断一个答案质量的最佳方式是看它与源材料的关联性,而不是看模型内部的确定感。这一发现为该领域提供了一个更广泛的教训:当 AI 智能体依赖外部信息时,它生成的关于自身信心的信号可能是具有误导性的。验证其工作的最可靠方法是查看它所使用的证据,而不是它表达的感觉。

这项研究并不声称已经解决了 AI 智能体的所有问题。新方法仍然取决于搜索结果的质量;如果智能体找到了错误的文档,该方法无法奇迹般地修复答案。此外,该方法衡量的是答案与文本的匹配程度,而不是文本本身是否真实。如果检索到的文档包含谎言,系统可能仍会将其评定为具有高度锚定性。然而,这项研究为改进如何聚合多个 AI 尝试的工作成果提供了一条清晰且实用的路径。通过跳出模型的内部语境并观察其收集到的切实的证据,研究人员可以构建出更稳健、更准确、且不易受到机器在阅读和重复发现内容时产生的信心幻觉影响的系统。这项工作证明了,在搜索型 AI 的时代,最值得信赖的信号不是模型的声调,而是它所持有的文档。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →