← 最新论文
💬 NLP

A New Role for Relevance: Guiding Corpus Interaction in Agentic Search

本文介绍了 RARG,一种通过利用相关性得分来引导有序文档遍历和匹配重排序,从而实现由粗到精的语料库交互,进而提升复杂问答的准确性与效率的关联性感知搜索智能体,其性能优于现有的检索方法和直接交互方法。

原作者: Jiangnan Li, Yuqing Li, Mo Yu, Jinchao Zhang, Jie Zhou

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiangnan Li, Yuqing Li, Mo Yu, Jinchao Zhang, Jie Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图破解谜题的侦探,但你拿到的不是几本充满线索的笔记本,而是一个拥有数百万本书的图书馆。你的目标是找到那句包含答案的特定句子。在人工智能的世界里,这被称为“检索”。长期以来,AI 助手就像一名图书管理员,快速扫描前十本书的书名并将其递给你,希望答案就在第一页。但如果答案隐藏在某本书第 400 页的一个段落深处,而这本书甚至不在前十名之列呢?或者,如果线索是一个只有当你搜索非常特定的模式时才会出现的微小、特定的短语呢?

这就是“智能体搜索”(Agentic Search)发挥作用的地方。智能体不再只是向图书管理员索要一份清单,而是被赋予了一套工具,可以亲自走进图书馆。它可以打开任何一本书,阅读特定的页面,并使用搜索工具(类似于数字化的“grep”或“find”命令)来搜寻关键词。然而,这里有一个难点:如果智能体只是在数百万本书中进行随机搜索,它可能会在找到正确线索之前,在错误的走廊里浪费数小时。研究人员提出的重大问题是:我们如何教会 AI 知道先打开哪些书,以及阅读哪些句子,从而更快、更省力地解决谜题?

你即将阅读的论文引入了这个故事中的一个新角色:RARG(相关性感知型 RipGrep 搜索智能体)。把 RARG 想象成一名极其聪明的侦探,他并不进行随机搜索。在侦探拿起放大镜之前,他会先得到一张“相关性地图”。这张地图并不会直接给出答案,而是告诉他哪些书最有可能包含线索。RARG 利用这张地图来决定它打开书籍的顺序。它从最有希望的书籍开始,确保如果答案就在那里,侦探能立即找到它。

但 RARG 的功能并未止步于此。它有两个特别的绝招。首先,它在开始时就给侦探一个由几个高度相关段落组成的“入门包”,这样他们就不必浪费时间去猜测从哪里开始。其次,当侦探从许多书中找到了一堆匹配的句子(命中项)时,RARG 就像一名严厉的编辑。它查看所有这些匹配项并对它们进行重新排序,将最具信息量的句子推到顶部,并将无聊且无关的句子隐藏起来。这确保了侦探只会看到最好的线索,即使这些线索来自一本最初并不在最顶端列表中的书。

研究人员将这位新侦探与旧方法进行了对比测试。他们发现,通过在智能体进行搜索的过程中利用相关性来引导搜索,而不是仅仅在预先挑选书单时使用相关性,AI 解决复杂问题的速度要快得多。在拥有 10 万份文档的库进行测试时,这种新方法(RARG++)达到了 84% 的准确率,击败了此前处于 78% 左右的现有最佳方法。当他们将图书馆扩大到 100 万份文档时,新方法的准确率确实有所下降,降至 79%,但它仍然保持着显著的领先优势,而旧方法则跌至 69%。即便存在这种下降,新方法使用的“工具调用”(搜索过程中的步骤)也明显更少,这使得它更加廉价且高效。

论文指出,更好的 AI 搜索关键不在于拥有更大的图书馆或更强大的搜索工具,而在于给智能体一个更好的方向感。通过将“相关性”从一个简单的过滤器转变为一种引导搜索如何进行的方式,AI 可以在无需移动整个草堆的情况下,找到草堆中的那根针。作者表明,这种方法对于寻找特定答案(如数学题)和对信息列表进行排序都非常有效,证明了知道去哪里看与知道如何搜索同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →