Beyond Sequential Hybrid Retrieval: A Parallel Framework for Accurate and Scalable RAG
本文介绍了 PH-RAG,这是一种并行混合检索框架,它通过同时执行稀疏检索与稠密检索,并结合融合与重排序技术,在开放域问答任务上实现了最先进的准确率并提升了延迟,其性能超越了复杂的智能体基准模型,且无需知识图谱或迭代式批判器。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代计算机在写作和交谈方面已经变得异常出色,能够以惊人的流畅度模仿人类对话。然而,这些数字大脑存在一个根本性的缺陷:它们被困在了过去。它们的知识在训练完成的那一刻就冻结了,这意味着它们无法了解昨天发生的事件,也无法轻易获取公司内部文档或整个图书馆收藏的庞大且具体的细节。当被问及无法从记忆中回答的问题时,它们往往会编造事实,创造出听起来很有把握但完全虚假的故事。为了解决这个问题,工程师们开发了一种称为检索增强生成(retrieval-augmented generation)的方法。与其仅仅依赖其内部记忆,计算机首先会在一个真实文档数据库中进行搜索,找到最相关的页面,然后将这些页面作为参考来构建答案。这让机器保持了诚实并能紧跟时事。
然而,寻找正确的信息比听起来要难得多。计算机寻找答案主要有两种方式。一种通常被称为稀疏检索(sparse retrieval),它的工作原理类似于传统的图书馆卡片目录,将问题中的精确词汇与页面上的词汇进行匹配。它非常擅长寻找特定的名称、日期或技术术语,但如果用户使用的词汇与文档中的词汇不同,它就会失效。第二种方法被称为稠密检索(dense retrieval),它采用了一种更直观的方式。它理解词汇背后的含义,因此即使文档从未出现过完全相同的词汇,它也能找到讨论相同概念的文档。多年来,研究人员一直试图结合这两种方法以获得两者的优点,但他们通常是先后运行其中一种搜索。这种顺序执行的方法造成了瓶颈,随着数据量的增加,系统速度会变慢。
来自巴基斯坦的一个研究小组提出了一种处理这一挑战的不同方法。他们构建了一个让两种搜索方法同时运行,而不是先后运行的系统。想象一位图书管理员派出两名助手去寻找一本书:一名助手检查卡片目录以查找准确的书名,而另一名助手则利用对故事主题的理解来扫描书架。在传统设置中,图书管理员必须等待第一名助手返回后,才会派出第二名助手。在这个新系统中,两名助手同时出发,图书管理员只需等待耗时最长的那个助手完成即可。这种并行处理的方法被研究人员称为 PH-RAG,它使计算机能够更快地收集信息,而不会牺牲准确性。
研究人员使用超过五千篇维基百科文章和一千个常识问题集对他们的系统进行了测试。他们发现,通过并行运行这两种搜索方法并仔细合并结果,他们的系统比以往更复杂的系统能更频繁地找到正确答案。具体而言,该方法成功地将正确答案置于列表顶端的时间达到了 65.6%。这略高于一个依赖于事实之间复杂关系网络(即知识图谱)的领先系统。新系统在实现更高准确性的同时,其构建和操作过程要简单得多,证明了如果你能高效地使用正确的工具,并不需要一个庞大且复杂的结构也能取得良好的效果。
他们成功的关键在于如何组合来自两种不同搜索方法的列表。他们并没有简单地从其中一个列表中选取最佳答案,而是采用了一种策略,即给予理解含义的方法更多的权重,同时仍保留寻找精确词汇的方法的重要角色。这种融合使得系统能够捕捉到任何一种方法单独工作时可能遗漏的答案。在合并列表后,系统会对前十个候选对象进行最后一次仔细审查。它根据原始问题重新评估每个潜在答案,以确保最匹配的项被放在首位。这一最后步骤并没有改变找到的文档,但它确保了最相关的文档被优先呈现,这在计算机在开始写作前阅读空间有限的情况下至关重要。
研究人员还仔细观察了随着图书馆规模扩大时系统的运行速度。他们发现,对于较小的文档集,先后运行搜索与同时运行搜索之间的速度差异微乎其微。然而,当集合规模增长到五千至两万份文档之间时,并行系统明显更快,将等待时间缩短了高达 64%。这是因为随着图书馆变大,搜索精确词汇的方法耗时会增加,而理解含义的方法则保持相对快速。通过将它们结合运行,系统避免了在开始较快的方法之前必须等待较慢的方法完成。这项研究表明,对于涉及中等规模文本的大多数实际应用场景,并行运行搜索是提高速度和准确性的极高效方式,且无需构建更复杂的机器。
这些发现挑战了“系统越复杂越好”的观点。研究人员将他们的方法与一个使用知识图谱且由人工智能代理反复检查自身工作的系统进行了对比。虽然那个复杂的系统功能强大,但新的并行方法在处理标准问题时,能以更简单的设计达到甚至超过其表现。这表明对于许多日常任务,例如回答关于常识或公司政策的问题,一个设计精良、简洁明了的系统可以胜过那些繁琐的多步骤流程。该研究并不声称解决了计算机科学中的所有问题,特别是涉及跨不同文档连接多个事实的问题。然而,它证明了通过仔细协调现有工具并进行并行运行,我们可以构建出既更快又更可靠的系统,为使人工智能在现实世界中变得更有用提供了一条切实可行的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。