Improving Retrieval-Augmented Generation: A Systematic Literature Review of Retrieval-Enhancement Techniques
本文对 173 项关于检索增强生成(RAG)检索增强技术的研究进行了系统性的文献综述,通过按技术贡献和流水线阶段进行分类,旨在识别评估与效率方面的关键空白,并为未来的进展提出一个结构化的研究议程。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人朋友,它读过几乎所有被写出来的书,但有一个限制:它在几年前停止了阅读。它极其流利,能写诗、解数学题、讲笑话,但它的知识是时间冻结的。如果你问它关于一部新电影或一条突发新闻,它可能会自信满满地胡编乱造,因为它不知道分不清什么是它学到的知识,什么是事实真相。这有点像一种“幻觉”。为了解决这个问题,科学家们发明了一个被称为**检索增强生成(Retrieval-Augmented Generation, RAG)**的小技巧。把它想象成给那个机器人一张图书馆借阅卡和一个图书管理员。在机器人回答问题之前,它会迅速跑向图书馆,抓取最相关的书籍(或文档),并阅读它们以形成答案。这样,机器人就不再仅仅是凭记忆瞎猜,而是将其答案建立在真实、最新的证据之上。
但问题在于:仅仅拥有一个图书馆是不够的。你还需要知道如何找到正确的书,如何向图书管理员提出正确的问题,以及如何阅读页面而不感到困惑。如果机器人抓错了书,或者图书管理员动作太慢,答案仍然会很糟糕。这就是我们要探讨的这篇论文所要解决的问题。它是一篇大规模的“系统性综述”,就像是一个超级有组织的侦探故事,作者 Abdullah Karasan 展开了一场搜寻,旨在寻找科学家们在 2024 年至 2026 年间为让机器人的这个“图书馆搜索”部分变得更聪明而发明的所有新技巧。他不仅仅是看了这一两个想法;他追踪了 173 项不同的研究,以观察哪些方法奏效,哪些失败了,以及该领域正朝着什么方向发展。
伟大的图书馆搜寻
想象一下,AI 研究的世界就像一个巨大的、混乱的市场,数百名发明家正试图为我们的机器人朋友构建完美的“搜索引擎”。有些人试图让书籍变得更小、更容易携带(切片/分块);另一些人试图教机器人如何提出更好的问题(查询重构);还有一些人正在构建复杂的知识图谱来展示事实之间的联系。问题是,每个人都在大声喊出自己的想法,使用不同的语言,并用不同的方式衡量成功。很难判断一项新发明究竟是真正的突破,还是仅仅是一个华丽的玩具。
为了给这种混乱带来秩序,Abdullah Karasan 扮演了高级图书管理员的角色。他制定了一套严格的规则来寻找最相关的论文,扫描了六个主要的数字图书馆(就像世界各大书店的数字书架)。他过滤掉了任何没有明确承诺能改进机器人“搜索”部分的资料。最终,他收集了 173 项发表于 2024 年 1 月至 2026 年 3 月之间的研究。然后,他将这些研究整理成一张巨大的地图,按它们试图修复的内容以及在流程中的位置进行分类。
搜索流程图
论文将机器人的搜索过程分解为一个流水线,就像工厂里的装配线一样。Karasan 发现,研究人员试图改进这条线的不同部分,但做得并不均衡。
1. 检索前阶段(搜索之前)
这就像是在机器人到达之前准备图书馆。
- 切片与索引(Chunking and Indexing): 想象一本巨大的百科全书。如果你把页面切成细小的、随机的条状,你可能会丢失句子的含义。如果你保持它们为巨大的块,机器人会被淹没。论文指出,研究人员正在尝试寻找这些切片的“金发姑娘”大小(即最合适的尺寸)——有时通过使其动态化,或者利用文档的结构(例如将表格作为一个整体保留),以确保机器人获得正确的信息片段。
- 查询重构(Query Reformulation): 这是关于教机器人如何提出更好的问题。有时用户问:“谁赢了比赛?”但图书馆是按“冠军赛结果”组织的。研究人员试图让机器人重写问题,以便图书管理员能更快地找到答案。论文发现只有 5 项 研究专注于这一点,这表明它是图书馆中一个被忽视的角落。
2. 检索阶段(搜索本身)
这是行动的核心,机器人在这里实际抓取书籍。
- 混合与稠密检索(Hybrid and Dense Retrieval): 这就像同时使用两种不同的搜索工具。一种工具寻找精确的词汇(如关键词搜索),另一种则寻找词汇的含义(如概念搜索)。论文强调,将这两者结合起来(称为“混合检索”)是一种非常流行且成功的策略,许多研究表明它比只使用其中一种效果更好。
- 知识图谱检索(Knowledge-Graph Retrieval): 这是最大的类别,共有 25 项 研究。想象一个蜘蛛网,每个事实是一个点,每条连接是一根线。机器人不再只是抓取单本书,而是沿着线条寻找一整条连接的事实路径。这对于复杂问题非常有效,比如“谁是发明电灯泡的人的表亲?”,因为它可以在一个事实到另一个事实之间跳转。然而,论文指出,构建这些网络既昂贵又难以维护。
- 多模态检索(Multimodal Retrieval): 这是指机器人不仅搜索文本,还搜索图片、音频和视频。这里有 13 项 研究,表明该领域正在开始扩展到文字之外。
3. 检索后阶段(搜索之后)
一旦机器人抓取了一堆书,它就需要对它们进行分类。
- 重排序与精炼(Re-ranking and Refinement): 机器人可能会抓取 100 页,但其中只有前 5 页真正有用。研究人员正在构建“过滤器”来丢弃垃圾并将最好的页面放在最前面。论文发现这里只有 6 项 研究,考虑到清理结果的重要性,这个数字低得令人惊讶。
4. 生成阶段(答案)
这是机器人写出最终答案的地方。
- 推理与忠实度(Reasoning and Faithfulness): 一些研究人员正在教机器人边搜索边“思考”。机器人不再只是抓起一本书并阅读,它可能会检查自己的工作,提出后续问题,或者验证事实是否合理。论文发现,虽然这让答案更加可靠,但也让机器人的运行速度变慢且成本更高。
四个大惊喜
在整理完所有 173 项研究后,Karasan 发现了四个主要模式,告诉我们该领域现状如何。
1. 精力的不平衡
最明显的发现是,大家都痴迷于过程的中间环节(检索阶段)。有数十项研究关于如何更好地抓取书籍,但很少有关于如何提出更好问题或如何在搜索后清理结果的研究。这就像有一支 50 人的团队试图让图书馆书架变得更快,但只有 5 个人试图教机器人如何索要正确的书。论文认为这是一个错失的机会,因为修复“提问”或“清理”部分可能更便宜且同样有效。
2. 混乱的测量问题
论文指出,由于每个人的衡量标准不同,比较不同的发明是非常困难的。一项研究可能说他们的机器人“更好”,是因为它 90% 的时间找到了正确的书;另一项研究可能说他们的机器人“更好”,是因为最终答案更准确。如果没有一把标准的尺子,就无法知道哪项发明才是真正的佼佼者。论文建议,该领域需要就测试系统的方法达成一致,特别是在医疗等高风险领域。
3. 准确性的隐藏成本
许多“最聪明”的小技巧都伴随着一个并不总是被提及的沉重代价。例如,构建知识图谱(事实的蜘蛛网)需要大量的时间和金钱。使用复杂的推理循环会让机器人的回答时间变长。论文指出,只有极少数研究(仅 3 项)实际上测量了这些技巧消耗了多少时间或金钱。随着这些机器人从实验室走向现实生活,这种“隐藏成本”可能会成为一个巨大的问题。
4. 医疗保健偏见
最引人注目的发现是,几乎所有的严肃测试都发生在医疗领域。在 173 项研究中,有 35 项 是专门针对医疗应用的,许多最严格的测试都是针对临床试验或手术进行的。虽然这对于确保医疗机器人的安全性很有好处,但也提出了一个问题:这些技巧在其他领域(如农业、金融或法律)是否有效?论文指出,由于证据过度集中在医院,我们其实并不了解这些方法在其他领域是否同样适用。
未来在哪里?
论文总结道,该领域正在从简单的、单步式的搜索转向更复杂的、“模块化”的系统。机器人不再只是抓起一本书并阅读,未来的机器人可能能够规划其搜索过程,检查自己的工作,甚至根据问题使用不同的工具。这就像是从一个简单的手电筒升级到了功能齐全的瑞士军刀。
然而,作者警告说,在我们感到兴奋之前,我们需要解决这些混乱问题。我们需要停止忽视“提问”和“清理”这两个步骤,我们需要开始衡量这些技巧消耗了多少时间和金钱,并且我们需要在医疗以外的领域测试这些机器人。在我们做到这些之前,我们可能只是在建造非常华丽的搜索引擎,它们在医院里表现完美,但在杂货店里却表现得一塌糊涂。这篇论文并不声称解决了问题;相反,它提供了一张清晰的地图,展示了目前研究的现状,并指出了未来科学家需要填补的空白区域。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。