← 最新论文
🤖 AI

ScalableRAG: High-Quality RAG at Zero Ingestion Cost

该论文介绍了 ScalableRAG,这是一种高质量的检索增强生成方法,它通过利用一个用于即时聚合推理的动态工作区,在实现零摄取成本的同时,在多个数据集上实现了卓越的准确度,同时还提供了一种受限摄取(Limited-Ingestion)变体,以极少的向量数据库使用量进一步提升了大规模场景下的性能。

原作者: Hilaf Hasson, Aditya Chakravarty, Jayant Thomas, Krishna Gogineni

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Hilaf Hasson, Aditya Chakravarty, Jayant Thomas, Krishna Gogineni

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过阅读一百万本书籍来解开一个巨大的谜团。在人工智能领域,这被称为检索增强生成(Retrieval-Augmented Generation, RAG)。把标准的 AI 想象成一位才华横溢的侦探,他读遍了整个互联网,却无法记住某个尘封档案中的具体细节。为了帮助这位侦探,我们通常会在他开始工作之前构建一个“卡片目录”或“知识图谱”。这涉及阅读每一本书、总结其内容,并将其组织成一个复杂的数据库,以便 AI 能快速找到正确的一页。这就像是在侦探到达之前,雇佣了一支图书管理员团队花费数周时间对图书馆进行索引。这个过程既昂贵又缓慢,而且仅仅为了启动就需要消耗大量的计算能力。但如果侦探可以直接走进图书馆,看着书本,并在现场即时得出答案,而不需要预先制作庞大的目录呢?这就是这篇论文要解决的大问题:我们能否在不支付构建那个庞大数据库的高昂“摄取(ingestion)”成本的情况下,获得同样出色的结果?

由 Hilaf Hasson 及其团队领导的 Cohesity 研究人员表示,答案是肯定的。他们推出了一种名为 ScalableRAG 的新系统,它有两种形式:零摄取(Zero-Ingestion)有限摄取(Limited-Ingestion)。他们的主要发现是,你并不需要预处理整个图书馆来回答复杂的问题。相反,他们的 AI 智能体表现得像一个组织极其严密的侦探,随身携带一个神奇且可扩展的剪贴板。当侦探需要寻找特定事实时,他们不仅仅是搜索关键词;他们会即时创建一个相关的文档“组”,对其进行过滤,甚至在现场对结果进行数学运算。

以下是他们的“零摄取”方法的工作原理,使用了一个简单的比喻:想象你有一堆混合在一起的一整年购物收据。传统系统需要有人坐下来,阅读每一张收据,并将它们分类放入贴有标签的文件夹(如杂货、汽油、电子产品)中,然后你才能问诸如“我六月份在汽油上花了多少钱?”之类的问题。这种分类工作非常耗时。然而,ScalableRAG 跳过了整个分类过程。当你提出问题时,AI 会查看这堆收据,找出所有提到“汽油”的收据,然后过滤这个较小的集合以仅找到属于“六月”的收据,最后把数字加起来。它通过即时创建和管理文档“集合(sets)”来实现这一点。这就像是一位侦察兵可以瞬间在相关的收据周围画个圈,计数并进行数学运算,而无需事先将它们归档。

论文显示,这种“即时(on-the-fly)”方法极其强大。在对六个不同文档集(从政府听证会记录到财务报告和电影剧本)的测试中,他们的零摄取系统在其中三个数据集(MuSiQue、Transcripts 和 Hotels)中轻松超越了所有基准模型(包括知识图谱方法)。在另外三个数据集(2Wiki、FinanceBench 和 ComplexTR)上,它仅略微落后于最高性能表现,与每个数据集表现最好的基准(即 A-RAG)相比,平均仅落后 1.63%。尽管在半数数据集上存在这些微小的差距,但该系统在所有六个数据集上的平均准确率比排名第二的竞争对手高出约 7.36%。这是一件大事,因为这表明对于许多类型的问题,预先构建数据库的昂贵步骤实际上是不必要的。

为了让系统在处理更棘手的问题时表现得更好,他们还构建了一个“有限摄取”版本。这就像是给侦探提供了一个针对最常见线索的小型预制索引,但仍然让他们进行现场的重体力劳动。这个版本使用了少量的预处理(仅对文档进行采样以寻找模式)和一个小型向量数据库(一种帮助寻找相似想法而非仅仅是精确单词的工具)。这种混合方法进一步提高了准确率,尤其是在信息隐藏在复杂结构中的数据集中,例如在酒店描述中寻找特定设施,或在法律合同中寻找特定条款。

论文明确反对那种认为你必须构建一个庞大的、经过预处理的知识图谱或完整的 SQL 数据库才能回答复杂的多步问题的观点。他们证明了那些要求 LLM 在用户提问之前阅读每份文档并提取数据的“重摄取”方法往往是过度设计的。虽然这些方法擅长对数据进行分组,但 ScalableRAG 证明了智能体可以在对话过程中即时完成同样的逻辑分组和数学运算。作者对这些结果非常有信心,他们在多样化的数据集上进行了严格的测试,并使用一个独立的 AI 作为评判者来对答案进行评分。他们发现,该系统不仅节省了资金和时间,而且往往比昂贵的替代方案能得到更正确的答案,或者以显著更少的精力达到非常接近的效果。

简而言之,ScalableRAG 通过展示你不需要建立一个巨大的、组织有序的知识仓库来寻找“大海捞针”中的那根针,从而改变了游戏规则。相反,你可以向草堆里派出一个聪明的智能体,并给它一套神奇的工具,让它就在原地抓取、分类并清点那些针头。无论你需要一个成本为零的设置系统(零摄取),还是一个通过增加少量预处理工作来换取更高精准度的系统(有限摄取),这项研究都表明,AI 问答的未来可能比我们想象的要简单、快速且廉价得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →