CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question Answering
CompactRAG 是一个用于多跳问答的高效能框架,它通过将离线的语料库重构为原子化的问答知识库,与依赖稠密检索和答案提取的在线推理阶段进行解耦,从而最大限度地减少了 LLM 调用次数和 Token 开销,无论推理复杂度如何,都仅调用两次 LLM。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解开一个复杂的谜题,比如弄清楚某部特定电影的导演是谁,但答案并不在一个地方。你必须读一本关于这部电影的书,找到导演的名字,然后去查阅那位导演的传记以找到他们的出生地,最后查看地图以确定城市。
这就是多跳问答(Multi-Hop Question Answering):通过在不同的信息碎片之间跳转(即“跳跃”)来解决谜题。
问题所在:“过度劳累的图书管理员”
目前的系统(称为 RAG 或检索增强生成)试图通过让一个超级聪明的 AI(即大语言模型或 LL0LLM)来完成这项工作。然而,它们的方法效率很低。
把目前的方法想象成雇佣了一位非常昂贵、高薪的图书管理员来解决你的谜题。
- 你向图书管理员提问。
- 图书管理员跑到书架旁,拿出一本书,阅读它,然后写下一条笔记。
- 图书管理员跑回你面前,读了你的笔记,然后说:“好的,现在我需要知道那位导演在哪里出生。”
- 你再次提问。图书管理员再次跑向书架,拿了另一本书,阅读它,并写下另一条笔记。
- 他们为谜题中的每一个步骤都重复这个过程。
结果是? 图书管理员累了,过程变得极其漫长,而且你必须支付巨额账单(以“Token”或计算能力的形式),因为图书管理员在不停地来回奔波。此外,有时图书管理员会对第二个步骤中的“他”指的是谁感到困惑,从而导致错误的答案。
解决方案:CompactRAG(“预包装知识盒”)
这篇论文的作者提出了一个更聪明的方法:CompactRAG。与其在用户提出问题之前让昂贵的图书管理员在图书馆里到处乱跑,不如在用户出现之前就重新组织好图书馆。
第一步:离线准备(“一次性设置”)
在任何用户提问之前,系统会使用 AI 一次性阅读整个图书馆的所有文档。
- 它将每份文档拆解成微小的、完美的、自包含的“事实卡片”。
- 它不再使用一段话如“这部电影由 Arthur Crabby 在 1953 年制作”;而是创建一个特定的卡片,写着:“问题:谁导演了《莉莉·玛琳的婚礼》?答案:Arthur Crabtree。”
- 它为图书馆中的每一个事实都执行此操作。这就创建了一个紧凑型知识库(Compact Knowledge Base)。
类比: 想象一下,与其拥有一个杂乱无章的图书馆,不如你拥有一个组织得极其完美的索引卡片大盒子。每张卡片的正面都有一个特定的问题,背面有准确的答案。没有废话,没有多余的词汇。
第二步:在线推理(“两次往返规则”)
现在,当用户提出一个复杂的问题时,系统的运作方式如下:
- 拆解(第一次往返): 昂贵的图书管理员(LLM)被调用仅一次,用于将大的谜题拆解成简单的、细小的步骤。
- 用户: “这部电影的导演在哪里出生?”
- LLM: “好的,第一步:谁导演了这部电影?第二步:那个人在哪里出生?”
- 搜索(无需图书管理员): 系统不再再次调用昂贵的图书管理员。相反,它使用一个廉价、快速的机器人在预制的“事实卡片”盒中查找答案。
- 机器人找到了“谁导演了……”的卡片,并得到了“Arthur Crabtree”。
- 机器人随后会重写下一个问题,使其表达清晰:“Arthur Crabtree 在哪里出生?”(这防止了“他”所指不明的困惑)。
- 机器人找到了“Arthur Crabtree 在哪里出生?”的卡片,并得到了“伦敦”。
- 最终答案(第二次往返): 一旦机器人收集齐了所有的小答案,昂贵的图书管理员会被最后一次调用,负责将这些碎片拼凑起来并给出最终答案。
神奇之处在于: 无论谜题有多少个步骤(跳数),昂贵的图书管理员每次问题只会被调用两次。无论谜题是 2 步还是 10 步,成本都保持不变。
为什么这很重要
- 节省成本: 你不再需要支付昂贵的图书管理员进行来回奔波的费用。你只需为他们调用两次付费。
- 节省时间: 由于“事实卡片”易于查找和阅读,整个过程要快得多。
- 减少错误: 通过重写问题以包含具体的姓名(例如使用“Arthur Crabtree”而不是“他”),系统不会对讨论对象产生混淆。
实验结果
论文在三个困难的谜题数据集(HotpotQA, 2WikiMultiHopQA, 和 MuSiQue)上测试了该方法。
- 准确度: CompactRAG 解决谜题的能力与那些旧的、昂贵的方法一样出色。
- 效率: 它使用了显著更少的“Token”(AI 计算的货币)。在某些情况下,它使用的资源不到其他方法的 la la la 一半。
总结
CompactRAG 就像是将一场混乱、昂贵且反复往返的调查,变成了一项精简、预包装的操作。它通过预先进行一次性的繁重整理工作,使得解决任何新谜题都变成了一个快速、廉价且仅需两步的过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。