Efficient RAG with Intent-Aware Retrieval and Semantics-Preserving Chunking
本文介绍了 InSemRAG,这是一个通过在迭代机制中结合意图感知检索器和语义保持分块,并利用小语言模型显著降低计算延迟,从而增强在多跳和证据敏感任务上性能的检索增强生成框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位才华横溢但有点健忘的助手(即大语言模型,简称 LLM),他擅长写作和交谈,但并不了解最近发生的每一件事。为了帮助他,你给了他一个巨大的图书库(外部数据库)来查找答案。这种设置被称为 RAG(检索增强生成)。
然而,使用这个图书馆的旧方法存在两个大问题,就像一个笨手笨脚的图书管理员:
- “一刀切”的搜索: 图书管理员对每个问题都使用完全相同的搜索方法。如果你问一个简单的“图书馆在哪里?”的问题,他可能会想得太多。如果你问一个复杂的“为什么图书馆失火了?”的问题,他可能只会抓取一张关于消防安全的随机页面,而不是关于火灾历史的页面。他不理解你的意图。
- “撕裂的页面”问题: 当图书管理员抓取页面展示给你时,他经常把页面撕成两半,以便塞进便签纸里。如果句子在中间被切断了,意义就丢失了。这就像是在读一份食谱,上面写着“加入两杯面粉,然后……”而下一页却缺失了。助手会感到困惑,因为证据是破碎的。
这篇论文介绍了一种名为 InSemRAG 的新系统来解决这些问题。把这看作是将图书管理员升级为一名聪明、高效的助手,他使用一个小型、快速的机器人(小语言模型,简称 SLM)来承担繁重的工作。
以下是 InSemRG 如何运作的,使用了简单的类比:
1. 智能搜索(意图感知检索)
该系统不再使用一种僵化的搜索方法,而是像一只变色龙一样。
- 问题: 有时你需要精确的关键词搜索(比如寻找特定的书名),有时你需要宽泛的概念搜索(比如寻找“关于悲伤的书籍”)。
- 解决方案: 系统会先观察你的问题。它会询问小机器人:“这个搜索需要哪种类型?”
- 如果问题很具体,它会侧重于关键词匹配。
- 如果问题很抽象,它会侧重于理解含义。
- 它会像厨师根据口味调整香料一样,动态地混合这两种搜索风格,确保为你的特定问题抓取正确类型的信息。
2. “胶水”机制(语义保留分块)
一旦图书管理员抓取了页面,系统就会检查它们是否被撕裂了。
- 问题: 标准系统只是将文本切成固定大小的块。这经常会导致句子被切断,或者将代词(如“他”)与它所指代的人(如“总统”)分开。
- 解决方案: 系统就像一个检查撕裂文件的侦探。
- 它会检查每一张纸。如果某 pieces 看起来“受损”(例如句子不完整或逻辑中断),它不会直接扔掉。
- 它会回到原书,抓取撕裂点之前的句子和撕裂点之后的句子,并利用小机器人将它们缝合在一起,变成一个完美的、完整的段落。
- 它会压缩这个新段落以使其符合要求,但不会丢失原有的含义。
3. “双重检查”循环
系统不仅仅是抓取一次并寄希望于好运。它使用一个检索并检查的循环。
- 在收集并修复证据后,它会问:“我们是否拥有回答这个问题所需的所有拼图碎片?”
- 如果缺少某个碎片(例如,问题要求给出三个原因,但证据只提供了两个),它会再次派小机器人回到图书馆寻找缺失的部分,重复这个过程,直到答案完整为止。
为什么这很特别?
通常,进行所有这些检查和修复需要一个超级强大、缓慢且昂贵的计算机大脑。但本论文表明,你可以使用一个小型、快速且廉价的机器人(小语言模型)来进行搜索和修复工作。
结果:
- 更好的答案: 在需要连接多个线索的困难测试中(例如“为什么 X 会发生,从而导致了 Y?”),该系统的得分显著高于以往的方法。
- 更快: 尽管它做了更多的检查,但由于它使用的是小型、高效的机器人而非庞大、缓慢的巨型模型,它实际上比其他试图解决类似问题的复杂系统快了 4 倍。
简而言之,InSemRAG 就像是给你的 AI 助手配备了一位聪明的图书管理员,他知道如何针对你的特定需求进行搜索;并配备了一位细心的编辑,确保在把信息递给你之前,没有任何页面是撕裂的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。