One Retrieval to Cover Them All: Co-occurrence-Aware Knowledge Base Reorganization for Session-Level RAG
本文提出了一种共现感知的知识库重组方法,该方法通过对相关文档进行聚类并扩展查询候选集,显著提升了企业级 RAG 系统的会话级检索覆盖率与效率,并主张应以会话级覆盖率取代单次查询召回率作为主要的评估指标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在尝试修复一个复杂的网站问题,比如建立一个新的在线商店。你需要完成四件事:连接你的域名、选择设计模板、设置支付方式以及配置电子邮件。
在标准 AI 系统(称为 RAG)中,计算机就像一个图书管理员,他只知道如何找到那些看起来与你的问题完全一致的书籍。
- 你问:“如何连接我的域名?”
- 图书管理员找到了三篇关于域名的文章。
- 问题在于: 图书管理员并没有意识到你现在同时也需要关于模板和支付的文章。这些文章在图书馆完全不同的书架上。为了获取它们,你必须提出四个独立的问题,等待管理员为每一个问题寻找答案,并希望他每次都能找对。
这篇论文的作者称之为“盲点”。他们发现,标准系统在一次检索中只能找到你实际所需信息的约 41%。
解决方案:一种新的图书馆组织方式
研究人员提出了一个聪明的技巧:根据人们实际如何一起使用信息,而不是仅仅根据书籍本身的样子来重新组织图书馆。
把它想象成一家杂货店。
- 标准系统: 它把“牛奶”放在“奶酪”旁边,因为它们都是白色的乳制品(语义相似性)。
- 这个新系统: 它注意到购买“牛奶”的人通常也几乎总是会购买“谷物麦片”和“草莓”(共现性),尽管牛奶和草莓看起来并不像。因此,它把谷物麦片和草莓也移到了牛奶所在的同一个过道。
它是如何运作的(简单的步骤)
- 离线重组(“夜班”): 在有人提问之前,系统会查看数千个过去的用户的会话。它发现当人们询问有关域名的内容时,他们通常也需要关于模板和支付的帮助。它将这些看似无关的主题组合在一起,形成“簇”或“邻里”。
- 在线检索(“白班”): 当你提出问题时,系统会做两件事:
- 它找到最显而易见的答案(就像标准的图书管理员一样)。
- 神奇的一步: 它立即查看该答案所在的“邻里”,并抓取该簇中的其他项目(如模板和支付),即使它们与你的问题看起来并不相关。
- 结果: 它不再只给你关于域名的文章,而是同时给你域名文章以及模板和支付的文章。
为什么这很重要
论文在包含 6,000 多篇文章的真实企业知识库上进行了测试。以下是他们的发现:
- 一次调用,更多答案: 与其需要四个独立的问题来获取所有信息,现在一个问题就能覆盖 58% 的用户需求(从 41% 上升而来)。
- 更少的步骤: 为了获得 70% 的所需信息,用户现在需要的提问次数减少了 34%。这就像是你只需一次购物就能完成任务,而不是跑四趟。
- 更小的图书馆: 由于系统能高效地对事物进行分组,它可以将有效知识库的大小缩减到原始大小的 20%,同时仍能找到正确的答案。
- 随处适用: 无论使用哪种用于理解文字的“大脑”(AI 模型),以及在六种不同类型的课题(如支付、电子邮件和设计)中,这个技巧都奏效。
权衡
作者承认这存在微小的代价。因为他们抓取的信息范围更广,有时第一个答案可能不如以前那么完美(精确度从 96% 下降到 93%)。然而,他们认为这是一个极好的权衡。比起拥有一个“完美的”单一答案,然后不得不为了剩下的部分再问三个问题,能够立即看到 58% 的解决方案要好得多。
他们并未声称的事项
- 他们没有声称这适用于没有后续问题的单次提问(例如百科知识问答)。
- 他们没有声称这会让 AI 最终生成的回答变得完美;他们仅衡量是否找到了正确的文档。
- 他们没有使用真实的用户的日志进行训练(出于隐私原因),而是使用了专家标注的数据和模拟的用户路径来教导系统如何进行分组。
简而言之,这篇论文表明,对于复杂的现实世界问题,我们不应仅仅要求 AI 寻找“最相似”的文档。我们应该教会 AI 根据人类实际如何共同使用这些信息,去寻找“最有帮助的一组”文档。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。