Topology-Aware Hybrid Retrieval for Enterprise Knowledge Systems
本文提出了一种拓扑感知型混合检索引擎,该引擎将稠密检索、稀疏检索与文件系统搜索相统一,并利用多层控制器自动遍历文档层级与超链接,在避免语言模型驱动的查询分解所带来的开销的同时,显著提升了企业知识系统的召回率、排序质量和延迟表现。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一座巨大且混乱的图书馆中寻找一个特定的事实。在人工智能的世界里,这座图书馆就是互联网或公司的内部文档,而图书管理员则是“检索增强生成”(RAG)系统。可以将 RAG 想象成一个超级聪明的机器人,它不仅靠记忆来回答问题,还会先去图书馆查阅资料后再开口说话。这防止了机器人凭空捏造(幻觉),并让它能够瞬间学习新知识。
然而,传统的图书管理员有一些怪癖。有些只在意你使用的精确词汇(如果你说“汽车”,它们找不到“轿车”);还有些只在意句子的整体氛围(如果你说“快速的交通工具”,它们可能会给你找来一辆赛车,即使你问的是卡车)。此外,这些图书管理员通常将每本书视为一堆零散、不连贯的页面,忽略了其中一个事实是:某页可能写着“参见第 42 页”,或者有一个指向另一本书的超链接。当机器人试图拼凑一个需要阅读多个关联页面的复杂故事时,它往往会迷失方向、感到困惑,或者在决定下一步该读哪些页面时耗费过长时间。
这就是一种新的方法,旨在让图书管理员变得更快、更聪明、连接性更强。
超连接图书管理员:一种寻找答案的新方式
想象你是一名正在试图破解谜团的侦探。在旧的方法中,你可能会向一位朋友寻求线索。如果你的这位朋友只了解“红色的车”,那么即使是“深红色的轿车”,他也无法告诉你;或者,如果你询问的是关于犯罪现场的“感觉”,他可能会带回一个关于抢劫的故事,而你实际寻找的是入室盗窃。
这篇论文介绍了一种被称为**拓扑感知混合检索(Topology-Aware Hybrid Retrieval)**的新型侦探团队。与其依赖于单一的朋友,这个团队同时派出四名不同的侦察兵去寻找线索,然后将他们的报告汇总成一份完美的清单。
四名侦察兵
系统同时向四种不同的“侦察兵”发送同一个问题:
- 语义侦察兵(稠密检索/Dense Search): 这位侦察兵理解词语的含义。如果你询问“快速的交通工具”,他们会找到关于速度的文档,即使文中没有出现“快速”这个词。
- 关键词侦察兵(稀疏检索/BM25 Search): 这位侦察兵是一个死板的匹配者。如果你询问特定的序列号或错误代码,这位侦察兵能瞬间找到它,而不会去管一般的含义。
- 频率侦察兵(TF-IDF Search): 这位侦察兵观察一个词在整个图书馆中的稀有程度。如果一个词非常常见,他们会忽略它;如果它很独特,他们就会给予关注。
- 文件系统侦察兵(原生 DFS): 这位侦察兵甚至不看书中的文本。相反,他们查看文件文件夹、文件名以及书架上的所有权标签,根据存储位置来寻找正确的文档。
伟大的混合大锅
这里最棘手的部分在于:语义侦察兵给出的分数可能是“0.95”(非常接近),而关键词侦察兵给出的分数可能是“150”(基于单词出现的次数)。如果你只是把这些数字相加,关键词侦察兵就会占据绝对优势,语义侦察兵的智能洞察就会被忽略。
为了解决这个问题,系统使用了一种巧妙的“过度获取”(Over-Fetching)策略。系统不是要求每位侦察兵只带回前 5 个结果,而是要求他们带回一大堆结果(例如,每个侦察兵带回 100 个结果)。然后,它使用一个数学“翻译器”来进行归一化处理,将所有的分数放在同一个尺度上。最后,它使用一个可定制的配方将它们混合在一起。你可以告诉系统:“我想要 70% 的含义和 30% 的精确词汇”,或者“直接取任何侦察兵中的最高分”。这确保了最终的文档列表是多种优势的结合。
“超链接”超能力
然而,真正的魔力发生在第一份清单制作完成之后。在普通的图书馆里,如果你发现一页写着“参见:秘密食谱”,人类可能需要停下来思考,并请求图书管理员去寻找第二个页面。这既耗时又容易出错。
这个新系统拥有一个拓扑感知的多层控制器(Topologically-Aware Multi-Tier Controller)。把它想象成一个可以瞬间看到连接各页面的无形线条的机器人。
- 初次扫描: 它利用四名侦察兵找到最佳的初始文档。
- 链接跳转: 它立即扫描这些文档,寻找任何“超链接”或对其他文档的引用。
- 二次扫描: 系统不再要求一个缓慢的、需要思考的 AI 来决定下一步搜索什么,而是通过程序化的方式直接跳转到这些链接的文档并立即获取它们。
- 安全网: 为了确保系统不会陷入死循环(就像狗追逐自己的尾巴),系统维护了一个“已访问列表”。如果它看到一个已经检查过的文档,它就会跳过。它还会检查新文档是否符合原始链接的上下文,从而过滤掉无关的垃圾信息。
为什么这很重要:速度与智慧
作者测试了这个系统,并发现了令人印象深刻的结果。
- 更好的答案: 该系统提高了“召回率”(它找到了多少正确答案),在某些测试中达到了完美的 1.0000 Recall@100。它还提高了排名质量(即最好的答案出现在顶部的程度)达 13.2%。
- 极速响应: 最大的胜利在于速度。旧方法使用思考型 AI 来确定下一步操作,需要数秒时间(约 3,700 毫秒)。而这个新系统完成同样的工作仅需不到一毫秒(0.87 毫秒)。这是 95% 的等待时间缩减。
- 更少浪费: 通过仅获取所需的特定链接文档,系统减少了需要处理的额外文本(Token)量 25.8% 至 43.3%。
它不是什么
需要注意的是,这篇论文并不是要取代那个编写最终答案的大型 AI;它只是让“查找”这一环节变得更好。它还反对使用缓慢、循环的 AI 智能体来决定下一步搜索什么的观点,证明了通过直接、程序化的跳转到链接文档,速度更快且更可靠。
简而言之,这篇论文表明,通过结合四种不同的搜索风格、数学化地融合它们的结果,并利用文档自身的内部地图跳转到相关页面,我们可以构建出一个不仅更聪明,而且快到足以跟上实时对话的企业级搜索系统。它将一个混乱的图书馆变成了一个完美组织、高度互联的知识网络。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。