LightRetriever: A LLM-based Text Retrieval Architecture with Extremely Faster Query Inference
LightRetriever 是一种新颖的检索架构,它通过采用一个仅限于嵌入查找的轻量级查询编码器,同时保留用于文档编码的全尺寸大语言模型(LLM),在保持 95% 原始检索性能的同时,实现了超过 1000 倍的查询推理速度提升和 10 倍的吞吐量提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在经营着一座拥有数百万本书籍(文档)和源源不断提问者(查询)的大型图书馆。
旧方法:过度劳累的图书管理员
传统上,当有人问出类似“什么是水果苹果?”这样的问题时,图书馆会使用一位超级聪明、受过高度专业训练的图书管理员(大语言模型或 LLM)来瞬间理解问题的深层含义,然后扫描整个图书馆以寻找最佳匹配。
问题在于,这位管理员虽然是天才,但既慢又昂贵。每当有新的人进来,你都必须唤醒这位沉重、缓慢的管理员来处理问题。如果同时涌入 1,000 人,管理员就会不堪重负,队伍会变长,系统也会变慢。
新方法:LightRetriever
本文的作者提出了一个名为“LightRetriever”的巧妙新系统,它将工作拆分为两个截然不同的角色,以实现极高的速度:
文档端(繁重的体力活):
图书馆仍然使用那位超级聪明、沉重的图书管理员在所有人到来之前阅读并索引所有的书。这是在后台离线进行的。管理员为每本书创建一份详细的“地图”并将其存储在数据库中。这是“沉重”的部分,但由于它是预先完成并存储起来的,因此不会减慢实时搜索的速度。查询端(闪电般的查找):
这是其中的魔术所在。当一个人带着问题走进来时,系统并不唤醒那位沉重的图书管理员。相反,它使用了一个微小、极速的助手。
- 运作方式: 助手只需查看问题中的单词(例如“苹果”、“水果”)。它会检查一份由图书管理员预先准备好的“速查表”(缓存的词义列表)。
- 类比: 与其让管理员在每次有人提问时都为“苹果”的意思写一篇新论文,不如让助手直接指向一张已经写着“苹果 = 圆的、红色的、水果”的便利贴。助手只需将这些便签粘合在一起即可形成答案。
- 结果: 这种查找几乎不耗费时间。这就像是用快速的“查表”动作取代了缓慢、详细的“访谈”。
权衡:速度 vs. 智力
该论文声称,这种新方法处理问题的速度比旧方法快 1,000 倍。
- 速度: 你可以每秒处理数千个问题而不会导致系统崩溃。
- 准确性: 出人意意的是,该系统仍然非常聪明。尽管“查询助手”所做的工作很少,但它找到正确书籍的能力仍能达到重型图书管理员水平的 95%。
为什么这很重要
作者在许多不同类型的提问(从简单的事实到复杂的推理)上对该方法进行了测试,发现对于大多数日常搜索,你并不需要为一个问题配备一个天才级别的头脑。你只需要一个知道在哪里寻找聪明答案的快速查找系统。
总结:
LightRetriever 就像是雇佣一位天才来组织一次图书馆(离线),但雇佣一个超快速的机器人来回答问题(在线),通过简单地指向天才留下的笔记来实现。这使得图书馆运行得极其快速且成本低廉,同时仍能为几乎所有人找到正确的答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。