MixLM: High-Throughput and Effective LLM Ranking via Text-Embedding Mix-Interaction
MixLM 是一种新颖的大语言模型(LLM)排序框架,它通过混合交互机制将冗长的文本输入替换为紧凑的嵌入标记(embedding tokens),从而显著提升系统吞吐量,在保持高相关性的同时,实现了在实际搜索应用中的高效全流量部署。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在经营着一家规模宏大的图书馆,每秒钟都有数百万人向你寻求书籍推荐。你拥有一位才华横溢、超级聪明的图书管理员(即大语言模型,或 LLM),他能读完一本书的完整描述,理解用户的提问,并瞬间判断出他们是否是完美的匹配。
问题在于?这位图书管理员非常严谨。为了给出一个好的答案,他需要为每一个候选书籍阅读其整个描述。如果一本书有 2,000 个单词,而他需要检查 1,000 本书,那么仅仅为了处理一个人的请求,图书管理员就必须阅读 200 万个单词。在现实世界的计算机服务器中,这不仅耗时,而且成本极高。图书馆会发生积压,人们的等待时间也会过长。
由此诞生了 MixLM:“速记笔记型”图书管理员。
LinkedIn 的研究人员发明了一种全新的工作方式,称为 MixLM。与其让图书管理员每次都阅读整本书,不如在图书管理员看到书籍之前,先将书籍的描述预处理成一份精简、高度浓缩的“速记笔记”(被称为嵌入标记/embedding tokens 的几个数字)。
它是如何运作的,我们可以将其分解为以下简单的步骤:
1. “预读”阶段(离线阶段)
想象一下,在图书馆开门营业之前,有一组助手阅读了图书馆里的每一本书。他们并没有写下摘要,而是将整本书浓缩成了一张完美的“本质卡片”。
- 论文指出: 他们使用“编码器 LLM”(Encoder LLM)将数千词的项目文本转化为一小组学习到的嵌入标记(embedding tokens)。
- 类比: 这些“本质卡片”被存储在一个特殊的、快速访问的柜子中(即近线缓存/nearline cache),就在图书管理员的办公桌旁边。
2. “混合”阶段(在线阶段)
当用户提出“我想要一份数据科学方面的工作”时,图书管理员不需要再次阅读完整的职位描述。
- 他们获取用户的提问(文本)。
- 他们从柜子中取出顶尖候选职位的“本质卡片”(嵌入/embeddings)。
- 他们将用户的提问与这些微小的卡片进行“混合”。
- 论文指出: 这创造了一个“混合交互表示”(mixed-interaction representation),它将文本标记(text tokens)与嵌入标记(embedding tokens)结合在一起。
- 类比: 这就像图书管理员正在阅读一张便签,上面写着:“用户想要数据科学” + [职位 A 的卡片] + [职位 B 的卡片]。图书管理员可以瞬间“感受到”用户与职位之间的联系,而无需在数千个单词中苦苦挣扎。
3. 结果:速度与智慧
由于图书管理员只需阅读几张“卡片”而非整本书,他们可以处理请求的速度比以前快了 75 倍,同时依然保持了几乎与那个缓慢、严谨的版本同等的聪明程度。
- 论文声称: 与“摘要化”方法相比,MixLM 将吞吐量提升了 10.0 倍;与阅读全文相比,吞吐量提升了 75.9 倍。
- 类比: 这就像是一个每小时能检查 290 本书的图书管理员(旧方法)与一个每小时能检查 22,000 本书的图书管理员(MixLM)之间的区别,而两者的准确度几乎相同。
他们是如何教导图书管理员的
你可能会好奇:“图书管理员是如何学会阅读这些微小卡片的?”
研究人员使用了一种巧妙的训练方法:
- 老师: 首先,他们训练了一位阅读整本书且非常准确的“超级图书管理员”。
- 学生: 然后,他们训练了“MixLM 图书管理员”去模仿超级图书管理员的决策,但使用的是微小的卡片而非完整的文本。
- 对齐: 他们加入了特殊的规则(损失函数/loss functions),以确保“本质卡片”能完美地契合进图书管理员的大脑,使得文本与卡片的混合感觉自然顺畅。
现实世界的影响
当 LinkedIn 将此系统应用于其职位搜索功能时:
- 他们终于能够让这种超级智能的 AI 服务于所有人(全量流量),而不仅仅是少数幸运的用户。
- 因为搜索变得更快、更智能,更多的人找到了他们喜欢的工作。
- 论文声称: 这带来了 0.47% 的日活跃用户(DAU)增长。在拥有数百万用户的平台世界里,这微小的百分比代表着庞大的人群体验到了更好的服务。
总而言之: MixLM 就像是给一位超级智能的 AI 提供了一个“荧光笔”,将长篇文档浓缩成精炼且强大的笔记。这让 AI 能够在不损失智能的前提下读得更快,使职位搜索(以及其他事物)的搜索引擎既极速又精准。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。