← 最新论文
💬 NLP

MixLM: High-Throughput and Effective LLM Ranking via Text-Embedding Mix-Interaction

MixLM 是一种新颖的大语言模型(LLM)排序框架,它通过混合交互机制将冗长的文本输入替换为紧凑的嵌入标记(embedding tokens),从而显著提升系统吞吐量,在保持高相关性的同时,实现了在实际搜索应用中的高效全流量部署。

原作者: Guoyao Li, Ran He, Shusen Jing, Kayhan Behdin, Yubo Wang, Sundara Raman Ramachandran, Chanh Nguyen, Jian Sheng, Xiaojing Ma, Chuanrui Zhu, Sriram Vasudevan, Muchen Wu, Sayan Ghosh, Lin Su, Qingquan So
发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Guoyao Li, Ran He, Shusen Jing, Kayhan Behdin, Yubo Wang, Sundara Raman Ramachandran, Chanh Nguyen, Jian Sheng, Xiaojing Ma, Chuanrui Zhu, Sriram Vasudevan, Muchen Wu, Sayan Ghosh, Lin Su, Qingquan Song, Xiaoqing Wang, Zhipeng Wang, Qing Lan, Yanning Chen, Jingwei Wu, Luke Simon, Wenjing Zhang, Qi Guo, Fedor Borisyuk

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营着一家规模宏大的图书馆,每秒钟都有数百万人向你寻求书籍推荐。你拥有一位才华横溢、超级聪明的图书管理员(即大语言模型,或 LLM),他能读完一本书的完整描述,理解用户的提问,并瞬间判断出他们是否是完美的匹配。

问题在于?这位图书管理员非常严谨。为了给出一个好的答案,他需要为每一个候选书籍阅读其整个描述。如果一本书有 2,000 个单词,而他需要检查 1,000 本书,那么仅仅为了处理一个人的请求,图书管理员就必须阅读 200 万个单词。在现实世界的计算机服务器中,这不仅耗时,而且成本极高。图书馆会发生积压,人们的等待时间也会过长。

由此诞生了 MixLM:“速记笔记型”图书管理员。

LinkedIn 的研究人员发明了一种全新的工作方式,称为 MixLM。与其让图书管理员每次都阅读整本书,不如在图书管理员看到书籍之前,先将书籍的描述预处理成一份精简、高度浓缩的“速记笔记”(被称为嵌入标记/embedding tokens 的几个数字)。

它是如何运作的,我们可以将其分解为以下简单的步骤:

1. “预读”阶段(离线阶段)

想象一下,在图书馆开门营业之前,有一组助手阅读了图书馆里的每一本书。他们并没有写下摘要,而是将整本书浓缩成了一张完美的“本质卡片”。

  • 论文指出: 他们使用“编码器 LLM”(Encoder LLM)将数千词的项目文本转化为一小组学习到的嵌入标记(embedding tokens)。
  • 类比: 这些“本质卡片”被存储在一个特殊的、快速访问的柜子中(即近线缓存/nearline cache),就在图书管理员的办公桌旁边。

2. “混合”阶段(在线阶段)

当用户提出“我想要一份数据科学方面的工作”时,图书管理员不需要再次阅读完整的职位描述。

  • 他们获取用户的提问(文本)。
  • 他们从柜子中取出顶尖候选职位的“本质卡片”(嵌入/embeddings)。
  • 他们将用户的提问与这些微小的卡片进行“混合”。
  • 论文指出: 这创造了一个“混合交互表示”(mixed-interaction representation),它将文本标记(text tokens)与嵌入标记(embedding tokens)结合在一起。
  • 类比: 这就像图书管理员正在阅读一张便签,上面写着:“用户想要数据科学” + [职位 A 的卡片] + [职位 B 的卡片]。图书管理员可以瞬间“感受到”用户与职位之间的联系,而无需在数千个单词中苦苦挣扎。

3. 结果:速度与智慧

由于图书管理员只需阅读几张“卡片”而非整本书,他们可以处理请求的速度比以前快了 75 倍,同时依然保持了几乎与那个缓慢、严谨的版本同等的聪明程度。

  • 论文声称: 与“摘要化”方法相比,MixLM 将吞吐量提升了 10.0 倍;与阅读全文相比,吞吐量提升了 75.9 倍
  • 类比: 这就像是一个每小时能检查 290 本书的图书管理员(旧方法)与一个每小时能检查 22,000 本书的图书管理员(MixLM)之间的区别,而两者的准确度几乎相同。

他们是如何教导图书管理员的

你可能会好奇:“图书管理员是如何学会阅读这些微小卡片的?”
研究人员使用了一种巧妙的训练方法:

  1. 老师: 首先,他们训练了一位阅读整本书且非常准确的“超级图书管理员”。
  2. 学生: 然后,他们训练了“MixLM 图书管理员”去模仿超级图书管理员的决策,但使用的是微小的卡片而非完整的文本。
  3. 对齐: 他们加入了特殊的规则(损失函数/loss functions),以确保“本质卡片”能完美地契合进图书管理员的大脑,使得文本与卡片的混合感觉自然顺畅。

现实世界的影响

当 LinkedIn 将此系统应用于其职位搜索功能时:

  • 他们终于能够让这种超级智能的 AI 服务于所有人(全量流量),而不仅仅是少数幸运的用户。
  • 因为搜索变得更快、更智能,更多的人找到了他们喜欢的工作。
  • 论文声称: 这带来了 0.47% 的日活跃用户(DAU)增长。在拥有数百万用户的平台世界里,这微小的百分比代表着庞大的人群体验到了更好的服务。

总而言之: MixLM 就像是给一位超级智能的 AI 提供了一个“荧光笔”,将长篇文档浓缩成精炼且强大的笔记。这让 AI 能够在不损失智能的前提下读得更快,使职位搜索(以及其他事物)的搜索引擎既极速又精准。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →