← 最新论文
💬 NLP

Giga-Embeddings: Mixture-of-Experts Encoders for High-Throughput Text Embeddings

该论文介绍了 Giga-Embeddings,这是一个文本嵌入模型系列,其特点是采用了一个拥有 100 亿参数的稀疏混合专家(Mixture-of-Experts)编码器,在多种语言上实现了最先进的检索质量和高吞吐量,同时还包含针对资源受限环境优化的较小规模稠密模型及蒸馏版本。

原作者: Egor Kolodin, Egor Krasnoperov, Evgeniy Kosarev, Fyodor Minkin

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Egor Kolodin, Egor Krasnoperov, Evgeniy Kosarev, Fyodor Minkin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字世界中,计算机并不像人类那样理解文字。对于机器而言,一个句子仅仅是一串很长的符号。为了理解文本,研究人员开发了一种将单词转化为数字列表的方法,这种方法被称为“嵌入”(embeddings)。可以将这些列表想象成每一段文本的唯一地址,将其置于一个巨大的多维空间中,在那里,相似的思想靠得很近,而不同的思想则相距甚远。这一系统驱动着我们日常使用的工具,从寻找正确文档的搜索引擎,到基于文本库回答问题的人工智能。然而,这个领域存在着一种持续的张力:系统越复杂,它对语言的理解通常就越好,但运行它所需的计算能力和内存也越多。如何在不损失智能的前提下使这些系统变得更快、更便宜,一直是科学家们面临的一大挑战。

一个研究小组推出了一系列名为 Giga-Embeddings 的新型文本嵌入模型,旨在通过平衡高质量与高速度来解决这个问题。他们最宏大的创作是一个包含一百亿个参数的大型模型,参数量是衡量其内部复杂度的指标。该模型并没有使用全部一百亿个参数来处理每一个单词,而是使用了一种称为“混合专家”(mixture of experts)的技术。想象一个大型图书馆,每当读者索要一本书时,只有一小组特定的图书管理员会被叫出来提供帮助,而其余的工作人员则处于待命状态。在这个计算机模型中,对于每个单词,大约只有 18 亿个参数被激活,而全部一百亿个参数都保留在内存中。这使得系统既能拥有巨大大脑的知识储备,又能在任何给定时刻只发挥较小规模大脑的工作量。

研究人员将这个大型模型与其他几个模型进行了对比测试,其中包括一个拥有 30 亿参数的标准稠密模型,以及一个拥有 4.8 亿参数的精简版模型。他们在涉及英语、俄语、多语言文本和计算机代码的广泛任务上对这些系统进行了评估。结果显示,这个大型稀疏模型在所有这些类别中都取得了最高的整体性能。它不仅对文本的理解优于较小的模型,而且处理信息的速度也更快。在测量系统每秒能处理多少单词时,这个百亿参数模型比 30 亿参数的模型快了 25%,并且显著快于在相同环境下测试的其他先进系统。这证明了构建一个既具有巨大容量又具有高效运行能力的系统是完全可能的。

为了让这些强大的工具能够被计算能力较低的设备所使用,该团队还创建了一个小得多的模型版本。他们使用了一种称为“相似性分布蒸馏”(similarity-distribution distillation)的方法来教导这个紧凑型模型。该小模型并不是试图复制大型“教师”模型的精确内部数值,而是学习模仿大型模型关于不同文本片段之间相似程度的最终判断。这使得这个仅有 4.8 亿参数的小模型,其表现几乎可以媲美规模大得多的 30 亿参数模型。在俄语文本测试中,这个小模型的得分略高于一个规模几乎是其两倍之多的知名竞争对手,这表明如果教学方法得当,较小的系统也可以非常高效。

该团队已向公众发布了他们所有的三个版本的模型,以便他人将其用于各种应用。他们发现,大型稀疏模型在处理长文本方面特别有效,即使输入内容变长,也能保持其速度。虽然较小的模型所需的存储内存较少,但大型模型在处理重型任务时提供了速度与准确性的最佳结合。研究人员指出,他们的测量是在特定的测试环境下进行的,因此实际应用中的表现可能会因所使用的硬件不同而略有差异。尽管如此,这项工作展示了一条清晰的前进路径:通过使用巧妙的架构选择和精心的教学方法,可以创造出既强大到足以处理复杂任务,又高效到足以在现代计算机上快速运行的文本理解系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →