← 最新论文
💬 NLP

BitNet Text Embeddings

BITEMBED 是一个极低比特框架,它将预训练的 LLM 主干网络转换为三值权重、量化激活值的嵌入编码器,并通过蒸馏技术对其进行训练,以在显著降低存储和带宽成本的同时,实现全精度水平的性能,并提供灵活的多精度输出嵌入。

原作者: Zhen Li, Xin Huang, Liang Wang, Nan Yang, Ting Song, Yan Xia, Xun Wu, Shaohan Huang, Huishuai Zhang, Furu Wei, Dongyan Zhao

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhen Li, Xin Huang, Liang Wang, Nan Yang, Ting Song, Yan Xia, Xun Wu, Shaohan Huang, Huishuai Zhang, Furu Wei, Dongyan Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的图书库,你想从中找到最符合你某个特定问题的书。为了快速实现这一目标,计算机将每一本书和每一个问题都转化成了一个“数字指纹”——一个被称为**嵌入(embedding)*的长数字列表。这些指纹捕捉了文本的含义*,以便计算机可以通过数学方式进行比较。

长期以来,制作这些指纹的最佳方法是使用一个巨大的、超级聪明的脑子(大语言模型或 LLM)。但问题在于:这些庞大的大脑运行起来很慢,而且它们的指纹会占用大量的存储空间。这就像是为了找一个事实,却要背着一整座百科全书图书馆在背包里到处跑。

这篇论文介绍了一种名为 BITEMBED 的新方法,用于制作这些数字指纹,它既超级快体积微小,且不会损失太多“聪明度”。

以下是他们是如何实现的,我们使用了一些简单的类比:

1. 问题所在:沉重的背包

目前的系统使用“全精度”模型。把这想象成背着一个装满了沉重、高清晰度金砖的背包。每一块砖(模型中的一个数字)都非常精确且珍贵,但这个背包太重了,以至于:

  • 推理(运行模型): 抬起和移动这个背包需要很长时间。
  • 存储: 你需要一个巨大的仓库来存放数百万个这样的背包。

2. 解决方案:“BitNet”背包

作者决定将那些沉重的金砖换成轻量级的三值块。与其使用广泛的数值范围,不如将模型的内部权重简化为仅有的三种状态:-1, 0, 或 +1

  • 类比: 想象一下,将一幅复杂的、色彩丰富的画作替换成一幅仅使用黑、白、灰三色的简单素描。它轻得多,也更容易携带,但如果你做得对,它看起来仍然像原画一样。

3. 训练过程:如何教导素描艺术家

你不能直接把一个聪明的脑子突然变“笨”(低比特),否则它会崩溃。论文描述了一个三步走的训练过程来解决这个问题:

  • 步骤 A:“再教育”(持续预训练)
    当你简化模型时,它会遗忘一些世界知识。作者首先使用海量的文本对(例如“问题”和“答案”)对简化后的模型进行重新教学,以重建它对单词之间关系的理解。

    • 类比: 这就像是让一位退休教授参加一个关于新、简化语言的速成班,然后再让他开始重新教学。
  • 步骤 B:“影子学生”(蒸馏)
    他们让原始的、沉重的、聪明的模型(“老师”)在后台运行。新的、轻量级的模型(“学生”)试图模仿老师。

    • 相似性蒸馏(Similarity Distillation): 学生不仅学习哪个答案是正确的,还学习老师对于不同答案之间关系的“信心程度”。
    • 注意力蒸馏(Attention Distillation): 学生观察老师的脑子是如何聚焦于句子中不同部分的(例如哪些词是最重要的),并尝试模仿这种聚焦方式。
    • 类比: 学生不仅是在背诵答案;他们还在观察老师的思考过程,并试图像老师一样思考,尽管他们的脑容量更小。

4. 魔法技巧:“Matryoshka(俄罗斯套娃)”指纹

通常,如果你想要一个更小的文件,你必须训练一个全新的模型。BITEMBED 则不同。它训练模型使其能够同时生成多种尺寸的指纹。

  • 类比: 想象一下俄罗斯套娃(Matryoshka)。
    • 如果你有充足的存储空间,你可以使用全 16 位的娃娃(最大、最详细的版本)。
    • 如果空间不足,你也可以只使用 8 位4 位的内层娃娃。
    • 即使是 1 位版本(最小的娃娃),在寻找正确的书方面依然表现得足够好。
  • 模型学会了变得“鲁棒”,这意味着它知道如何在缩小自身规模的同时,不丢失核心含义,从而允许用户在速度/存储与完美准确度之间进行即时选择。

结果:他们发现了什么?

作者在名为 MMTEB 的巨大基准测试(一个测试模型理解文本能力的巨大测试)上进行了测试。

  • 速度: 与沉重的、全精度的版本相比,新的 BITEMBED 模型在标准计算机芯片(CPU)上运行速度快了 2 倍
  • 聪明度: 尽管它们是“轻量级”的,但 BITEMBED 模型的表现几乎与沉重的老师模型一样出色。在一项测试中,两者的差距不到 1%。
  • 存储: 通过使用较小的“内层娃娃”(较低的比特精度),他们可以将存储需求降低高达 16 倍,同时仍保持模型寻找信息的能力。

总结

BITEMBED 就像是把一位超级聪明但沉重的图书管理员,交给他们一个简化语言的速成班,并教会他们如何用一个微小的、轻量级的背包来携带他们的知识。他们寻找正确书籍的速度和准确度可以与沉重的图书管理员一样快且精准,但他们可以做得更轻便,且速度更快。这使得强大的 AI 搜索工具能够在那些没有庞大计算能力或存储空间的设备和系统中成为可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →