← 最新论文
🤖 machine learning

Kronecker Embeddings: Byte-Level Structured Token Representations for Parameter-Efficient Language Models

本文介绍了克朗内克嵌入,这是一种确定性的字节级分解方法,用固定编码器和可学习投影替代传统的大型嵌入表,从而在大型语言模型中消除了超过 90% 的输入侧可训练参数,同时提升了训练效率、拼写鲁棒性和运行时内存使用效率。

原作者: Rohan Shravan

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Rohan Shravan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一座巨型图书馆,其中每本书都拥有一张独特的身份证。在标准的语言模型(AI)中,当计算机看到一个单词时,它所做的第一件事就是在一本庞大的、预先写好的电话簿中查找该单词的身份证。这本电话簿被称为嵌入表

对于小型模型而言,这本电话簿尚可管理。但对于驱动当今最先进 AI 的庞大“前沿”模型来说,这本电话簿已变成一个臃肿的怪物。它占用了价值数亿美元的计算机内存,并要求 AI 在开始思考句子含义之前,先耗费巨大的算力去死记硬背哪个身份证对应哪个单词。

克罗内克嵌入(Kronecker Embeddings) 是一种构建这座图书馆的新方法,它彻底摒弃了那本巨大的电话簿。

以下是其工作原理,使用简单的类比来说明:

1. 旧方法:巨大的电话簿

将标准 AI 想象成一名学生,必须死记硬背一本字典,其中从"apple"到"zephyr"的每一个单词都被分配了一个特定的随机数字。

  • 问题所在:如果字典有 130,000 个单词,学生就必须死记硬背 130,000 个随机数字。这会占用其大脑(内存)中的巨大空间,并拖慢其速度。
  • 怪癖:该研究发现,这本“电话簿”实际上非常不擅长理解词族。如果你问 AI 关于"run"的问题,它的电话簿会显示最接近的单词是"Run"、"run"和".run"(仅仅是大小写或标点符号不同的同一个词)。它将"run"和"running"视为陌生人,尽管它们彼此相关。

2. 新方法:乐高蓝图

克罗内克嵌入扔掉了电话簿。相反,它给 AI 提供了一份乐高蓝图

  • 工作原理:每个单词只是一串微小的积木块(字节)。蓝图规定:“如果你在第一个位置看到'b',就使用这块特定的乐高积木。如果你在第二个位置看到'a',就使用那块积木。”
  • 神奇之处:AI 不需要死记硬背单词"run"。它通过按特定位置将'r'、'u'和'n'的积木块拼接起来,即时构建出单词"run"。
  • 结果:AI 不再需要一本巨大的电话簿。它只需要一本微小的说明书(投影矩阵),就能知道如何将那些乐高积木拼接成有意义的形状。这节省了模型输入端通常所需的**91–94%**的内存。

3. 论文实际发现的内容

研究人员将这种新方法与旧方法进行了测试,发现了一些令人惊讶的结果:

  • 对拼写错误更智能:因为新方法是从单个字母(字节)构建单词的,所以它理解"netwrok"与"network"非常相似。如果你打错了字,AI 仍然能识别出单词的轮廓。而依赖巨大电话簿的旧方法,在出现拼写错误时,往往会将单词分解成令人困惑的碎片。
    • 类比:如果你将"cat"误拼为"cst",旧 AI 可能会认为你在谈论一个完全不同的、未知的物体。而新 AI 能看到"c"和"t"处于正确的位置,从而知道你可能指的是"cat"。
  • 学习速度更快:在测试中,使用乐高蓝图(克罗内克)的 AI 在预测句子中下一个单词方面的表现,比使用电话簿的 AI 高出约2.5%。而且,它达到同等技能水平所使用的训练步数减少了 43%
  • 不会“忘记”新单词:如果你让 AI 谈论一个生造词,比如"kronekticus",旧 AI 会感到困惑并编造一个虚假的定义。而新 AI 由于是从字母构建单词,可以完美地将这个生造词复述给你,保留你给出的确切拼写。

4. 权衡(潜在缺陷)

该论文诚实地指出了缺点。

  • 混淆的“双胞胎”:因为新方法关注字母,所以它有时会将外观相似的单词视为相关,即使它们的含义不同。例如,"compute"和"commute"在字母层面上看起来非常相似。新 AI 可能会认为它们是近亲,尽管一个关乎数学,另一个关乎旅行。AI 必须利用其“大脑”(模型的其余部分)根据上下文来区分差异。
  • 无法“系结”节点:在旧系统中,AI 可以使用同一本电话簿进行读写以节省空间。新系统的结构差异太大,无法这样做,因此它需要一本独立的小手册用于写作。不过,论文指出,最大的 AI 模型本身就已经在摒弃这种“系结”做法了。

5. 这对未来的意义

该论文表明,通过移除巨大且沉重的电话簿,我们可以释放那部分庞大的计算机内存。

  • 重新分配:不再将内存浪费在静态的单词列表上,而是可以将节省下来的空间用于扩大 AI 的“大脑”(Transformer 主体),使其更聪明,或能够阅读更长的文档。
  • 边缘设备:对于在手机或小型设备上运行 AI 而言,这是一个游戏规则的改变者。新方法允许 AI 在发货时不带有多 GB 的单词列表。它可以从一个仅 4.5 MB 的小文件中重建单词,而不是一个 2 GB 的文件,这使得在小型硬件上运行强大的 AI 变得容易得多。

总结:
克罗内克嵌入用一套灵活的、逐字母的构建套件,取代了庞大且僵化的字典。它节省了海量内存,更好地处理拼写错误,学习速度更快,并允许 AI 处理它从未见过的单词,同时保持 AI 其余架构完全不变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →