← 最新论文
💬 NLP

In-Place Tokenizer Expansion for Pre-trained LLMs

本文介绍了一种原位分词器扩展方法,该方法通过在多语言语料库上继续进行 BPE 合并,并利用子词平均值初始化新嵌入来升级预训练大语言模型,从而在不牺牲模型质量的前提下,显著减少了印地语和越南语等语言的标记数量并提高了解码速度。

原作者: Jimmy T. H. Smith, Tarek Dakhran, Alberto Cabrera, Simon S. Lee, Paul Pak, Aditya Tadimeti, Tim Seyde, Maxime Labonne, Alexander Amini, Mathias Lechner

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Jimmy T. H. Smith, Tarek Dakhran, Alberto Cabrera, Simon S. Lee, Paul Pak, Aditya Tadimeti, Tim Seyde, Maxime Labonne, Alexander Amini, Mathias Lechner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机器的语言:快速入门

想象一下,你正在教一个机器人说话。为了做到这一点,你不能只给它一本包含宇宙中所有词汇的字典;那样的话,字典太重了,它带不动。相反,你给它一组积木。在人工智能的世界里,这些积木被称为标记(tokens)。把标记想象成计算机理解的最小文本块——有时是一个完整的单词,比如“cat”(猫),但通常只是一个音节,比如“ca”或者甚至只是一个字母“c”。

当一个机器人学习语言时,它会决定如何将句子拆分成这些积木。如果它先学习英语,它可能会有一个专门针对单词“the”的特殊积木。但如果你稍后要求它说印地语或越南语,而它并没有为此做好准备,它可能不得不把这些单词拆成极小、极低效的碎片,比如把“Hindi”拆成“H-i-n-d-i”。这就像是试图用锤子来盖房子,虽然能用,但既慢又笨拙,而且还浪费能量。这篇论文探讨了如何在不从头开始重建整个机器人的情况下,升级机器人的“工具箱”(它的词汇表)的问题。


破碎工具箱的谜题

见见 Jimmy 和他在 Liquid AI 的团队。他们正在研发一个非常聪明的机器人,叫做 LFM2,它运行在手机和笔记本电脑等设备上。这个机器人擅长英语和编程,但当它尝试说印地语、越南语或泰语时,它却会磕磕绊绊。为什么呢?因为它的词汇表就像一个为了伦敦之行而打包的工具箱,而不是为了曼谷。当机器人尝试写“Hindi”这个词时,它并没有一个完整的单词积木。相反,它必须使用四个或五个微小的积木来拼凑起来。这让机器人变得缓慢、疲惫,并且消耗大量电量。

团队面临着一个艰难的选择。他们可以放弃已有的工作,从头开始构建一个拥有更好工具箱的新机器人。或者,他们可以尝试在不破坏原有机器人的情况下,悄悄地向旧机器人中塞入一套新工具。第二个选项就像是在汽车在高速公路上行驶时,试图给正在运转的引擎增加一个新的抽屉。大多数人认为这是不可能的,或者风险太高。

“原地”升级

团队发现了一个可以实现这一目标的聪明方法。他们称之为分词器扩展(Tokenizer Expansion)。他们没有扔掉旧的工具箱,而是保留了原有的工具,并简单地在盒子末端添加了新的工具。

以下是他们分步实现的方法:

  1. 智能复制粘贴: 他们提取了机器人现有的积木列表,并让它开始学习多种不同语言的混合内容。当机器人学习新词汇时,它并没有丢弃旧的积木。相反,它为像“Hindi”或“Thai”这样的词创造了新的、更大的积木。至关重要的一点是,每一个新积木都是通过将它已知的旧的小积木拼接而成的。这就像是意识到,如果你有一个“H”积木和一个“i”积木,你可以把它们拼在一起组成“Hi”积木,然后再把这个与“nd”和“i”拼在一起,从而组成“Hindi”。
  2. 神奇的胶水(嵌入初始化): 现在机器人有了新积木,但它并不知道这些积木代表什么意思。团队必须教会机器人这些新积木所代表的内容。他们使用了一个简单但精妙的技巧:他们观察了构成新积木的旧积木,并赋予了新积木这些部分“平均”后的含义。如果一个新积木是由三个旧积木组成的,机器人的大脑就会赋予它那三个部分的“平均性格”。这意味着机器人不需要瞎猜,它从一开始就拥有了一个非常好的初始猜测。
  3. 两阶段锻炼: 机器人还没准备好跑马拉松。如果让他们立即开始跑步,它会摔跤。所以,他们进行了一次两阶段的锻炼:
    • 第一阶段: 他们冻结了机器人的大脑(除了新积木以外的所有部分),只让新积木进行学习。这就像是让工具箱里的新抽屉在不移动汽车其余部分的情况下,先适应装载东西。
    • 第二阶段: 一旦新积木变得熟练了,他们就解冻了整个机器人,让它再次练习阅读和写作多种语言。这有助于机器人理解这些新积木如何融入大局。

结果:更快、更聪明、更轻量

结果令人印象深刻。通过使用这种新的、扩展后的工具箱,机器人可以更高效地使用印地语、越南语和泰语。

  • 印地语文本被拆分的积木数量减少了 2.4 倍
  • 越南语减少了 2.6 倍
  • 泰语的变化最大,需要的积木数量减少了 4.0 倍

因为机器人处理同样的内容时需要更少的积木,它变得更快了。团队估计,在手机上,使用这些语言时,每个字符的处理速度提升了 2.2 到 3.7 倍。这就像是从步行切换到了骑自行车;机器人用极短的时间完成了同样的距离。

他们学到了什么(以及避免了什么)

团队还学到了哪些事是不该做的,这同样重要。

  • 不要触碰旧工具: 在一次实验中,他们尝试在添加新积木的同时,让机器人重新学习其积木的含义。这让机器人变得困惑,它开始像坏掉的唱片一样不断重复。他们发现,保持旧积木完全不变是成功的秘诀。
  • 不要只读英语: 当他们尝试主要利用英语文本来教机器人学习新积木时,机器人虽然擅长回答选择题,但在实际书写句子方面表现得很差。它能选出正确答案,但无法讲述一个故事。他们明白,必须喂给它多种语言的均衡饮食,才能保持它的健康。

核心结论

这篇论文表明,你并不总是需要建造一个全新的机器人才能让它学会一种新语言。如果你是机器人的构建者,你可以在它生命的中途升级它的词汇表。通过仔细添加新工具并赋予它们正确的“平均”含义,你可以让机器人变得更快、更高效,且无需失去它已有的技能。这是一个让 AI 更具包容性、更快速的实用方案,直接运行在你口袋里的设备上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →