← 最新论文
💬 NLP

Length-MAX Tokenizer for Language Models

本文介绍了 Length-MAX 分词器,这是一种通过图划分方法优化词表选择的新颖方法,旨在最小化平均每字符标记数,从而在与标准字节对编码(BPE)相比,实现训练步数、推理延迟和内存使用的显著降低,同时提升下游性能。

原作者: Dong Dong, Weijie Su

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Dong Dong, Weijie Su

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个超级聪明的机器人如何使用人类语言。为了做到这一点,你必须将每一句话分解成微小的构建模块,这些模块被称为“标记”(tokens)。把这些标记想象成乐高积木。如果你使用一套标准的积木,你可能需要用一百万个微小的碎片才能盖起一座简单的房子,这会让建筑过程变得缓慢且混乱。多年来,制造这些积木最流行的方法(一种叫做字节对编码,或 BPE 的方法)是抓取最常见的字母组合并把它们粘在一起。这就像是在说:“嘿,‘th’和‘e’经常出现,所以我们做一个‘the’积木吧。”但这种方法有一个缺陷:它太喜欢短小、常见的词了,以至于不断地将长而有意义的短语拆解成微小、低效的碎片。这迫使机器人必须处理比必要更多的积木,减慢了它的思考速度,并消耗了它的内存。

现在,想象一下另一种构建乐高套装的方式。与其仅仅寻找最频繁出现的组合,不如问问:“如果我们制作更大的、更聪明的积木,让它们覆盖更广的范围,会怎样呢?”这就是宾夕法尼亚大学的研究人员董东(Dong Dong)和苏维杰(Weijie Su)提出的一种新方法的核心。他们引入了一种名为 Length-MAX 的新分词器。Length-MAX 不仅仅是统计一个词出现的次数,它还会奖励那些出现频率足够高且具有实用价值的长短语。这就像是意识到虽然“the”很常见,但短语“the United States”是一个比三个独立碎片更好的构建模块。通过用更少、更长、更有意义的积木替换掉那些微小、重复的积木,机器人可以更快地构建句子,使用更少的内存,并且实际上能更好地理解故事。

问题在于过多的微小积木

长期以来,教计算机语言的标准方式是将文本根据出现的频率切分成小块。这被称为字节对编码(BPE)。它的工作原理是找到相邻的两个最常见的符号,并将它们合并成一个新的标记。这有点像一个游戏,你不断组合最受欢迎的邻居,直到你用完所有的招数。

问题在于,这个游戏偏爱短小、高频的片段。它将像“in the midst of a historic snowstorm”(在一次历史性的暴风雪中)这样连贯的长句视为一系列微小、脱节的碎片。因为现代 AI 模型必须关注每一个碎片才能理解整个句子,所以拥有过多的微小碎片会导致数学复杂度爆炸。这就像是在读一本书,每个单词都被拆成了三个音节;为了获得同样的意义,你必须阅读三倍数量的“单词”。这减慢了训练速度,让 AI 回答问题的速度变慢,并需要更多的计算机内存。

Enter Length-MAX:“长即是好”的策略

这项研究背后的研究人员决定改变局面。他们问道:“如果我们针对长度而不是仅仅针对频率进行优化,会怎样呢?”他们创建了一个名为 Length-MAX 的新分词器。

Length-MAX 不仅仅寻找最常见的配对,它还会寻找使特定得分最大化的子字符串:频率 × 长度。它奖励那些既常见又长的标记。如果一个短语如“the United States”出现得足够频繁,Length-MAX 就会抓住它并将其作为一个单一标记,而不是将其拆分为“the”、“United”和“States”。

为了实现这一点,团队必须解决一个棘手的数学难题。他们发现,寻找一组完美的长标记是一个极其复杂的问题,以至于在处理海量文本时,在数学上是不可能完美解决的(这个问题被称为 NP-hard)。因此,他们构建了一个聪明的“贪婪”算法。想象一个计分板,每个可能的短语都会根据其长度和出现频率获得一个分数。该算法会挑选出得分最高的短语,将其锁定,然后重复此过程直到词表填满。他们利用一种称为 Rabin-Karp 滚动哈希的技术使这一过程变得极其快速,该技术让他们能够像高速扫描仪一样扫描文本,并且他们在数百个计算核心上同时运行。

结果:更快、更小、更聪明

团队通过从头开始训练 AI 模型(具体来说是 GPT-2 模型)并将其与标准 BPE 方法进行对比,测试了这种新方法。结果令人印象深刻,各方面表现出色:

  • 更少的标记: 在不同的词表大小下,与 B 方法相比,Length-MAX 将表示文本所需的标记数量减少了 14–18%。对于 64,000 个词的词表,减少量为 13.0%。这意味着 AI 处理同样的内容时需要处理显著更少的“积木”。
  • 更快的训练: 因为要处理的标记更少,模型学习得更快了。为了达到特定的技能水平,1.24 亿参数的模型需要 18.5% 更少的步骤,3.55 亿参数的模型需要 17.2% 更少的步骤,13 亿参数的模型需要 18.5% 更少的步骤
  • 更快的回答: 当模型被要求生成文本时,它们的速度更快了。对于 124M 模型,推理延迟(回答所需的时间)下降了 13.7%,而生成文本的速度(吞吐量)提升了 16%
  • 更少的内存: 模型也使用了更少的内存。研究人员发现,模型“工作记忆”(称为 KV-cache)和词嵌入所需的内存下降了 18%
  • 更好的理解: 令人惊讶的是,使用更少的标记并没有让 AI 变笨;反而让它变得更聪明了。在衡量 AI 理解长篇故事和上下文能力的测试中,Length-MAX 模型表现更好。例如,在名为 LAMBADA 的测试中,AI 的困惑度(perplexity)下降了 11.7%,而在常识推理测试 HellaSwag 中,准确率提高了 4.3 个点

为什么它有效(以及它不做什么)

Length-MAX 的魔力不仅在于它节省时间,还在于它改变了 AI 看待世界的方式。通过将单词组合成更长的、有意义的短语(如“in the midst of”),AI 可以更容易地维持句子的上下文。这就像是理解一个故事时,是通过观察单个字母,还是通过观察整个单词和短语来理解的区别。

研究人员还检查了他们是否破坏了语言自然的“节奏”。他们发现,Length-MAX 仍然遵循语言频率的自然规律(即 齐普夫定律/Zipf's law),这意味着它并没有创造出奇怪、随机的长词。它在保持语言自然结构的同时,提高了效率。

然而,论文也谨慎地指出,这种方法 并不做 什么。它不适用于已经训练完成且处于冻结状态的模型;你必须使用新的分词器从头开始训练模型才能获得这些收益。此外,它目前专注于英语文本,因此目前尚不清楚它是否在结构迥异的其他语言中同样有效。而且,虽然对于高达 13 亿参数的模型结果很强,但研究人员建议,对于更庞大的模型(如 70 亿参数的模型),其收益可能类似,但尚未经过充分测试。

总结

Length-MAX 是对一个数十年之久的难题提出的新鲜方法。通过意识到对于标记而言“长通常意味着更好”,研究人员找到了一种让 AI 模型运行得更快、更便宜、且在理解上下文方面表现得更出色的方法。这提醒我们,有时,前进的最佳方式不是建造一个更大的引擎,而是建造一个更聪明的变速器。代码和新的词表现已向所有人开放,为从下一代语言模型中榨取更多效率提供了一种实用的途径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →