← 最新论文
💬 NLP

Compute Optimal Tokenization

本文表明,在计算最优的语言模型配置中,参数量与以字节而非令牌计量的数据规模成比例扩展,揭示了最优令牌压缩率不同于标准字节对编码,并随计算量的增加而降低。

原作者: Tomasz Limisiewicz, Artidoro Pagnoni, Srini Iyer, Mike Lewis, Sachin Mehta, Alisa Liu, Margaret Li, Gargi Ghosh, Luke Zettlemoyer

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Tomasz Limisiewicz, Artidoro Pagnoni, Srini Iyer, Mike Lewis, Sachin Mehta, Alisa Liu, Margaret Li, Gargi Ghosh, Luke Zettlemoyer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在建造一座终极知识图书馆。你有一笔固定的资金(你的计算预算)来建造这座图书馆。你主要有两个选择:

  1. 购买一座拥有数百万个空书架的巨大建筑(模型规模)。
  2. 购买一大堆书来填满这些书架(训练数据)。

多年来,专家一直告诉图书管理员:“要获得最好的图书馆,每建造一个书架,就购买 20 本书。”但这条建议有一个隐藏的缺陷:它假设每本书的大小都一样。事实上,有些书是厚厚的百科全书,而另一些则是薄薄的宣传册。

这篇题为**“计算最优分词”**的论文认为,我们一直用错误的单位来衡量我们的“书”。与其数“书”(token),不如数“页”(字节)。

以下是他们研究发现的简要说明,使用了简单的类比:

1. “书的大小”问题(压缩率)

在人工智能领域,文本被切分成称为token的块。

  • 低压缩:想象将一句话切分成单个字母。你会得到一大堆微小的碎片(许多 token)。
  • 高压缩:想象将完整的单词甚至短语组合成单个块。你会得到一小堆大块(较少的 token)。

这篇论文问道:我们切分块的大小重要吗?
答案是肯定的。块的大小(称为压缩率)会改变我们建造图书馆的效率。

2. 找到最佳点:“字节与 token"规则

研究人员训练了近 1,000 个不同的 AI 模型,调整块的大小和模型的大小。他们发现了一条关于完美平衡的新规则:

  • 旧规则:“每参数购买 20 个 token。”(这仅在 token 具有特定大小时有效,例如标准的 BPE token)。
  • 新规则:“每参数购买60 字节的文本。”

类比
把你的 AI 模型想象成一位厨师,数据就是食材。

  • 如果你给厨师提供切好的小份食材(高压缩),他们可以很快烹饪出很多餐食。
  • 如果你给他们提供整颗蔬菜(低压缩),他们必须先切菜,这需要时间。
  • 论文发现,无论你怎么切蔬菜,厨师在每单位技能(参数)拥有特定重量的食材(60 字节)时表现最佳。无论这重量是 20 个大块还是 100 个碎屑,重要的是总重量

3. “金发姑娘”压缩率

你可能会想:“如果我让块变得更大,就能节省更多时间,所以我应该把它们做得尽可能大!”
论文说:别急。

他们发现块的大小存在一个**“金发姑娘区”**(即大小适中)。

  • 太小:模型会被过多的微小数据碎片压垮。
  • 太大:模型会丢失太多细节,因为块太粗糙。
  • 刚刚好:存在一个特定的压缩率,能在给定预算下产生最智能的模型。

转折:随着你拥有更多资金(更多计算能力),“刚刚好”的大小实际上会变得更小

  • 类比:如果你有一个小厨房,你可能想要切好的蔬菜以节省时间。但如果你有一个巨大的专业厨房,拥有无限的工作人员,你可能更喜欢整颗蔬菜,因为你可以如此高效地处理它们,以至于额外的细节值得付出努力。

4. 一种尺寸并不适合所有情况(语言很重要)

研究人员在不同语言(英语、印地语、阿拉伯语、俄语等)上测试了这一点。他们发现,“刚刚好”的块大小取决于语言。

  • 类比:想象为不同的旅行打包行李箱。
    • 对于前往一个人们使用非常紧凑单词的语言(如英语)的国家旅行,你可能会打包稍大一点的物品。
    • 对于前往一个单词较长或使用不同脚本(如印地语或阿拉伯语)的国家旅行,“最佳”的打包方式会发生变化。
  • 论文发现,流行的 AI 工具(如 Llama 3 或 Qwen)通常使用“一种尺寸适合所有”的打包方法。这对英语来说还可以,但对某些语言来说往往压缩过度,而对另一些语言来说则压缩不足。它们本质上是为特定旅行打包了错误大小的物品。

关键要点总结

  1. 停止数 token,开始数字节。 在规划向 AI 喂入多少数据时,测量文本的原始大小(字节),而不是块的数量(token)。比例应大致为模型中每 100 万参数对应60 字节的文本
  2. 存在一个完美的块大小。 将 token 做得太大或太小都会损害性能。压缩存在一个特定的“最佳点”。
  3. 最佳点会变化。 随着你拥有更强大的计算机,实际上应该使用稍小的块(较低的压缩率)以获得最佳结果。
  4. 语言很重要。 印地语的最佳块大小与英语不同。当前的 AI 模型通常使用一种通用的设置,这对每种语言来说都不是最优的。

简而言之:要构建尽可能智能的 AI,不要仅仅遵循“每参数 20 个 token"的旧规则。相反,将文本的重量大脑的大小相匹配,并根据你拥有的计算能力以及你正在教授的语言来调整文本块的大小

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →