← 最新论文
💬 NLP

Tokenization with Split Trees

本文介绍了 ToaST,这是一种新颖的子词分词方法,它利用分裂树和整数规划来优化词汇选择以实现最少的词元数量,与 BPE 和 WordPiece 等现有基线相比,在压缩效率和语言模型性能方面取得了显著提升。

原作者: Craig W. Schmidt, Michael Krumdick, Adam Wiemerslage, Seth Ebner, Varshini Reddy, Yuval Pinter, Chris Tanner

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Craig W. Schmidt, Michael Krumdick, Adam Wiemerslage, Seth Ebner, Varshini Reddy, Yuval Pinter, Chris Tanner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过互联网发送一座庞大的图书馆,但你的网络连接很慢。为了加快传输速度,你希望在不丢失任何含义的前提下,将书籍压缩成尽可能最少数量的“块”(token)。

长期以来,实现这一目标的标准方法就像一位乐高建造师:他从微小的单个积木(字母)开始,只有当看到两块积木经常粘在一起时,才将它们逐一粘合。这种方法称为BPE,它快速且贪婪,但并不总是最高效的。它可能会将本不该粘在一起的两块积木强行粘合,或者因为先被较小的片段卡住,而错失了将整个单词粘合在一起的机会。

这篇论文介绍了一种名为ToaST(基于分裂树的 Tokenization)的新方法。以下是其工作原理,借助一些简单的类比来说明:

1. “可能性之树”(分裂树)

ToaST 不是将事物粘合在一起,而是从一个完整的单词(例如"Kentucky")开始,并问道:“如果我必须将这个单词切成两半,最佳切分点在哪里?”

它查看一个庞大的数据库,了解单词的不同部分在现实世界中出现的频率。它选择那个能将单词切分成两个都非常常见片段的切分点。然后,它拿这两个片段,再次提出同样的问题。它持续这样做,直到切分到单个字母。

  • 类比:想象你有一条巨大的、未切分的长面包。你不是随机切片,而是查看人们通常食用面包的分布地图。你找到完美的切分点,使得两半都是受欢迎的尺寸。然后,你取这两半,在最受欢迎的部位再次切片。最终,你得到了一个家族树,展示了从整条面包到单个面包屑的所有可能切分方式。

2. “智能菜单”(词汇选择)

现在,你拥有了数百万种可能的切分树。你无法使用所有切分;你只有有限的空间来容纳特定数量的“菜单项”(词汇表大小,例如 40,000)。

旧方法只是挑选最流行的切分。ToaST 则使用数学优化器(整数规划)来玩一场“如果……会怎样?”的游戏:

  • 如果我将"Kentucky"这个大块作为一个单独的 token 选中,总共能节省多少块?
  • 如果我将"Kent"和"ucky"分开选中,是否能在其他地方节省更多空间?

它计算出最佳的切分组合,使得书写整座图书馆所需的总块数最少。这就像一位厨师规划菜单,不仅基于什么最流行,还基于如何用尽可能少的盘子服务最多的顾客。

3. “魔法技巧”(推理)

一旦菜单设定好,读取文本的速度就很快了。当计算机看到"Kentucky"时,它会查看树的顶部。

  • "Kentucky"在菜单上吗??太好了,将其作为一个 token 发送。
  • "Kentucky"在菜单上吗??那么查看下一层。"Kent"在菜单上吗??发送"Kent",然后在另一侧查找"ucky"。

由于树是在选择菜单之前构建的,路径始终清晰。没有令人困惑的规则,也没有“如果我改变这个会发生什么?”的情景。

为什么这更好?

论文声称,对于大型图书馆(词汇表大小为 40,000 以上),ToaST 显著优于旧方法:

  • 压缩:它将所需的块数减少了超过11%。这就像将一份 100 页的文档压缩到 89 页,而不丢失任何一个字。
  • 效率:它使用了更少的“单字母”token(例如只发送字母'y'或'u')。这使得数据流动更加顺畅和高效。
  • 性能:当他们使用这种新方法训练语言模型(一个学习说话的大脑)时,该模型在测试中表现更好。与使用旧方法训练的模型相比,它在推理和逻辑任务中得分更高。

核心结论

ToaST 是一种分解文本的新方法。它不是盲目地将碎片粘合在一起,而是绘制出单词所有可能的切分方式,然后利用强大的数学求解器挑选出绝对最佳的切分集合,以最小化数据总量。其结果是,计算机读写语言的方式变得更加高效、快速和智能。

注意:该论文仅在英文文本上测试了此方法。它并未声称这些结果适用于其他语言,也未讨论医疗或临床用途。这些改进严格限于文本处理的效率以及语言模型在标准基准测试中的表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →