← 最新论文
💬 NLP

Faster Superword Tokenization

该论文提出了一种通过聚合预分词合并候选项频率并采用两阶段训练策略的优化方法,将 BoundlessBPE 和 SuperBPE 等超词分词算法的训练速度提升了 600 倍以上,并开源了相应的 Python 和 Rust 实现。

原作者: Craig W. Schmidt, Chris Tanner, Yuval Pinter

发布于 2026-04-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Craig W. Schmidt, Chris Tanner, Yuval Pinter

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文主要解决了一个让大型人工智能(AI)模型“读书”变慢的难题。为了让你轻松理解,我们可以把训练 AI 的过程想象成教一个外国学生阅读一本厚厚的百科全书

1. 背景:传统的“切词”方法(BPE)

想象一下,你要教学生阅读。传统的做法(叫 BPE)是这样的:

  • 规则:你先把书里的句子按空格或标点切成一个个小词块(比如 "to", "be", "the")。
  • 限制:你规定,切好的词块之间不能再合并。比如,你不能把 "to" 和 "be" 拼成一个新词 "to be",因为它们在原来的规则里是两块。
  • 结果:学生只能认识这些固定的小词块。虽然这很安全,但效率不高,因为很多常见的短语(如 "to be")被拆散了,学生得一个个去记,读起来很慢。

2. 新的尝试:打破界限(BoundlessBPE 和 SuperBPE)

之前的研究(BoundlessBPE 和 SuperBPE)提出了一个大胆的想法:打破界限!

  • 超级词(Superwords):允许把相邻的两个词块(比如 "to" 和 "be")合并成一个“超级词”("to be")。
  • 好处:这样学生就能直接认出整个短语,读得更快,理解更自然,AI 模型的效果也更好。
  • 大麻烦:但是,之前的实现方法太慢了
    • 比喻:以前的做法就像,为了教学生认 "to be",老师必须把整本百科全书都背下来,放在脑子里,然后一页一页地翻,找哪里出现了 "to" 后面跟着 "be"。
    • 后果:处理 1GB 的数据(对于 AI 训练来说其实很少),竟然需要 4.7 天!这就像为了教学生认几个词,老师花了几天时间翻书,效率极低。

3. 本文的突破:聪明的“记账法”

这篇论文的作者(来自 Kensho Technologies 和以色列本·古里安大学)想出了一个绝妙的办法,把训练速度提高了 600 多倍(从 4.7 天缩短到 10 分钟左右)。

他们是怎么做到的?用了两个核心策略:

策略一:不再背整本书,而是“记账”(聚合)

  • 旧方法:像刚才说的,把整本书(所有文档)都塞进内存里,一遍遍扫描。
  • 新方法:作者发现,我们不需要知道 "to be" 具体出现在哪一页,只需要知道它出现了多少次就够了。
  • 比喻
    • 以前:老师拿着放大镜,在 100 万页书里找 "to be"。
    • 现在:老师直接拿个计数器。只要看到 "to be",计数器就 "+1"。最后老师只拿着一个写着“出现次数”的小本子去训练,完全不需要看原书。
    • 效果:内存占用极小,速度极快。

策略二:分两步走(两阶段法)

为了让这个“记账法”行得通,作者把训练过程拆成了两个阶段,就像先练基本功,再练绝招

  • 第一阶段(练基本功)
    • 先不管那些“超级词”,只教学生认识最基础的词块(就像传统的 BPE)。
    • 这时候,学生已经能认出大部分单词了。
  • 第二阶段(练绝招)
    • 现在,老师拿着第一阶段做好的“小本子”(基础词表),去检查哪些相邻的词块经常一起出现(比如 "to" 和 "be")。
    • 如果它们经常一起出现,就允许把它们合并成“超级词”。
    • 关键点:作者发现,这种“先练基础,再合并”的方法,和以前那种“一边练基础一边合并”的复杂方法,最终教出来的学生是一模一样的,但速度却快得惊人。

4. 额外的巧思:处理没有空格的语言

对于中文、日文这种没有空格的语言,以前的方法容易把字切得乱七八糟(比如把一个汉字切成两半,变成乱码)。

  • 比喻:就像切蛋糕,如果蛋糕上没有画线,你一刀下去可能把上面的草莓(字的一部分)切飞了。
  • 新方案:作者规定,每个汉字/字符必须是一个独立的“小蛋糕块”,不能切半。然后再把这些小蛋糕块根据需要拼成“超级蛋糕”(短语)。这样既保证了字是完整的,又能灵活组合。

5. 成果与意义

  • 速度飞跃:处理同样的数据,从 4.7 天 变成了 603 秒(约 10 分钟)。
  • 开源工具:作者不仅提出了理论,还免费开源了代码(有 Python 版和更快的 Rust 版),让任何人都能轻松使用这种更快的训练方法。
  • 未来影响:以前因为训练太慢,大家不敢用这种更好的“超级词”方法。现在速度上来了,未来的 AI 模型可能会读得更准、理解得更深,而且训练成本更低。

总结

这篇论文就像给 AI 训练装上了一个超级加速器。它没有改变 AI 学习的“最终目标”(还是那个聪明的学生),而是换了一种更聪明的教学方法(从“死记硬背整本书”变成了“高效记账 + 分步教学”),让原本需要几个月的训练过程,现在只需要喝杯咖啡的时间就能完成。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →