← 最新论文
💻 computer science

A Pilot Study of Autocompleting Tokenizers

本文提出了一项关于“自动补全分词器”(autocompleting tokenizers)的试点研究,该方法利用轻量级自回归模型在 Transformer 处理之前预测并省略输入序列中的冗余字节,从而在不损害多种语言机器翻译质量的前提下,显著降低计算成本并缩短序列长度。

原作者: Samuel Wexler, Mark Hopkins

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Samuel Wexler, Mark Hopkins

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每天,数以百万计的人们在智能手机或电脑上打字时,都会使用那些能在用户完成输入前预测下一个词的系统。这些自动补全功能之所以有效,是因为人类语言充满了模式;一旦你看到了句子的开头,剩下的部分往往会遵循一条可预测的路径。这种预测的原理正是现代人工智能的核心,特别是驱动翻译和文本生成的那些大型计算机模型。这些被称为“Transformer”的模型功能极其强大,但需要海量的数据才能发挥作用。为了处理文本,它们将句子分解成被称为“token”(标记)的微小单元。多年来,标准方法是将字母组合成代表整个单词或单词部分的块,这种技术可以使数据保持在可控范围内。然而,存在一种更简单的替代方案:将文本分解为单个字节(byte),即数字信息的最小单位。虽然这种基于字节的方法具有通用性,且不需要为不同语言准备专门的词典,但它产生的序列过长,会导致计算机运行变慢并降低模型的效率。

威廉姆斯学院(Williams College)的研究人员试图通过提出一个简单的问题来解决这个问题:如果计算机能以高置信度预测序列中的下一个字母,那么它是否真的需要看到那个字母才能理解句子?他们提出了一种新的方法,其作用类似于一个智能过滤器,剔除文本中那些过于显而易见、缺乏实用价值的部分。通过训练一个小型且轻量级的程序充当自动补全助手,他们识别出了句子中哪些字节是如此可预测,以至于在主翻译模型看到它们之前就可以被安全地删除。其结果是生成了一个压缩版的文本,该版本显著缩短了长度,但仍保留了所有必要的含义。他们的实验表明,对于英语和法语等语言,他们可以在不损失任何翻译质量的情况下,移除近三分之一的字符。这一发现表明,我们输入到这些强大AI系统中的大量数据是冗余的,通过剥离掉这些可预测的部分,我们可以让这些模型变得更快、更高效,而不会牺牲它们理解世界的能力。

这项工作的核心涉及一个将文本输入机器方式进行转换的三步流程。首先,一个小型、快速的模型逐字节读取原始文本,并根据已看到的内容预测接下来的内容。如果模型对下一个字符非常有把握,它就会将该字符标记为“可预测的”。在第二步中,系统从序列中移除这些被标记的字符。为了确保主模型不会因缺失部分内容而产生困惑,系统会修改前一个字节以指示有一个字符被移除,从而允许模型通过上下文进行推断。最后,这个缩短后的、压缩后的序列被传递给一个大型的标准翻译模型,随后由该模型生成目标语言的输出。研究人员测试了几种处理这些缺失部分的方法,发现最有效的方法是使用这种特定类型的标记——即通过改变前一个字节来简单地记录字符的缺失,从而让主模型能够从上下文中推断出剩余部分。

当团队将这种技术应用于英语到法语的翻译时,结果令人瞩目。他们发现,可以将源文本压缩到原始长度的约68%,同时保持与未压缩版本完全相同的翻译质量。在某些情况下,压缩版本的表现甚至略好。研究人员还在具有不同书写系统和结构的语言上测试了该方法,包括语法复杂的芬兰语、使用不同字母表的俄语,以及字符代表整个单词而非声音的中文。在所有这些案例中,该方法都表现良好,将文本长度分别缩减至0.646(芬兰语)、0.468(俄语)和0.668(中文)的比例,同时保持甚至提升了翻译质量。这种在如此多样化的语言中的一致性表明,预测并移除冗余信息的能力是人类语言的一种基本属性,而不仅仅是英语的一个特性。

该研究还将这种智能压缩方法与更简单、不够复杂的缩短文本方式进行了对比,例如移除所有元音或仅保留每个单词的前几个字母。这些粗糙的方法无法维持翻译质量,证明了关键不在于仅仅移除字符,而在于移除“正确的”字符。研究人员证明,通过使用模型来识别文本中哪些部分是真正可预测的,他们可以剥离掉噪声,同时保持信号的完整。这种方法为降低运行大型语言模型的计算成本提供了一种切实可行的方式,潜在地使它们能够在性能较低的硬件上运行得更快。这项工作表明,我们目前强迫计算机处理的许多字节其实是不必要的,通过让模型自行填补空白,我们可以以更少的努力实现同样的结果。虽然这项研究是一项初步调查,但其发现为构建更高效的AI系统指明了清晰的路径,使这些系统能够处理多种语言,而无需承担处理每一个字符的沉重负担。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →