Beyond Two Bytes per Letter: Tokenization Overhead in Cyrillic AI Systems
本文量化了现代人工智能系统中乌克兰语及其他西里尔字母语言相比英语所面临的显著分词开销,证明了这种差异源于训练数据的分配,但可以通过推理时压缩技术或通过训练平衡的字节级 BPE 分词器来有效缓解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
当计算机阅读句子时,它看到的并不是人类所理解的那种单词。相反,它会将文本分解成被称为“标记”(tokens)的小块,这些标记是机器理解含义和计算成本的基本单位。对于使用拉丁字母的语言(如英语),这些块通常非常高效,因为字母本身在计算机内存中占用的空间极小。然而,对于使用西里尔字母(如乌克兰语)的语言,情况则有所不同。这些脚本使用的字符需要更多的数字空间来存储,并且由于用于训练人工智能的大部分数据都是英语,计算机已经学会了非常高效地处理英语文本,却在处理西里尔字母方面显得力不从心。这产生了一种隐形的税收:为了处理相同数量的信息,计算机处理乌克兰语句子时可能需要将其分解成比英语多近两倍的碎片,从而使过程变得更慢、更昂贵。
独立研究员伊万·多布罗沃尔斯基(Ivan Dobrovolskyi)的一项近期研究调查了这种差异,该研究专门针对乌克兰语,但其结论也适用于许多其他使用西里尔字母的语言。这项研究提出了一个简单但至关重要的问题:为什么计算机在处理这些语言时如此困难,我们能否在等待技术彻底变革之前解决这个问题?研究表明,问题不仅仅在于字母的形状或它们占用的空间大小,而是在于计算机学习阅读它们的方式。通过分析不同现代系统如何分解文本,研究人员发现,这种不平衡源于训练数据本身。计算机看到的英语文本远多于乌克兰语文本,因此它为乌克兰语学到的“捷径”较少。
为了衡量问题的规模,研究人员测试了九种由大型科技公司使用的不同商业系统。他们向这些系统输入了数百万个乌克兰语单词,并将每个系统生成的碎片数量与为英语生成的碎片数量进行了对比。结果显示存在显著差距。在最现代化的系统上,乌克兰语文本所需的碎片比英语多 68% 到 121%。在较旧的系统中,这一差距甚至更大,达到了 220%。这意味着,对于处理英语文本所花费的每一美元,用户在处理相同数量的乌达克语文本时,可能会多花近两倍的钱,仅仅是因为计算机必须做更多的工作来分解这些词汇。
研究还探讨了转向拉丁字母(即“罗马化”过程)是否能解决问题。有些人建议,使用拉丁字母书写乌克兰语会使计算机阅读起来更便宜、更快。然而,研究发现对于现代系统而言,情况恰恰相反。由于这些系统已经学会了高效处理乌克兰网络上存在的原生西里尔字母,强行将文本转换为拉丁字母反而会让计算机感到困惑。这导致文本被分解成更多的碎片,在某些系统上增加了高达 19% 的成本。计算机最擅长处理的是它在训练数据中见得最多的脚本,而对于乌克兰语来说,那就是原生的西里尔脚本。
为了了解是否能在源头上解决问题,研究人员创建了一个新的自定义系统,旨在平等对待英语和乌克兰语。这个新系统不再让计算机从庞大的、以英语为主的互联网中学习,而是使用了一个完美平衡的英语和乌克兰语混合文本进行训练。结果令人震惊。当使用这个平衡后的系统时,效率差距大幅缩小。乌克兰语文本不再需要两倍多的碎片;相反,它仅比英语多出约 30% 的碎片。这证明了高昂的成本并非字母本身的不可避免的物理限制,而是由于计算机是如何被训练的结果。如果训练数据是平衡的,计算机就能为两种语言都实现高效处理。
研究还探索了一种在不改变计算机训练的情况下降低成本的方法。通过使用一种能够智能移除文本中不必要单词的技术,研究人员能够将乌克兰语文本量减少近一半。至关重要的是,这种压缩并没有损害计算机在涉及数千件真实产品和客户问题的测试中找到正确答案的能力。该系统检索正确价格、评分和细节的准确度,与使用完整、未压缩文本时完全一致。这表明,虽然训练失衡是一个根深蒂固的问题,但目前仍有实用的方法可以降低成本。
最终,这项研究揭示了西里尔字母语言的低效是一个关于数据分配的可解问题,而非脚本本身固有的缺陷。计算机并没有“坏掉”,它只是对它所见最多的数据产生了偏见。通过调整训练数据以包含更多这些代表性不足的语言,或者使用智能压缩工具,我们可以缩小成本和速度上的数字鸿沟。这些发现为实现更公平的人工智能提供了一条清晰的路径,确保这些强大工具的益处不会仅限于那些使用最常见脚本的人群。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。