← 最新论文
💬 NLP

Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language Models

本文对 11 种东南亚语言的公平分词器进行了系统性评估,证明了 Parity-aware BPE 和 Morphology-Driven Byte Encoding 在平衡多语言大语言模型的压缩效率、语义推理和跨语言公平性方面具有显著优势。

原作者: Kieron Seven Jun Wei Lee, Muhammad Reza Qorib, Andrew Ivan Soegeng, Hwee Tou Ng

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Kieron Seven Jun Wei Lee, Muhammad Reza Qorib, Andrew Ivan Soegeng, Hwee Tou Ng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图构建一个能够翻译 11 种不同东南亚语言的通用翻译器。为此,你需要一本“字典”,将句子分解成细小、易于处理的块(称为词元/tokens),以便计算机理解。

长期以来,大型 AI 模型使用的标准字典一直存在偏见。它主要是为英语和使用拉丁字母的语言(如西班牙语或法语)构建的。当这个字典试图处理其他语言(如缅甸语、高棉语或泰语)时,它会变得笨拙。它会将这些语言切碎成极其微小且低效的碎片,使得计算机在处理相同信息量时需要付出更多的努力,成本也更高。

这篇论文就像一份消费者报告,测试了三种新的、更公平的字典,以观察哪一个最适合这些代表性不足的语言。研究人员不仅观察了字典,还利用每种字典构建了小型 AI 大脑(15 亿参数),以观察 AI 的思考和翻译能力如何。

以下是使用简单类比对他们研究结果的解读:

问题所在:“一刀切”的西装

标准方法(称为字节级 BPE)就像一位只知道为身材高大、宽肩的人(英语使用者)量体裁衣的裁缝。当一个具有不同体型的人(东南亚语言使用者)尝试穿上这套西装时,裁缝不得不将布料剪成数百个细小、尴尬的碎布片,才能使其合身。

  • 结果: 与处理英语相比,AI 在处理缅甸语或老挝语时需要处理更多的“碎布片”。这使得 AI 对这些语言的使用者来说运行速度更慢、成本更高,且准确性较低。

竞争者:三种新方法

研究人员测试了三种新的“裁缝”方法:

  1. 感知对等 BPE(“公平优先”型裁缝)

    • 工作原理: 这种方法将英语西装和缅甸语西装并排对比。如果缅甸语西装得到的碎布片过多,这位裁缝就会强制调整切割过程以实现平衡。它牺牲了一点点整体速度,以确保每个人都能得到尺寸大致相仿的西装。
    • 结论: 这是 帕累托前沿(Pareto Frontier) 的获胜者。它位于“完美平衡线”上。它提供了最佳的公平性(每个人支付的成本大致相同),同时没有损失太多的效率。它是构建公平 AI 的推荐“默认”选择。
  2. 形态驱动字节编码 / MYTE(“语言学家”型裁缝)

    • 工作原理: 这位裁缝不再仅仅根据字母或声音进行切割,而是研究语言的语法词根(形态学)。他沿着语言自然的“缝隙”进行切割。
    • 结论: 这产生了最聪明的 AI。因为理解了单词的“缝隙”,AI 在处理复杂思想的推理和翻译方面表现得更好。然而,这些西装更重,制作起来也更耗时(计算成本更高)。如果你需要高质量的翻译并且预算充足,这是最佳选择。
  3. 字节潜变量变换器 / BLT(“无字典”型裁缝)

    • 工作原理: 这种方法试图完全跳过字典。它不再将布料切割成预定义的形状,而是尝试在运行过程中即时猜测原始布料块片的含义。
    • 结论: 这是表现不佳者。虽然听起来很有创新性,但 AI 却表现挣扎。研究人员怀疑,由于这种方法依赖于“猜测”模式,它会被现有数据有限的低资源语言所困扰。它还没有足够的练习来掌握交通规则。

核心要点

  • 公平性与效率并非敌人: 你不必在快速 AI 和公平 AI 之间做选择。“公平优先”型裁缝(感知对等 BPE)证明了你两者皆可兼得。
  • “文字系统”并不重要,“工具”才重要: 研究人员发现,无论一种语言是使用拉丁字母还是复杂的泰文或缅甸文字,都不会决定成本。选择什么样的字典才是关键。糟糕的字典会让每个人都付出更多代价;好的字典则能让成本趋于相等。
  • 语境即王道: “语言学家”型裁缝(MYTE)最擅长理解深层含义,但“公平优先”型裁缝则是最实用的全能选手。

结论

如果你正在为东南亚构建 AI,不要仅仅使用标准的、带有英语偏见的字典。

  • 如果你想要一个平衡、公平且高效的系统,请使用 感知对等 BPE
  • 如果你需要绝对最好的翻译和推理能力,并且负担得起额外的计算能力,请使用 MYTE
  • 目前请避免使用 BLT,因为在本研究的特定语言约束下,它的表现很挣扎。

最终,这篇论文表明,通过简单地改变我们切分文本的方式,我们可以让 AI 对数亿被现有系统遗忘的人群来说变得更加便宜且公平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →