← 最新论文
🤖 machine learning

BrahmicTokenizer-131K: An Indic-Capable Drop-In Replacement for o200k_base

本文介绍了 BrahmicTokenizer-131K,它是 OpenAI 的 o200k_base 的即插即用替代品,通过对词表进行精准改造,在保持英语、代码和数学任务上具有竞争力的性能的同时,实现了对印度语言更优的压缩效果。

原作者: Rohan Shravan

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Rohan Shravan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在为一次旅行打包行李箱,这次旅行既包括英语国家城市,也包括印度九个拥有各自独特文字(如天城文、泰米尔文或奥里亚文)的地区。

问题:“一刀切”的行李箱
目前,大多数人工智能模型使用的是一种标准的“行李箱”(分词器),其设计主要针对英语和少数几种欧洲语言。当你试图将印度语言塞进这个行李箱时,它并不合身。

  • 类比:想象一下,试图将一件精致复杂的印度纱丽塞进一个专为 T 恤设计的行李箱。由于行李箱没有合适的隔层,它迫使你不得不将纱丽折叠成细小且凌乱的碎片。
  • 结果:像奥里亚语这样的印度语言中的一个单词,可能仅仅为了塞进行李箱而被切分成三个独立的碎片。相比之下,一个英语单词可能只需一个碎片即可容纳。这使得“行李箱”(即 AI 处理的数据)变得沉重得多,携带成本也更高,尽管实际的信息量是相同的。

解决方案:BrahmicTokenizer-131K
本文的作者创建了一种更智能的新行李箱,名为BrahmicTokenizer-131K。他们并非从零开始制造行李箱,而是选取了一个非常高质量且流行的行李箱(OpenAI 的 o200k_base),对其进行了“手术”改造,使其完美适配印度语言,同时不破坏其承载英语或代码的能力。

以下是他们通过简单步骤实现这一目标的过程:

1. “断舍离”(第一阶段)

原始行李箱拥有 200,000 个隔层。其中许多隔层装满了本次特定旅行不需要的语言物品(如韩语、日语、阿拉伯语或俄语)。

  • 行动:他们扔掉了 38,000 个未使用的隔层。
  • 结果:现在他们拥有一个更干净、更小的行李箱,恰好包含 131,072 个隔层,准备进行新的布局。

2. “手术式改造”(第二阶段)

现在行李箱里有了空余空间。他们没有让这些空间闲置,而是小心翼翼地用高频印度单词和字符将它们填满。

  • 策略:他们使用数学公式(线性规划)来决定哪些印度单词值得获得一个位置。他们优先考虑了那些此前被忽视的语言,例如奥里亚语。
  • 神奇之处:他们专门增加了725 个隔层用于奥里亚文字符。在此之前,行李箱里零个位置留给奥里亚语,迫使每个奥里亚字母都被拆解成细小且低效的碎片。现在,它们可以容纳完整的奥里亚语单词或其大部分片段。

3. “即插即用”功能

最棒的是,这个新行李箱在外观上与旧行李箱完全一致。

  • 类比:这就像将标准汽车发动机更换为高性能发动机,而新发动机恰好能装入完全相同的发动机舱内。你无需重建汽车、更换轮胎或重写手册。
  • 声明:任何使用旧行李箱的 AI 训练流程都可以简单地将其替换为新行李箱,并立即生效。

结果:发生了什么变化?

该论文在包含 2700 万份印度文档的庞大集合上测试了这个新行李箱。以下是他们的发现:

  • 巨大的节省:对于印度语言,这个新行李箱产生的碎片(token)数量比当前最佳竞争对手(Tekken/Sarvam-m)减少了26.7%
    • 示例:对于奥里亚语,改进幅度巨大。旧行李箱需要4.3 倍多的碎片来承载相同的文本。而新行李箱则能高效地承载它。
  • 没有权衡取舍:通常,当你让行李箱在某一方面变得更好时,它在另一方面就会变差。但这个新行李箱是一个“通用型”赢家。
    • 它在打包英语单词方面与原版一样出色。
    • 实际上,它在打包计算机代码和数学问题方面比竞争对手更好
  • “专家”与“通才”的权衡
    • 还有其他专为印度语言设计的行李箱(专家型)。它们在打包印度单词方面略胜一筹(大约好 12–18%)。
    • 然而,这些专家型行李箱在打包英语或代码方面表现糟糕。
    • BrahmicTokenizer-131K 是唯一一个能在同一尺寸限制下,同时出色地处理所有内容(印度语言、英语、代码和数学)的行李箱。

总结

该论文提出了一种工具,解决了 AI 处理印度语言时的结构性低效问题。通过手术式地移除未使用的语言槽位,并用精心挑选的印度语言槽位取而代之,他们创建了一种分词器,在为印度语言节省大量计算能力的同时,保持了现代 AI 模型所依赖的英语和代码的高性能。这是一个“即插即用”的升级方案,使得在印度数据上训练 AI 变得更便宜、更快速,而不会牺牲其说英语或编写代码的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →