Phonemes to the Rescue: Multilingual Tokenization Based on International Phonetic Alphabet
本文提出将国际音标(IPA)作为一种与语言无关的输入方式用于多语言分词器,以解决不同语言之间的性能差异,并证明了基于国际音标的分词能够提高质量和泛化能力,尤其是在非拉丁脚本方面。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一群来自 24 个不同国家的学生一起阅读一个故事。问题在于,这些学生说着不同的语言,并使用不同的书写系统。有些学生使用拉丁字母(如英语),有些使用字符(如中文或日文),还有些使用完全不同的脚本(如阿拉伯文或希腊文)。
在人工智能的世界里,这些“学生”就是大语言模型(LLM),而“阅读”的过程被称为分词(Tokenization)。在计算机理解一个句子之前,它必须将句子切分成被称为“标记”(Tokens)的小块。
问题所在:“一刀切”的剪刀
目前,大多数 AI 模型使用一种标准的方法来切割文本。论文指出,这种方法是不公平的,就像是给每个人都发了一把同样的剪刀,却期望他们能同样好地剪开纸张、硬纸板和钢铁。
- 高资源语言(纸张): 对于英语这类语言,剪刀效果很好。单词被切分成极少的碎片。
- 低资源或非拉丁语系语言(钢铁): 对于日语、泰语或印地语等语言,同样的剪刀却显得力不从心。因为这些脚本拥有复杂的字符,或者无法很好地适配计算机的标准“字节”系统,计算机不得不将这些单词切成许多极其细碎、破碎的片段才能理解。
结果: 英语中的一个句子可能只需要 5 个标记来阅读,而同样的句子在泰语中可能需要 15 个标记。这使得泰语句子的处理速度慢了三倍,运行成本高了三倍,而且往往导致回答的质量更低。论文称之为“标记税(Token Tax)”。
解决方案:“通用声音地图”(IPA)
作者提出了一个聪明的变通方法。他们建议不要向计算机输入书面文字(正字法),而是输入单词的读音,并使用**国际音标(IPA)**来表示。
把 IPA 想象成一张通用的声音地图。
- 无论你用英语写成 "cat",用法语写成 "chat",还是用西班牙语写成 "gato",它们的读音都有些相似。
- IPA 将所有这些不同的书面单词转化为一套统一的、共享的声音符号(例如 /k/, /æ/, /t/)。
通过在计算机进行分词之前将文本转换为 IPA,作者实际上是在说:“让我们停止关注那些奇怪、复杂的字母形状,转而倾听声音。”
为什么这行得通(类比说明)
1. 共享背包(词汇效率)
想象计算机有一个背着固定数量“意义块”插槽的背包。
- 旧方法: 计算机为英语填充特定的块,然后为日语填充特定的块,再为阿拉伯语填充特定的块。由于这些脚本差异巨大,背包里装满了独特的、互不重叠的物品。没有剩余的空间留给那些不太常见的语言。
- IPA 方法: 因为 IPA 使用了一套适用于所有语言的小型共享声音符号,计算机可以用“声音块”来填充背包,这些块对每个人都适用。代表 "ship" 中 "sh" 音的块,与代表日语中 "sh" 音的块是相同的。这创造了一个更高效的、共享的词汇表。
2. 均匀的砖墙(压缩率)
- 旧方法: 有些语言就像是用巨大的、沉重的砖块来砌墙(复杂的字符占据了大量的计算机内存),而另一些语言则使用小石子。最终墙体变得凹凸不平,某些部分占用的空间比其他部分多得多。
- IPA 方法: IPA 将一切转化为标准尺寸的砖块(主要是 1 或 2 个字节)。现在,一段中文和一段英文都是由同样大小的砖块组成的。墙面变得平整了,计算机也不必为那些“沉重”的语言承担额外的重量。
研究人员做了什么
该团队选取了 24 种语言(包括英语、日语、俄语、泰语和阿姆哈拉语),并做了两件事:
- 使用一个名为 Epitran 的工具(一种字形到音素的转换器)将所有文本转换为 IPA。
- 训练了两组“切割器”(分词器):一组处理原始文本,另一组处理 IPA 声音。
他们在 14 种不同的书写系统上测试了这些模型,发现 IPA 切割器在几乎所有方面都表现优异:
- 更少的碎片: 它们将单词拆解成的碎片更少(更好的压缩率)。
- 更公平的待遇: 英语所需的碎片数量与泰语所需的碎片数量之间的差距大幅缩小。这种“标记税”被降低了。
- 对未知内容的更好处理: 当他们将模型测试在训练过程中未见过的语言上时,IPA 模型处理得比标准文本模型要好得多。
权衡之处
论文指出有一个难点:你很难轻易地将声音还原回原始的书写形式。
如果你只用 IPA 训练一个模型,它学会的是用声音说话。如果你让它写故事,它可能会输出音标而不是标准的字母。论文提到,虽然这是一个局限性,但其在“理解”和“处理”方面的益处非常显著,因此这是一个极具前景的研究方向。他们还指出,对于发音规则复杂的语言(例如一个拼写对应两种含义的多音字/词),转换并不完美,但足以产生巨大的改进。
核心结论
该论文声称,通过在处理之前从“阅读字母”转向“聆听声音”(通过 IPA),我们可以让 AI 模型对所有语言(而不仅仅是使用拉丁字母的语言)更加公平、高效且准确。这就像是给班上的每个学生都戴上了一副眼镜,让他们无论说什么语言,都能以同样清晰、统一的方式看待世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。