The Tokenizer Tax Across 25 European Languages: Domain Invariance, Cross-Lingual Few-Shot Effects, and the Ukrainian Penalty
本文量化了 25 种欧洲语言的“分词器税”,揭示出非英语语言(尤其是乌克兰语及形态复杂的语言)因在预训练数据中代表性不足而面临显著更高的词元 - 词比率,同时证明这些生育力排名在不同领域间保持一致,且少样本效应源于模型内在特性而非语言依赖。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在支付出租车费。在英语中,出租车按“词”(stop)收费。但在乌克兰语中,出租车司机坚持按“步”(step,即词的微小片段)收费。由于乌克兰语单词通常更长、更复杂,司机到达同一目的地需要迈出更多的“步”。结果,即使距离未变,你为完全相同的行程支付的费用却翻了一倍。
本文由 Volodymyr Ovcharov 撰写,聚焦于在使用人工智能时非英语语言所面临的这种隐性“税收”。以下是他们发现的要点,辅以简单类比:
1. “步”税(分词器丰度)
人工智能模型不像人类那样阅读完整单词,而是将文本切分成称为token(词元)的微小片段。
- 类比:将单词想象成一条面包。
- 英语:人工智能将面包切成大块厚片。你只需 1.2 片就能代表一个单词。
- 乌克兰语:人工智能使用钝刀,将同一条面包切成细小、易碎的小块。代表一个单词需要 2.7 片。
- 成本:由于人工智能公司按“片”(token)收费,因此对于相同数量的文本,使用乌克兰语的成本比英语高出约2.2 倍。
- 层级:该研究测量了 25 种欧洲语言。
- 廉价组:英语、西班牙语和法语(每词 1.2 至 1.7 片)。
- 中等组:德语和荷兰语(每词 1.7 至 1.9 片)。
- 昂贵组:波兰语和捷克语等斯拉夫语言(每词 2.2 至 2.5 片)。
- 最昂贵组:乌克兰语、希腊语和马耳他语(约 3.1 片)。
2. “乌克兰语惩罚”
研究人员发现了一个关于乌克兰语的惊人事实:尽管乌克兰语、波兰语和捷克语都是结构相似的斯拉夫“表亲”,但乌克兰语的处理成本显著更高。
- 类比:想象两家完全相同的工厂。一家(波兰语)因长期建设而拥有充足的预切砖块供应;另一家(乌克兰语)因过去被忽视,不得不从原石中切割每一块砖。
- 原因:该研究表明,与波兰语或捷克语相比,人工智能“图书馆”中乌克兰语的训练数据少了 2 到 6 倍。由于人工智能较少见到乌克兰语单词,它不知道如何高效地组合它们,只能不断将其切分成细小、低效的片段。
3. “一刀切”的刀
该研究测试了这种“税收”是否会根据讨论内容(如法律合同、新闻或维基百科)而变化。
- 发现:这无关紧要。无论你谈论的是足球、法律还是历史,哪种人工智能“便宜”、哪种“昂贵”的排名完全一致。
- 启示:如果你在某类文本上测试了人工智能,你就确切知道它在任何其他类型文本上的成本。你无需每次都重新测试。
4. “魔术戏法”(少样本学习)
人工智能有时只需看到几个示例(例如展示一个样本问题和答案)就能学习新任务。研究人员测试了这种“魔术戏法”是否对不同语言有不同的效果。
- 发现:这个戏法与语言无关,而与人工智能的“个性”(其设计)有关。
- 某些人工智能(如"Nemotron")无论文本是乌克兰语、波兰语还是俄语,在看到示例后都会变得更聪明。
- 其他人工智能(如"Maverick")无论语言如何,在看到示例后反而变得更笨。
- 教训:不要将人工智能的困惑归咎于语言,而应归咎于其设计。如果人工智能在英语示例上失败,它在乌克兰语示例上也很可能失败。
5. 为何某些人工智能更擅长“切分”
研究人员深入探究了不同人工智能如何切分单词。
- 优秀的切分者:某些人工智能(如 Gemma 2)在自然的“词素”边界处切分乌克兰语单词(即单词中有意义的部分,如词根和词尾)。这很高效。
- 糟糕的切分者:其他人工智能(如 Qwen3)在随机位置切分单词,有时甚至将一个有意义的部分从中间劈开。这就像在三明治中间切过一片酸黄瓜,而不是在面包片之间切分。
- 意外发现:拥有更大的词典(词汇表)并不能保证更好的切分效果。一些拥有巨大词典的人工智能仍然将乌克兰语单词切分成细小、低效的片段,仅仅因为它们的训练数据中缺乏足够的乌克兰语示例来学习正确的切分方式。
建议总结
该研究为使用乌克兰语或类似语言的人工智能用户提出了三条简单规则:
- 预期税收:预算中要考虑到乌克兰语的成本约为英语的两倍。
- 一次测试:你只需测量一次“税收”,它适用于所有主题。
- 谨慎使用示例:不要假设向人工智能展示示例会有所帮助。对于某些模型,这实际上可能会损害性能,且这种情况在所有语言中都会发生。
核心结论:当前的人工智能世界建立在英语偏见之上。在训练数据的“图书馆”实现平衡之前,像乌克兰语这样的语言为了被理解,将不得不支付隐性的“步税”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。