Measuring the Tokenization Premium: A Cost Audit for Underserved Language Communities
本文介绍了分词公平性审计(Tokenization Equity Audit, TEA),旨在证明分词效率的不均衡为欠发达语言社区造成了显著的经济与功能障碍,并揭示了诸如孟加拉语和约鲁巴语等语言的内容所需的标记(tokens)数量高达英语的4.5倍,从而大幅缩减了有效上下文窗口并增加了成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图给一位住在巨大图书馆里的超级聪明机器人朋友发送一条消息。这个机器人并不像我们这样阅读文字;相反,它会将每一句话切成极小的、一口大小的块,叫做“标记”(tokens)。把这些标记想象成拼图碎片。如果你用英语写一个句子,机器人可能只需要几个较大的、厚实的碎片就能拼凑出完整的图像。但如果你用另一种语言写完全相同的句子,机器人可能需要将这句话切成数十个微小、零碎的碎片才能理解其含义。
这就是大语言模型(LLMs)的世界——这些强大的人工智能工具正在帮助我们写作、学习和编程。但问题在于:机器人的“拼图盒”并不是为所有人平等构建的。有些语言能完美地契合这个盒子,使用高效的大型碎片;而另一些语言则会被压碎成一堆微小、昂贵的碎片。这至关重要,因为在现实世界中,你通常需要为使用的每一个拼图碎片付费。如果你的语言需要比别人多出两倍的碎片来表达同样的意思,你的费用就会翻倍,你的消息会被更早截断,整个体验也会变得更慢、更令人沮丧。这并不是关于机器人的智力问题,而是关于拼图盒本身不公平的规则。
巨大的标记税:关于不平等拼图碎片的寓言
在一项新的研究中,研究人员 Avijit Roy、Proma Roy 和 Hrishitva Patel 决定调查这种隐形的税收。他们创建了一个特殊的测试,称为标记公平性审计(Tokenization Equity Audit, TEA)。想象一下,他们拿了一套标准的 120 个初级 Python 编程问题——比如“为什么我的代码崩溃了?”或“我该如何修复这个错误?”——并将它们翻译成了英语、孟加拉语、印地语、阿拉伯语、泰米尔语和约鲁巴语。然后,他们将这些翻译输入到三种用于流行 AI 系统的“拼图盒”(分词器)中:一个是来自 OpenAI(GPT-4o)的,一个是来自 Qwen 的,还有一个是来自 Mistral 的。
他们的目标很简单:计算每种语言表达相同内容时需要多少个拼图碎片。
研究结果:某些人承担的沉重负担
结果揭示了显著的不平等。当使用 OpenAI (GPT-4o) 系统时,孟加拉语表达相同技术内容所需的标记数是英语的 1.56 倍。换句话说,如果机器人的“记忆桶”可以容纳 128,000 个标记,英语使用者可以用这个桶装满一段完整的对话。但孟加 la 语使用者使用同一个桶时,在桶溢出之前,只能装下大约 8,2000 个标记 份量的意义。这就像背着一个沉重的背包,有些人的背包带是结实的皮革带,而有些人的背包带却是细弱、易断的绳子。
在使用另外两个系统(Qwen2.5 和 Mistral)时,情况变得更加剧烈。对于孟加拉语,这些系统需要的标记数竟然达到了英语的 4.5 倍。这意味着,对于英语用户来说可以轻松容纳的对话,对于孟加拉语用户来说,会被切碎成一大堆庞大且难以处理的碎片,消耗着内存并减慢了速度。
字体的迷思:不仅仅是关于字母表
这项研究中一个最令人惊讶的发现涉及到了约鲁巴语。你可能会猜测,使用非拉丁字母(如阿拉伯语或泰米尔语)的语言处理起来会最困难,因为它们看起来与英语截然不同。虽然这些语言确实面临挑战,但研究发现,使用拉丁字母(即我们使用的 A, B, C)的约鲁巴语,在 GPT-4o 系统中的惩罚反而更高,达到了英语标记数的 2.37 倍。
这一发现表明,问题不仅仅在于字母的“形状”。尽管约鲁巴语使用熟悉的拉丁字母,但由于机器人的拼图盒构建方式不对,无法高效处理该语言独特的发音和重音。研究人员认为,这个“拼图盒”缺少了处理这些特定声音的正确碎片,迫使机器人将单词分解成极其低效的微小碎屑。
现实世界的成本
为什么这很重要?论文指出,这不仅仅是一个数学问题,更是一个经济和教育障碍。
- 对于付费服务: 如果你是按标记付费,那么一名学习编程的孟加拉学生在进行 1,000 次请求时可能会多支付 0.07 美元,而一名英语学生在获得同样的帮助时,额外费用为 0.00 美元。随着时间的推移,这会积少成多,使得 AI 辅导对于欠发达社区来说变得明显更加昂贵。
- 对于离线工具: 许多处于低网络连接地区的民众依赖于在手机上本地运行的 AI 工具。这些设备内存有限。如果 AI 为了处理同样的课程需要存储 4.5 倍的“拼图碎片”,它可能会崩溃或耗尽空间,导致工具无法使用。
这项研究做了什么,以及没有做什么
作者谨慎地指出,他们并没有证明 AI 对这些语言变得“更笨”,他们只是证明了其交付系统是低效的。他们也没有测试世界上所有的语言,而是专注于这 120 个特定的编程示例,以展示一个清晰的模式。他们明确反对“这只是针对‘奇特’脚本的问题”这一观点,通过展示即使是基于拉丁字母的语言,如果词汇库构建得不好,也会遭受损失。
研究表明,要让 AI 真正实现公平,我们不能只关注让机器人变得更聪明。我们还需要修复拼图盒。我们需要设计出这样的系统:让孟加拉语、印地语或约鲁巴语的句子,在表达成本或占用空间上,不会比英语的句子更高。在此之前,“标记税”仍然是一个隐藏的障碍,使得全球化免费教育的承诺对某些人来说比对其他人来说更加昂贵。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。