Tokenization Multiplicity Leads to Arbitrary Price Variation in LLM-as-a-service
原作者: Ivi Chatzi, Nina Corvelo Benz, Stratis Tsirtsis, Manuel Gomez-Rodriguez
原作者: Ivi Chatzi, Nina Corvelo Benz, Stratis Tsirtsis, Manuel Gomez-Rodriguez
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:Tokenization 多样性导致 LLM-as-a-service 中的任意价格波动
1. 问题陈述
本文探讨了大型语言模型即服务(LLM-as-a-service)经济学中一个关键却被忽视的问题。目前,提供商主要采用按 token 付费的定价模型,即用户根据生成的 token 数量支付固定费用。标准假设是,产生相同输出字符串的相同输入提示应当产生相同的成本。
然而,作者证明由于tokenization 多样性(tokenization multiplicity),这一假设存在缺陷。即使 LLM 从相同的输入提示生成了完全相同的输出字符串(字符级一致),其底层的 token 序列也可能不同。由于定价是基于 token 计数而非字符计数,这些不同的 tokenization 导致了相同输出的任意价格波动。这种现象在非英语语言中尤为普遍,并影响了包括专有模型和开源权重模型在内的所有模型。
2. 研究方法
实证调查
作者在三个自然语言任务中进行了广泛的实证研究:翻译、拼写检查和改写。
- 设置: 他们使用简短的维基百科文本为每个任务构建了 100 个输入提示。对于翻译任务,他们测试了英语到 5 种目标语言的配对;对于拼写检查和改写,他们测试了 6 种语言。
- 执行: 每个提示被输入到 LLM 中 100 次,使用相同的参数但不同的随机种子,以模拟不同用户请求同一任务的情景。
- 模型: 研究涵盖了专有模型(GPT-4o-mini, GPT-4.1, GPT-5-mini, Gemini, Claude)和开源权重模型(Llama-3.1-8B-Instruct, Qwen2.5-7B-Instruct)。
- 测量: 他们识别出解码后的字符串相同但 token 长度不同的输出对。他们测量了这种情况发生的概率以及由此产生的价格波动的幅度。
理论分析
论文正式定义了**规范化 tokenization(canonical tokenization)为字符串在 LLM 训练过程中接收到的唯一 tokenization(由编码器决定)。作者证明了一个关于非恢复性 tokenizer(non-recovering tokenizers)**的关键理论结果:
- 定理: 对于 BPE、Unigram 和 Wordpiece tokenizer,如果一个部分 token 序列是非规范的,那么该序列的任何扩展(追加更多 token)也将是非规范的。
- 含义: 为了生成规范的输出序列,模型必须在每一步都生成规范的部分序列。这一特性允许使用受限生成策略。
提出的解决方案:规范化生成(Canonical Generation)
为了消除价格波动,作者引入了规范化生成,这是一种受限生成方法,它将 LLM 限制为仅生成任何输出字符串的规范化 tokenization。
- 算法: 他们提出了一种基于 Gumbel-Max trick 的高效采样算法。
- 该算法并非显式计算新的概率分布(因为这需要检查所有词表中的 token 是否具有规范性),而是为每个 token 采样 Gumbel 噪声。
- 它根据扰动后的对数概率对 token 进行排序。
- 它遍历排序后的 token,并选择第一个在追加到当前序列后能产生规范序列的 token。
- 这种方法有效地将非规范 token 的概率质量重新分配给剩余的规范 token,而无需进行昂贵的归一化。
3. 关键结果
Tokenization 多样性
- 普遍性: 在所有测试的模型和任务中都观察到了 tokenization 多样性。对于开源权重模型(Llama, Qwen),在所有三个任务中都定期出现。专有模型也表现出该问题,尽管频率各异。
- 语言依赖性: 与英语相比,该现象在少数族裔语言(如土耳其语、斯瓦希里语)中更为普遍。例如,在翻译任务中,高达 7% 的土耳其语和斯瓦希里语提示导致了字符串相同但 token 长度不同的情况。
- 价格波动: 当多样性发生时,价格差异可能非常显著。作者观察到,对于相同的输出字符串,最短和最长 tokenization 之间的相对价格差异可达 15%。
- 长文本输出: 在较长文本中,tokenization 错误倾向于传播;如果一个单词是以非规范 token 形式生成的,那么该单词后续的出现往往也会遵循相同的非规范模式,从而复合价格差异。
规范化生成性能
- 理论保证: 作者证明,通过规范化生成产生的 token 序列的分布,在 KL 散度方面,比标准生成产生的序列更接近训练期间看到的真实序列分布。
- 实证性能: 在翻译、拼写检查、改写和 MGSM(多语言数学)基准测试上的实验表明,规范化生成在以下方面与标准生成相当:
- 质量: 翻译质量评分、编辑距离和余弦相似度等指标显示出微小的差异(通常在误差范围内)。
- 运行时间: 每个 token 的时间仅略微增加(例如,从 0.019s 增加到 0.020s),证明了基于 Gumbel-Max 的采样算法的高效性。
- 非规范率: 根据模型和任务的不同,标准生成在 6% 到 29% 的案例中产生了非规范输出,而规范化生成通过设计将该比例降低到了 0%。
4. 重要性与主张
论文声称提供了第一个实证证据,证明 tokenization 多样性会导致 LLM-as-a-service 中出现任意且不理想的价格波动,即使提供商是“忠实”的(即并非有意操纵 token 数量)。
- 经济影响: 这些发现挑战了按 token 付费模型的公平性,表明由于 tokenization 的随机变化,用户可能会为相同的价值(文本)支付显著不同的费用。
- 技术贡献: 引入规范化生成提供了一个实用的解决方案,在不牺牲模型性能或显著增加延迟的情况下消除了这种价格波动。
- 理论洞察: 关于 BPE、Unigram 和 Wordpiece 是非恢复性的证明,为理解为什么会出现非规范序列以及如何通过逐步约束来防止它们提供了基础性的理解。
作者得出结论,虽然规范化生成略微限制了采样空间(可能导致在特定受限场景下性能略微下降),但它有效地解决了任意定价问题,同时保持了高质量的输出生成。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 NLP 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。