Tokenization Multiplicity Leads to Arbitrary Price Variation in LLM-as-a-service
原著者: Ivi Chatzi, Nina Corvelo Benz, Stratis Tsirtsis, Manuel Gomez-Rodriguez
原著者: Ivi Chatzi, Nina Corvelo Benz, Stratis Tsirtsis, Manuel Gomez-Rodriguez
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約:トークナイゼーションの多重性がLLM-as-a-serviceにおける恣意的な価格変動を引き起こす
1. 問題提起
本論文は、大規模言語モデル(LLM)をサービスとして提供する形態(LLM-as-a-service)の経済学において、極めて重要でありながら見落とされている問題を取り上げている。現在、プロバイダーは主にトークン単位の課金モデルを採用しており、生成されたトークンごとに固定価格でユーザーに請求している。標準的な仮定では、同一の入力プロンプトから生成された出力文字列が同一であれば、コストも同一になるはずである。
しかし、著者らは、トークナイゼーションの多重性(tokenization multiplicity)によって、この仮定が不完全であることを実証している。たとえLLMが同じ入力プロンプトから、文字レベルで全く同一の出力文字列を生成したとしても、その背後にあるトークンのシーケンスは異なる場合がある。価格設定は文字数ではなくトークン数に基づいているため、これらの異なるトークナイゼーションによって、同一の出力に対して恣意的な価格変動が生じる。この現象は非英語圏の言語において特に顕著であり、プロプライエタリなモデルおよびオープンウェイトモデルの両方に影響を及ぼす。
2. 手法
実証的研究
著者らは、翻訳、スペルチェック、言い換えという3つの自然言語タスクに対して広範な実証研究を行った。
- セットアップ: Wikipediaの短いテキストを用いて、各タスクにつき100個の入力プロンプトを作成した。翻訳については、英語から5つのターゲット言語へのペアをテストした。スペルチェックと言い換えについては、6つの言語をテストした。
- 実行: 同一のタスクを要求する異なるユーザーをシミュレートするため、各プロンプトに対し、同一のパラメータを用いつつ異なるランダムシードを使用して、LLMに100回ずつ入力した。
- モデル: プロプライエタリなモデル(GPT-4o-mini, GPT-4.1, GPT-5-mini, Gemini, Claude)およびオープンウェイトモデル(Llama-3.1-8B-Instruct, Qwen2.5-7B-Instruct)を対象とした。
- 測定: デコードされた文字列は同一であるが、トークン長が異なる出力のペアを特定した。そして、この現象が発生する確率と、それに伴う価格変動の大きさを測定した。
理論的分析
本論文では、**カノニカル・トークナイゼーション(canonical tokenization)**を、LLMの学習プロセス(エンコーダーによって決定される)中にその文字列が受ける一意のトークナイゼーションとして定義している。著者らは、**非リカバリ型トークナイザー(non-recovering tokenizers)**に関する重要な理論的結果を証明している:
- 定理: BPE、Unigram、およびWordpieceのトークナイザーにおいて、部分的なトークンシーケンスが非カノニカルである場合、そのシーケンスを拡張したもの(トークンを追加したもの)もまた非カノニカルとなる。
- 示唆: カノニカルな出力シーケンスを生成するためには、モデルは各ステップでカノニカルな部分シーケンスを生成しなければならない。この特性により、制約付き生成戦略が可能となる。
提案手法:カノニカル生成(Canonical Generation)
価格変動を排除するために、著者らは、LLMが任意の出力文字列に対してカノニカルなトークナイゼーションのみを生成するように制限する制約付き生成手法であるカノニカル生成を導入する。
- アルゴリズム: Gumbel-Maxトリックに基づく効率的なサンプリングアルゴリズムを提案する。
- 全ての語彙トークンのカノニシティをチェックするために新しい確率分布を明示的に計算する代わりに、各トークンに対してGumbelノイズをサンプリングする。
- 摂動を加えた対数確率によってトークンをランク付けする。
- ランク付けされたトークンを反復処理し、現在のシーケンスに付加した際にカノニカルなシーケンスとなる最初のトークンを選択する。
- このアプローチは、高価な正規化を行うことなく、非カノニカルなトークンの確率質量を、残りのカノニカルなトークンへと効果的に再分配する。
3. 主な結果
トークナイゼーションの多重性
- 普及度: テストされたすべてのモデルおよびタスクにおいて、トークナイゼーションの多重性が観察された。オープンウェイトモデル(Llama, Qwen)では、3つのタスクすべてにおいて定期的に発生していた。プロプライエタリなモデルもこの問題を露呈したが、その頻度は様々であった。
- 言語依存性: この現象は、英語と比較してマイノリティ言語(例:トルコ語、スワヒリ語)において著しく高い。例えば、翻訳タスクにおいて、トルコ語とスワヒリリ語のプロンプトの最大7%が、同一の文字列でありながら異なるトークン長を持っていた。
- 価格変動: 多重性が発生する場合、価格差は相当なものになる。著者らは、同一の出力文字列に対して、最短のトークナイゼーションと最長のトークナイゼーションの間で、最大**15%**の相対的な価格差を観察した。
- 長い出力: 長いテキストでは、トークナイゼーションのエラーは伝播しやすい傾向がある。ある単語が非カノニカルなトークナイゼーションで生成されると、その単語のその後の出現も同様の非カノニカルなパターンに従うことが多く、価格差を増幅させる。
カノニカル生成の性能
- 理論的保証: 著者らは、カノニカル生成によって生成されるトークンシーケンスの分布が、標準的な生成よりも、学習中に見られたシーケンスの真の分布に対して(KLダイバージェンスの観点から)確実に近いことを証明している。
- 実証的性能: 翻訳、スペルチェック、言い換え、およびMGSM(多言語数学)ベンチマークにおける実験の結果、カノニカル生成は以下の点で標準的な生成と同等であることが示された:
- 品質: 翻訳品質スコア、編集距離、余弦類似度などの指標において、無視できる程度の差(多くの場合、誤差範囲内)しか示さなかった。
- 実行時間: 1トークンあたりの時間はわずかに増加したのみであり(例:0.019秒から0.020秒)、Gumbel-Maxベースのサンプリングアルゴリズムの効率性が示された。
- 非カノニカル率: 標準的な生成では、モデルやタスクに応じて6%から29%のケースで非カノニカルな出力が生成されたが、カノニカル生成は設計通りにこの率を0%に減少させた。
4. 重要性と主張
本論文は、プロバイダーが「忠実(faithful)」である(すなわち、意図的にトークン数を操作していない)場合であっても、トークナイゼーションの多重性がLLM-as-a-serviceにおける恣意的かつ望ましくない価格変動を引き起こすという最初の経験的証拠を提供したと主張している。
- 経済的影響: これらの知見は、支払・トークン単位の課金モデルの公平性に疑問を投げかけている。これは、ユーザーが、テキストという同一の価値に対して、トークナイゼーションの確率的な変動によって、著しく異なる金額を請求される可能性があることを示している。
- 技術的貢献: カノニカル生成の導入は、モデルの性能を損なったりレイテンシを大幅に増加させたりすることなく、この価格変動を排除する実用的な解決策を提供する。
- 理論的洞察: BPE、Unigram、およびWordpieceが非リカバリ型であるという証明は、なぜ非カノニカルなシーケンスが発生するのか、そしてどのようにステップ・バイ・ステップの制約を通じてそれを防ぐことができるのかについての基礎的な理解を提供するものである。
著者らは、カノニカル生成はサンプリング空間をわずかに制限する(特定の制約されたシナリオにおいて性能がわずかに低下する可能性がある)ものの、高品質な出力生成を維持しながら、恣意的な価格設定の問題を効果的に解決すると結論付けている。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。