Compute Optimal Tokenization
本論文は、計算量最適化された言語モデル構成において、パラメータ数がトークン数ではなくバイト単位で測定されたデータサイズに比例してスケーリングすることを示しており、最適なトークン圧縮率は標準的な BPE と異なり、計算量が増加するにつれて低下することを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
知識の究極の図書館を建設していると想像してください。この図書館を建設するための固定された資金(あなたの計算リソース予算)があります。ここで、主に 2 つの選択があります:
- 数百万の空の棚を持つ巨大な建物を購入する(モデルサイズ)。
- その棚を埋めるための巨大な本の山を購入する(トレーニングデータ)。
長年、専門家は図書館員にこう伝えてきました。「最高の図書館を手に入れるには、あなたが建設する棚 1 個に対して 20 冊の本を購入しなさい」と。しかし、この助言には隠れた欠陥がありました。それは、すべての本が同じサイズであると仮定していたことです。実際には、厚い百科事典もあれば、薄いパンフレットもあります。
**「計算最適化トークナイズ」**と題されたこの論文は、私たちが本を間違った単位で測定してきたと主張しています。「本(トークン)」を数える代わりに、「ページ(バイト)」を数えるべきなのです。
以下に、彼らの発見を単純なアナロジーを用いて解説します。
1. 「本のサイズ」の問題(圧縮率)
AI の世界では、テキストはトークンと呼ばれる断片に分割されます。
- 低圧縮: 文を個々の文字に分割すると想像してください。すると、小さな破片の巨大な山(多くのトークン)ができます。
- 高圧縮: 単語全体やフレーズを単一の断片にグループ化すると想像してください。すると、大きな断片の小さな山(少ないトークン)ができます。
この論文は問いかけます:「断片のサイズは重要でしょうか?」
答えははいです。断片のサイズ(圧縮率と呼ばれる)は、いかに効率的に図書館を建設できるかを変化させます。
2. 絶妙なバランスを見つけること:「バイト対トークン」のルール
研究者たちは、約 1,000 種類の異なる AI モデルを訓練し、断片のサイズとモデルのサイズを調整しました。彼らは完璧なバランスのための新しいルールを発見しました。
- 古いルール: 「パラメータあたり 20 トークンを購入する。」(これは、トークンが特定のサイズ、例えば標準的な BPE トークンである場合のみ機能します。)
- 新しいルール: 「パラメータあたり60 バイトのテキストを購入する。」
アナロジー:
あなたの AI モデルを料理人、データを食材だと考えてください。
- もし料理人に小さく事前に刻まれた食材(高圧縮)を与えれば、彼らは多くの食事を素早く調理できます。
- もし彼らに野菜そのもの(低圧縮)を与えれば、彼らはまずそれを刻まなければならず、時間がかかります。
- この論文は、野菜をどのように刻んでも、料理人が最もパフォーマンスを発揮するのは、彼らのスキル(パラメータ)の単位ごとに特定の重量(60 バイト)の食材がある場合であると発見しました。その重量が 20 の大きな断片であっても、100 の小さな破片であっても構いません。重要なのは総重量です。
3. 「ジャスト・サイズ」の圧縮率
あなたはこう思うかもしれません。「もし断片を大きくすれば、より多くの時間を節約できるので、できるだけ大きくすべきだ!」
しかし、この論文は言います:そう簡単ではありません。
彼らは、断片のサイズに**ジャスト・サイズ(ゴールドilocks ゾーン)**が存在することを発見しました。
- 小さすぎる: モデルは、小さすぎるデータ片の多さに圧倒されてしまいます。
- 大きすぎる: モデルは、断片が粗すぎるために詳細を失いすぎます。
- ちょうど良い: 特定の予算に対して最も賢いモデルを生み出す、特定の圧縮率が存在します。
意外な展開: あなたがより多くの資金(より多くの計算能力)を得るにつれて、「ちょうど良い」サイズは実際には小さくなります。
- アナロジー: もし小さなキッチンを持っているなら、時間を節約するために事前に刻まれた野菜を望むかもしれません。しかし、無限のスタッフを持つ巨大でプロフェッショナルなキッチンを持っているなら、余分な詳細がその努力に値するほど効率的に処理できるため、野菜そのものを好むかもしれません。
4. 一つのサイズがすべてに合うわけではない(言語が重要)
研究者たちは、このことを異なる言語(英語、ヒンディー語、アラビア語、ロシア語など)でテストしました。彼らは、「ちょうど良い」断片のサイズは言語に依存することを発見しました。
- アナロジー: 異なる旅行のためにスーツケースをパッキングすると想像してください。
- 非常にコンパクトな単語を持つ言語を話す国への旅行の場合(英語など)、少し大きなアイテムをパッキングするかもしれません。
- 単語が長かったり、異なる文字体系を使用したりする国への旅行の場合(ヒンディー語やアラビア語など)、パッキングする「最適な」方法は変化します。
- この論文は、人気のある AI ツール(Llama 3 や Qwen など)がしばしば「一つのサイズがすべてに合う」パッキング方法を使用していることを発見しました。これは英語ではまあまあいいますが、一部の言語に対しては過度に圧縮されており、他の言語に対しては圧縮不足であることがよくあります。彼らは本質的に、特定の旅行に不適切なサイズのアイテムをパッキングしているのです。
主要な教訓のまとめ
- トークンを数えるのをやめ、バイトを数え始めること。 AI にどの程度のデータを与えるかを計画する際、断片の数(トークン)ではなく、テキストの生サイズ(バイト)を測定してください。比率は、モデル内の 100 万パラメータあたり、おおよそ60 バイトのテキストであるべきです。
- 完璧な断片サイズが存在する。 トークンを大きすぎたり小さすぎたりすると、パフォーマンスが損なわれます。圧縮には特定の「絶妙なバランス」が存在します。
- 絶妙なバランスは変化します。 より強力なコンピュータを手に入れるにつれて、最良の結果を得るためには、実際には少し小さな断片(低い圧縮)を使用すべきです。
- 言語が重要です。 完璧な断片サイズは、ヒンディー語と英語では異なります。現在の AI モデルは、すべての言語に最適ではない一般的な設定を使用することがよくあります。
要約すれば:最も賢い AI を構築するには、単に「パラメータあたり 20 トークン」という古いルールに従うのではなく、テキストの重量を脳のサイズに合わせ、テキスト断片のサイズを、あなたが持っている計算能力と、それを教える言語に基づいて調整してください。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。