Joint Optimization for Greedy Longest-match Tokenization
本論文は、語彙学習を最長一致デコーディングに適合させるための強欲一貫性制約を用いた整数計画問題として定式化し、標準的なBPEを大幅に上回る近似最適の圧縮を実現するとともに、近似最適性の証明を提供する結合最適化フレームワークであるJOLTを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
膨大な図書室の蔵書を、たった一つの小さなスーツケースに詰め込もうとしている場面を想像してみてください。できるだけ多くのテキストを限られたスペースに収めたいのですが、ページをただ丸めて潰すわけにはいきません。整理された、扱いやすい塊(チャンク)に分ける必要があります。人工知能の世界では、この「スーツケース」はコンピュータのメモリであり、「チャンク」はトークンと呼ばれます。AIはテキストを単語全体としてではなく、これらのより小さな断片として読み取ります。言葉をどのように切り分けるかは非常に重要です。切り方を誤ると、より多くのスペースを消費し、コンピュータはそれを読むためにより多くの労力を要することになります。長年、これらの言葉を切り分ける標準的な手法は、BPE(Byte Pair Encoding)と呼ばれる方法でした。BPEを、非常に効率的ですが、少し融通の利かない司書だと考えてみてください。その司書は、「常に最も一般的な2つのテキストの断片を最初に結合せよ」という厳格なルールに従っています。これは高速で貪欲なアプローチであり、うまく機能してきましたが、本質的にはヒューリスティック、つまり単純なルールに基づいた「良い推測」であって、完璧な数学的解ではありません。
最近、科学者たちは大きな問いを投げかけ始めました。「この司書の『良い推測』は、本当に私たちができる最善の方法なのだろうか? それとも、もっと多くのテキストをスーツケースに詰め込めるような、より賢い切り方があるのだろうか?」 この論文は、AIがテキストを読み取る特定の方式である「Greedy Longest-Match(貪欲な最長一致)」に着目することで、この問いを掘り下げています。文章を読みながら、次の文字に進む前に、自分が知っている中で可能な限り長い単語を常に掴み取る様子を想像してください。著者たちは、単なる汎用的な語彙がうまく機能することを期待するのではなく、この読み方に特化した語彙を設計できるのではないかと考えました。彼らは、JOLT(Joint Optimization for Greedy Longest-match Tokenization)と呼ばれる新しいシステムを構築しました。JOLTYは、単に頻度に基づいて断片を結合するのではなく、問題全体を巨大で複雑なパズルのように扱います。高度な数学を用いて、どの単語の断片を残すべきか、そしてトレーニングデータ内のあらゆる単語をどのように切り分ければ、AIが「最長一致」ルールを用いて読み取った際に、使用される断片の数が絶対的に最小になるかを正確に算出します。
この論文は、古い司書(BPE)は実はかなり優秀であり、理論上の最善のパッキングの範囲内にすでに1%から2%の誤差で収まっているものの、新しいシステムであるJOLTは、さらに少しだけ多くのスペースを絞り出せることを明らかにしています。この数学的パズルを解くことで、JOLTは、従来のメソッドと比較して、残された隙間をほぼすべて埋めることができます。異なるデータサイズを用いたテストにおいて、JOLTは標準的な手法と比較して、必要なトークン数を最大0.78%削減しました。その数字は小さく聞こえるかもしれませんが、AIの世界では、たとえ数パーセントのわずかな節約であっても、モデルがより多くのテキストを読み、より速く思考し、実行コストを低く抑えられることを意味します。著者たちは、語彙をAIが実際に読む方法と完璧に一致させることで、これまでテーブルの上に残されていた「圧縮の余地(ヘッドルーム)」をほぼすべて回収できることを示しています。
JOLTの物語:言葉のパズルを解く
JOLTがどのように機能するかを理解するために、あなたが大規模な宴会のための完璧なメニューを作ろうとしている熟練のシェフだと想像してみてください。あなたは膨大な材料(テキスト)のリストを持っており、それらをゲスト(AI)に提供するために、特定のサイズ(トークン)に刻む必要があります。ただし、条件があります。ゲストには非常に特殊な食べ方の習慣があります。彼らは、次のひと口に進む前に、口に入る限りの最大の塊を常に掴み取ります。これが「Greedy Longest-Match(貪欲な最長一致)」ルールです。
長い間、シェフ(AI研究者)はBPEと呼ばれる標準的なレシピを使用してきました。彼らは材料を見て、「『th』と『e』はよく一緒に現れるから、これらを結合して『the』にしよう」と考えていました。彼らは最も一般的なペアを結合し続け、一定のサイズのメニューができるまで作業を続けました。それはうまく機能しましたが、壁が完全に真っ直ぐであることを確認せずに、ただレンガを積み上げて家を建てるようなものでした。それは「貪欲な」アプローチ、つまり、まず目の前の簡単な、明白なことを行う手法でした。
論文の著者たちは、もしゲストに効率的に食べてもらいたいのであれば、単に一般的なものに基づいてメニューを作るのではなく、彼らが「どのように食べるか」に基づいてメニューを作るべきであることに気づきました。彼らが作成したJOLTは、スーパー・スマートなシェフのようなものです。彼は、あらゆる材料と、あらゆる切り方を考慮しながら、宴会全体のメニューを一度に計画し、最終的な結果がゲストの「最大のひと口」という習慣に対して完全に最適化されるようにします。
数学的パズル
JOLTの核心は、巨大な数学の問題です。著者たちは同時に2つのことを決定しなければなりませんでした。
- どの材料を残すか:最終的な語彙にはどの単語の断片を含めるべきか?
- テキストをどう刻むか:トレーニングデータ内のあらゆる単語について、それを構成するためにどの特定の断片を使用すべきか?
厄解なのは、これら2つの決定が互いにロックされていることです。「ta」と「ble」に刻むと決めるには、実際に「ta」と「ble」を語彙に残すと決めていなければなりません。さらに、AIは「最長一致」ルールを使用するため、もし「table」というより長い断片が語彙の中に存在する場合、それが主役を奪ってしまうことを考慮しなければなりません。もし「table」が存在すれば、AIは「table」を丸ごと食べてしまい、「ta」と「ble」に刻むというあなたの計画は失敗します。
これを解決するために、著者たちは「整数計画法(Integer Programming)」と呼ばれる手法を用いました。巨大なスイッチのグリッドを想像してください。あるスイッチは単語を(語彙に)入れ、別のスイッチは単語の特定の切り方を有効にします。目標は、合計の断片数を最小にするためにスイッチを切り替えることです。しかし、テキスト全体のグリッドを解こうとすると、あまりにも巨大すぎて、最速のコンピュータでも永遠に時間がかかってしまいます。
スマートな近道
そこで、著者たちは巧妙なトリックを編み出しました。全体を一気に解こうとする代わりに、まずは小さくシンプルなバージョンから始めました。単語を1つまたは2つの断片に刻むことのみを検討しました。数学的問題を解き、もしコンピュータが「この単語はこれらの断片だけでは刻むのが難しすぎる。もっと選択肢が必要だ」と言えば、その単語に対してのみ、より複雑な切り方のオプションを追加しました。このプロセスを、必要に応じて複雑さを追加しながら繰り返し、解決策が安定するまで行いました。
このアプローチにより、彼らは理論上の限界に極めて近い解を見つけることができました。彼らは、標準的なBPEメソッドがすでに素晴らしい仕事をしており、最善の結果の1%から2%の範囲内に収まっていることを発見しました。しかし、JOLTはその残された隙間の89.6%から99.4%を埋めることができました。
結果
彼らが異なる量のデータ(10万語から40万語)と異なる語彙サイズ(32,000および64,000語)で新しいシステムをテストしたところ、結果は明白でした。JOLTは一貫して、標準的なBPEメソッドよりも少ないトークンを使用しました。
- 語彙が32,000語の場合、JOLTは標準的な手法と比較して、トークン数を最大**0.78%**削減しました。
- 語彙が64,000語の場合、改善幅は小さくなりましたが依然として存在し、最大**0.31%**に達しました。
論文では、彼らの解が絶対的な数学的限界にどれだけ近いかも確認されました。彼らの最終的な「丸め処理(実用的な語彙への変換)」後の解は、理論上の最善の**0.008%から0.176%**以内に収まっていました。これは、「丸め」のプロセス(数学的解を実際の使用可能な語彙に変えること)によって失われる効率がほとんどないことを意味します。JOLTがBPEに対して示した小さな利点は、単なる偶然ではなく、実質的かつ構造的な改善でした。
なぜこれが重要なのか
著者らは他の手法についても調査しました。彼らは、同じ「最長一致」の読み方に設計されたWordPieceと呼ばれる人気のある手法が、テストにおいてBPEよりもむしろ性能が低いことを発見しました。これは、WordPieceが(断片の数を最小化するのではなく)別の目標(次の単語の予測)を最大化するように訓練されていたためです。このことは、ある目的のために設計された語彙を、別の目的のためにそのまま使うことはできないということを証明しています。語彙は、AIが実際に読む方法に合わせて特別に訓練する必要があります。
要約すると、この論文は、古い「貪欲な」司書(BPE)が驚くほど優れた仕事をしてきた一方で、まだ絞り出せるわずかなスペースが残されていることを示しています。AIの読み方に完璧に一致する数学的に厳密なアプローチを用いることで、JOLTは失われていたスペースのほぼすべてを回収します。これは、AIの世界において、効率性のわずかな改善が、より高速で、より安価で、より有能なモデルにつながることを思い出させてくれます。著者たちは単に推測したのではなく、彼らの手法が、これまでのどの方法よりも完璧なパッキングに近づいていることを数学的に証明したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。