Tokenization with Split Trees
本論文は、分割木と整数計画法を活用して語彙選択を最適化し、トークン数を最小化することで、BPE や WordPiece などの既存のベースラインと比較して圧縮効率と言語モデルの性能を大幅に向上させる新しいサブワードトークナイゼーション手法である ToaST を紹介する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネット上で膨大な量の書籍を送信しようとしていると想像してください。しかし、インターネット接続が遅い場合です。転送を高速化するために、意味を失うことなく、書籍を可能な限り最小の「チャンク」(トークン)に圧縮したいと考えています。
長らく、これを行う標準的な方法は、小さな個々のレンガ(文字)から始め、それらが頻繁に隣り合っている場合のみ、一つずつ接着していく「レゴ職人」のようなものでした。この方法は BPE と呼ばれ、高速で貪欲ですが、常に最も効率的とは限りません。この方法は、実際には結びつく必要のない二つのレンガを接着したり、より小さな部品に最初に固執してしまったために、単語全体を結合する機会を逃したりする可能性があります。
この論文は、ToaST(Split Trees を用いたトークナイゼーション)と呼ばれる新しい手法を紹介しています。その仕組みを、いくつかの単純な比喩を用いて説明します。
1. 「可能性の木」(Split Trees)
何かを接着するのではなく、ToaST は「Kentucky」のような単語全体から始め、「もしこの単語を半分に切るなら、どこが最善の場所だろうか?」と問いかけます。
それは、現実世界で単語の異なる部分がどれほど頻繁に現れるかという膨大なデータベースを参照します。そして、単語を非常に一般的な二つの部分に分割する切り方を採用します。その後、それらの二つの部分を取り、同じ問いを繰り返します。単一の文字に到達するまで、これを繰り返します。
- 比喩: 巨大な、切り分けられていないパンの塊を持っていると想像してください。ランダムにスライスするのではなく、人々がパンを食べる場所の地図を見て、両方の半分が人気のあるサイズになるように、完璧な切り口を見つけます。次に、その半分たちを最も人気のある場所で再度スライスします。その結果、丸ごとのパンから個々のパン屑に至るまで、その単語を切るすべての可能な方法の「家系図」が完成します。
2. 「賢いメニュー」(語彙の選択)
さて、数百万もの可能な切り口の木が手元にあります。それらすべてを使うことはできません。特定の数の「メニュー項目」(語彙サイズ、例えば 40,000)しか収容できないからです。
古い方法は、最も人気のある切り口を選ぶだけでした。ToaST は、数学的な最適化器(整数計画)を用いて、「もしも?」というゲームをプレイします。
- 「もし 'Kentucky' という大きなチャンクを単一のトークンとして選んだら、合計でいくつのチャンクを節約できるか?」
- 「'Kent' と 'ucky' を別々に選んだら、他の場所でより多くのスペースを節約できるか?」
それは、図書館全体を書くために必要な「合計チャンク数」を最小にする、最適な切り口の組み合わせを計算します。これは、人気があるものだけでなく、最も少ない皿の総数で最も多くの顧客にサービスを提供する方法に基づいてメニューを計画するシェフのようなものです。
3. 「マジック・トリック」(推論)
メニューが決まれば、テキストの読み取りは高速です。コンピュータが「Kentucky」を見たとき、木の頂上を見ます。
- 「Kentucky」はメニューにありますか?はい? 素晴らしい、それを一つのトークンとして送信します。
- 「Kentucky」はメニューにありますか?いいえ? では、次のレベルを見ます。「Kent」はメニューにありますか?はい? 「Kent」を送信し、その後、もう一方の側で「ucky」を探します。
木がメニューが選ばれる前に構築されたため、経路は常に明確です。混乱するルールや「これを変えたらどうなるか?」というシナリオはありません。
なぜこれが優れているのか
この論文は、大規模なライブラリ(語彙サイズ 40,000 以上)において、ToaST が古い方法よりも著しく優れていると主張しています。
- 圧縮: 必要なチャンク数を 11% 以上削減します。これは、100 ページの文書から一つの単語も失うことなく 89 ページに縮小するようなものです。
- 効率性: 「単一文字」トークン(例えば 'y' や 'u' だけを送信するなど)の使用を減らします。これにより、データのフローがよりスムーズかつ効率的になります。
- 性能: この新しい手法を用いて言語モデル(学習して話す脳)を訓練したところ、モデルはテストでより良いパフォーマンスを発揮しました。古い手法で訓練されたモデルと比較して、推論や論理タスクにおいて高いスコアを記録しました。
結論
ToaST は、テキストを分解する新しい方法です。盲目的に部品を接着するのではなく、単語を切るすべての可能な方法をマッピングし、強力な数学ソルバーを使用して、データ総量を最小化するための絶対的に最適な切り口のセットを選択します。その結果、コンピュータが言語を読み書きするための、より効率的で、高速で、賢明な方法が実現しました。
注記: この論文は、英語のテキストのみでこれをテストしました。これらの結果が他の言語にも適用されるとは主張しておらず、医療や臨床用途についても言及していません。改善点は、テキストがどの程度効率的に処理されるか、および言語モデルが標準的なベンチマークでどの程度よく機能するかという点に厳密に限られています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。