Length-MAX Tokenizer for Language Models
本論文は、グラフ分割手法を用いて語彙選択を最適化することで、1文字あたりの平均トークン数を最小化する新しい手法であるLength-MAXトークナイザーを紹介しており、標準的なバイトペアエンコーディングと比較して、学習ステップ数、推論レイテンシ、およびメモリ使用量を大幅に削減すると同時に、ダウンストリームの性能を向上させている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、超スマートなロボットに人間の言葉を教えようとしていると想像してください。これを行うために、あなたはすべての文章を「トークン」と呼ばれる小さな構成要素に分解しなければなりません。これらのトークンをLEGOブロックのようなものだと考えてください。もし標準的なブロックのセットを使えば、単純な家を作るためだけに100万個もの小さなピースが必要になり、建設作業は遅く、乱雑なものになってしまいます。長年、最も一般的な方法(Byte Pair Encoding、またはBPEと呼ばれる手法)は、最も頻繁に現れる文字のペアを見つけて、それらを結合させるというものでした。それは、「『th』と『e』がよく出てくるから、『the』というブロックを作ろう」と言うようなものでした。しかし、このアプローチには欠点がありました。それは、短くて一般的な単語をあまりにも愛するあまり、長く意味のあるフレーズを小さく非効率的な塊へとバラバラにしてしまうことがあったのです。これにより、ロボットは必要以上に多くのブロックを処理することを強いられ、思考が遅くなり、メモリを消費してしまいました。
ここで、新しいLEGOセットの作り方を想像してみてください。単に最も頻度の高いペアを探すのではなく、この新しい方法は、「より広範囲をカバーする、より大きく、よりスマートなブロックを作ったらどうだろうか?」と問いかけます。これが、ペンシルベニア大学のDong Dong氏とWeijie Su氏による新しい研究の核心です。彼らはLength-MAXと呼ばれる新しいトークナイザーを導入しました。Length-MAXは、単語がどれくらい出現するかを数える代わりに、有用であるほど頻繁に現れる「長いフレーズ」に報酬を与えます。これは、「the」は一般的ではあるものの、「the United States」というフレーズの方が、「the」、「United」、「States」という3つの別々のピースよりもる優れた構成要素であると気づくようなものです。小さくて繰り返しの多いブロックを、より長く、より意味のある少ない数のブロックに入れ替えることで、ロボットは文章をより速く構築でき、メモリの使用量を抑え、実際に物語をより良く理解できるようになります。
あまりに小さなブロックが多すぎるという問題
長い間、コンピュータに言語を教える標準的な方法は、テキストを出現頻度に基づいて小さな断片に切り刻むことでした。これは**Byte Pair Encoding (BPE)**と呼ばれます。これは、最も一般的な隣り合う2つの記号を見つけ、それらを新しいトークンへと結合していくゲームのようなものです。
問題は、このゲームが短くて高頻度な断片を好むことです。それは、「in the midst of a historic snowstorm(歴史的な吹雪の最中に)」のような長く一貫したフレーズを、小さくバラバラな断片の集合として扱ってしまいます。現代のAIモデルは全体を理解するためにすべての断片に注意を払わなければならないため、あまりに多くの小さな断片があると、計算の複雑さが爆発してしまいます。それは、すべての単語が3つの音節に分割された本を読んでいるようなものです。同じ意味を得るために、3倍の「単語」を読まなければなりません。これは学習を遅らせ、AIの回答を遅くし、より多くのコンピュータメモリを必要とさせます。
Length-MAXの登場: 「長いほうが良い」戦略
この論文の背後にいる研究者たちは、この状況を逆転させることに決めました。彼らはこう問いかけました。「もし頻度ではなく、長さを最適化したらどうだろうか?」 彼らはLength-MAXと呼ばれる新しいトークナイザーを作成しました。
単に最も一般的なペアを探す代わりに、Length-MAXは特定のスコア、すなわち 頻度 × 長さ を最大化する部分文字列を探します。これは、一般的であり、かつ長いトークンに対して報酬を与えます。もし「the United States」のようなフレーズが十分に頻繁に現れるなら、Length-MAXはそれを「the」、「United」、「States」と分割するのではなく、一つの単一のトークンとして掴み取ります。
これを行うために、チームはトリッキーな数学的パズルを解く必要がありました。彼らは、最適な長いトークンのセットを見つけることは、膨大な量のテキストに対して完璧に解くことが数学的に不可能な(NP困難として知られる)問題であることを理解しました。そこで、彼らは巧妙な「貪欲(greedy)」アルアルゴリズムを構築しました。あらゆる可能なフレーズが、その長さと出現頻度に基づいてスコアを得るスコアボードを想像してください。アルゴリズムは最もスコアの高いフレーズを選び、それを固定し、語彙が満たされるまでプロセスを繰り返します。彼らは、テキストを高速スキャナーのようにスキャンできるRabin-Karpローリングハッシュという技術を使用し、数百のコンピュータコアで同時に実行することで、これを驚異的に高速化しました。
結果: より速く、より小さく、よりスマートに
チームは、GPT-2モデルをゼロから訓練することでこの新しい手法をテストし、標準的なBPE手法と比較しました。結果はあらゆる面で素晴らしいものでした。
- より少ないトークン数: さまざまな語彙サイズにおいて、Length-MAXはBPEと比較して、テキストを表すために必要なトークン数を**14〜18%削減しました。64,000語の語彙の場合、削減率は13.0%**でした。これは、AIが同じことを言うために、より大幅に少ない「レンガ」を処理すればよいことを意味します。
- より速い学習: プロセスすべきトークンが少ないため、モデルはより速く学習しました。1億2,400万パラメータのモデルは、18.5%少ないステップを、3億5,500万パラメータのモデルは17.2%少ないステップを、そして13億パラメータのモデルは18.5%少ないステップを必要としました。
- より迅速な回答: モデルがテキストを生成する際、より高速になりました。124Mモデルの推論レイテンシ(回答にかかる時間)は**13.7%低下し、テキスト生成速度(スループット)は16%**向上しました。
- より少ないメモリ: モデルはメモリもより少なく使用しました。研究者たちは、モデルの「作業メモリ」(KVキャッシュと呼ばれる)と語彙埋め込みに必要なメモリが**18%**減少したことを発見しました。
- より優れた理解力: 驚くべきことに、トークンを減らしてもAIが愚かになることはなく、むしろ賢くなりました。長い物語や文脈を理解する能力を測定するテストにおいて、Length-MAXモデルはより優れた性能を示しました。例えば、LAMBADAというテストでは、AIの混乱度(パープレキシティ)が11.7%低下し、常識推論テストであるHellaSwagでは、精度が4.3ポイント向上しました。
なぜ機能するのか(そして何を行わないのか)
Length-MAXの魔法は、単に時間を節約することではなく、AIが世界をどのように見るかを変えることにあります。単語をより長い、意味のあるフレーズ(「in the midst of」など)にグループ化することで、AIは文の文脈をより容易に維持できます。それは、個々の文字を見て物語を理解しようとするのと、単語やフレーズ全体を見て理解しようとするのととの違いです。
研究者たちはまた、Length-MAXが言語の自然な「リズム」を壊していないかを確認しました。彼らは、Length-MAXが依然として言語の自然な頻度の法則(ジップの法則として知られる)に従っており、奇妙でランダムな長い単語をただ作っているわけではないことを発見しました。それは、より効率的にしながらも、言語の自然な構造を保持していました。
しかし、論文は、この手法が「行わないこと」についても注意深く述べています。この手法は、すでに訓練され固定されたモデルには機能しません。これらの恩恵を得るためには、新しいトークナイザーを用いてモデルをゼロから訓練する必要があります。また、これは英語のテキストに焦点を当てているため、非常に異なる構造を持つ言語で同様にうまく機能するかどうかはまだ明確ではありません。さらに、結果は最大13億パラメータのモデルまでは強力ですが、研究者たちは、より大規模なモデル(70億パラメータなど)においても、その恩ichtは同様である可能性が高いものの、まだ完全には検証されていないと示唆しています。
まとめ
Length-MAXは、数十年来の課題に対する新鮮なアプローチです。「長いことはしばしば、より良い」ということをトークンに見出すことで、研究者たちは、AIモデルをより速く、より安価に、そして驚くほど文脈理解に優れたものにする方法を見つけました。これは、前進するための最善の方法が、必ずしも「より大きなエンジンを作ること」ではなく、「よりスマートなトランスミッションを作ること」である場合があるということを思い出させてくれます。コードと新しい語彙は誰でも試せるように公開されており、次世代の言語モデルからさらなる効率を引き出すための実用的な方法を提供しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。