← 最新の論文
💬 NLP

What Tokens are Learned when Tokenization is Optimized Jointly with Language Modeling?

本論文は、トークナイゼーションと言語モデリングを共同で最適化することがトークン構造を根本的に変化させることを示しており、バイトレベルの効率性を優先するH-Netとは異なり、トークナイザーフリーのアプローチであるSSLMが、形態論的に整合し文脈的に効率的なトークンを学習することで、パープレキシティを低減し、多様な言語において競争力のあるダウンストリーム性能を達成することを明らかにしている。

原著者: Saketh Reddy Vemula, Parameswari Krishnamurthy

公開日 2026-08-19
📖 1 分で読めます☕ さくっと読める

原著者: Saketh Reddy Vemula, Parameswari Krishnamurthy

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界において、コンピュータは人間と同じようにはテキストを読みません。彼らは文章を意味の流れるような流れとして見ることはできず、離散的な単位の連続として捉えます。言語を理解するために、これらのシステムはまず単語をより小さな断片へと分解しなければなりません。これは「トークナイゼーション(分かち書き)」と呼ばれるプロセスです。本全体ではなく、本の書き方に応じて、個々の章や段落ごとに図書館を整理しなければならない司書を想像してみてください。もし司書が間違った場所で本を切り刻んでしまったら、物語を追うのが難しくなってしまいます。数十年にわたり、研究者たちはどこでこれらの切り込みを入れるかを決定するために固定されたルールを使用してきました。それらは多くの場合、特定の文字の組み合わせがどの程度の頻度で一緒に現れるかという単純な統計に基づいています。これらのルールは十分に機能しますが、それらは静的です。一度設定されると、コンピュータが新しい言語や複雑な方言を学習しているとしても、決して変化することはありません。ここで根本的な疑問が生じます。もし私たちがこれらの固定されたルールを使うのをやめ、代わりにコンピュータが言語そのものを学習する過程で、単語をどのように切り分けるべきかを自ら学習させるようにしたらどうなるのでしょうか。

IIITハイデラバードの研究チームは、学習しながらトークナイズを学習する言語モデルを構築することで、この問いに答えようとしました。彼らは、英語やスウェーデン語から、タミル語、ヒンディー語、ヘブライ語に至るまで、18の異なる言語を用いて、これらの「トークナイザーフリー(トークナイザーを用いない)」システムをテストしました。これらの言語は、単純で短い単語から、パーツが追加されるたびに意味が変化する複雑で長い音の連鎖に至るまで、単語がどのように構成されているかの幅広い多様性を表すように選ばれました。研究者たちは、新しい学習型システムを従来の固定的な手法と比較しました。彼らは、コンピュータが自ら発明した単語の断片がどのようなものになるのか、それらの断片が言語学的に意味を持つのか、そしてそれらがコンピュータによる言語理解を助けるのかどうかを確かめたかったのです。

結果は、コンピュータが単語を分解する独自の方法を学習することを許されると、使用されるアーキテクチャに応じて2つの非常に異なる戦略を発達させることを明らかにしました。一方のアプローチは、「サブワード・セグメンタル言語モデル」として知られ、言語の自然な構成要素に密接に一致するように単語を切り分けることを学習しました。単語がしばしばルート(語根)に特定の語尾を付け加えることで形成されるヒンディー語のような言語では、このシステムはルートと語尾を素早く特定し、それらを明確に分離しました。意味が単に末尾に付け加えられるのではなく、単語の内部構造の中に織り込まれているヘブライ語においては、システムはそれらの内部パターンを認識することを学習しました。この手法は、人間が言語の文法や構造を理解する方法とよく一致する、言語学的に意味のあるトークンを生み出しました。

対照的に、「H-Nets」と呼ばれる別のアプローチは、より実利的なルートを辿りました。言語学的な構成要素を見つけようとする代わりに、このシステムは完全に効率性に焦点を当てました。それは、データを処理するためにコンピュータが踏むべきステップ数を最小限に抑えるために、時にはフレーズ全体に及ぶような非常に長いテキストの塊を作成することを学習しました。これらの塊は、実際の文法や意味とはほとんど関係のないものでした。例えば、複雑なスクリプトを持つ言語において、このシステムは他のどの手法によって作成されたものよりも著しく長いトークンを生成し、言葉の構造の明快さよりも処理速度を優先しました。これにより、システムは計算上は効率的になりましたが、その語彙は人間や伝統的なアルゴリズムによる標準的な分解方法とは似ても似似つかないものとなりました。

また、この研究は、これらのシステムが学習する方法が、処理している言語のタイプによって変化することも示しました。多くの小さなパーツをつなぎ合わせることで単語が作られる言語では、学習プロセスはより動的で変動しやすいものでした。システムは単語の切り分け方を何度も試し、完璧な分割を見つけたと思ってもそこから離れ、最終的に効率性と意味のバランスが取れた解決策に落ち着くというプロセスを繰り返しました。より単純な言語では、システムは非常に迅速に単語を切り分ける安定した方法を見つけ、それに固執しました。このことは、言語自体の複雑さが、コンピュータがそれをどのようにトークナイズするかという学習の仕方を形作ることを示唆しています。

研究者が、文章の感情分析や人名・地名の特定といった実世界のタスクでこれらの新しいトークナイゼーション手法をテストしたところ、勇気づけられる結果が得られました。コンピュータが標準的なモデルで使用されているものとは全く異なる語彙を学習していたにもかかわらず、これらのタスクにおいて、システムは同等、あるいは場合によってはそれ以上の性能を発揮しました。言語の自然な構造に沿うように学習したシステムは、文章の次の単語を予測する際にコンピュータが感じる混乱を一貫して減少させました。これは、コンピュータに独自のトークナイゼーション戦略を学習させることで、固定されたルールが見逃してしまうかもしれない意味のあるパターンを発見できることを示しています。

結局のところ、この研究は、コンピュータにとって単語を分解するための唯一の「最善の」方法は存在しないということを証明しています。最適な手法は、システムが何を達成しようとしているかに依存します。もし目的が言語の深い構造を理解することであれば、モデルに独自のセグメンテーションを学習させることで、人間の言語的直感に映えるトークンが生成されます。もし目的が生の処理速度であれば、モデルは言語的な明快さを犠牲にして効率性を優先した、全く異なる長い塊を発明するかもしれません。これらの結合学習アプローチが、人間が設計したルールなしに効果的で意味のある語彙を生み出すことができることを示すことで、この研究は、人間の言語の多様性を扱うことができる、より適応性が高く言語学的に意識された人工知能システムへの扉を開いたのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →