インターネットを、あらゆる本が異なる言語で書かれた、巨大で混沌とした図書館だと想像してみてください。長い間、司書たち(コンピューター科学者)は、コンピューターがすべての言語を一度に理解できるように、一つの巨大で超高密度な百科事典を作り上げてきました。しかし、その巨大な本の中から、ある特定の小さな言語に関する特定の事実を探そうとすると、情報が少しぼやけてしまいます。それは、満員のスタジアムの中でささやき声を聞き取ろうとするようなもので、信号がノイズの中に紛れてしまうのです。
これを解決するために、研究者たちは単一の言語専用の、より小さく専門化された辞書を作り始めました。トルコ語に関する最も有名な辞書は2020年に作られました。それは良いスタートでしたが、古い道具、つまり、他の誰もがスポーツカーを運転している中で自転車に乗っているような道具で作られていました。その一方で、世界は、より速く読み、より長い文章を記憶し、文法の紆余曲折をより良く理解できる「モダン」なエンジンへと進化していきました。ここで大きな疑問が生じました。現代的なこれらのツールを使い、10億ドルの予算や月ほどの大きさの図書館を必要とせずに、トルコ語専用の全く新しい、超高速のスポーツカーを構築できるのだろうか?
この論文は、コンピューターのための究極の「トルコ語の脳」として設計された、新しい人工知能モデルであるModernBERT-TRを紹介しています。研究者たちは、最新かつ最も高度な設計(「ModernBERT」エンジン)を取り入れ、トルコ語のテキストのみを使用してゼロからトレーニングを行いました。彼らは単に膨大な量のデータを投げ込んだわけではありません。高品質なトルコ語の文章を慎重にバランスよく組み合わせ、トルコ語の単語が構築される独特な仕組みに合わせて特別に調整されたカスタム辞書(トークナイザー)を使用しました。
結果は驚くほど強力でした。この新しいモデルは、約1億5,000万の「ニューロン」(パラメーター)しか持たない比較的小規模なものですが、その4倍近いニューロンを持つモデルを含む、より大きなモデルを凌駕しました。ヘイトスピーチの検出や映画レビューの理解など、11の異なるトルコ語タスクでテストしたところ、ModernBERT-TRは平均60.2%を記録し、次に優れたモデルを大幅に上回りました。フルファインチューニングのテストでは、約7倍のデータ量(1兆トークン対モデルの1,444億トークン)でトレーニングされた競合モデルとも互角の成績を収め、スマートなトレーニングと優れたアーキテクチャが、生のデータ量に勝ることを証明しました。
著者らは、秘訣は単にモデルのサイズではなく、データの混合の質にあると示唆しています。彼らは、特定の高品質なトルコ語データセットをトレーニング中に5回繰り返すことが、バッチサイズのような他の設定を微調整することよりもはるかに重要であることを発見しました。要するに、彼らは、最大である必要はなく、最もモダンで最も集中していればよいのだということを証明する、引き締まった精悍なトルコ語マシンを作り上げたのです。彼らは、トルコ語を話すテクノロジーを構築しようとするすべての人に大きな後押しを与えることを願い、すべてのコードとモデル自体を公開しています。
技術要約: ModernBERT-TR
問題提起
トルコ語の自然言語処理(NLP)は、現在、時代遅れのアーキテクチャや最適化不足の多言語モデルに依存しています。主要な単一言語エンコーダーである BERTurk (2020) は、バニラなBERTアーキテクチャを利用しており、比較的規模の小さいコーパス(約45億トークン)で学習されています。一方で、多言語モデル(例:mBERT, XLM-R)は広範なカバー範囲を提供しますが、多くの言語間で容量が希釈されるため、言語ごとの性能が制限されます。さらに、英語においてエンコーダーの品質を大幅に向上させた最近のアーキテクチャ上の進歩(回転位置埋め込み(RoPE)、ゲート付き線形ユニット(GLU)、交互のローカル・グローバル・アテンション、シーケンス・パッキング学習など)は、トルコ語の単一言語事前学習には体系的に適用されていません。
手法
著者らは、ModernBERTアーキテクチャに基づき、トルコ語専用にゼロから事前学習された150Mパラメータのエンコーダーモデルである ModernBERT-TR を導入します。
アーキテクチャおよび学習構成
- アーキテクチャ: 本モデルは、22層のTransformerレイヤー、768の隠れ次元、12のアテンションヘッドを持つModernBERT-base構成に従います。バニラなBERTと比較した主なアーキテクチャ上の改善点は以下の通りです:
- RoPE: 学習済みの絶対位置の代わりに回転位置埋め込み(RoPE)を採用し、様々なシーケンス長への汎化性能を向上させています。
- GLU: フィードフォワードネットワークにおいて、GELU活性化関数を用いたゲート付き線形ユニット(GLU)を使用しています。
- Pre-normalization: 勾配フローを改善するため、アテンションおよびフィードフォワードのサブレイヤーの前にレイヤー正規化を適用しています。
- アテンション・メカニズム: ほとんどのレイヤーでは128トークンのスライディングウィンドウを使用し、3レイヤーごとにフル・グローバル・アテンションを適用することで、効率性と長距離依存関係のモデリングのバランスを取っています。
- 学習効率: パディングによる無駄を排除するため、Flash Attentionとシーケンス・パッキング学習(可変長のドキュメントを固定長のバッチに連結する手法)を活用しています。
- トークナイザー: トルコ語のデータからゼロから構築されたカスタム50K WordPieceトークナイザーを使用しています。このサイズは、埋め込みテーブルのサイズに対する圧縮効率のバランスを考慮して選択されており、より大きな(128K)代替案と比較して高い語彙効率を実現しています。
- 学習データ: コーパスは 144.4Bトークン で構成されています(2エポックで学習)。データは以下の混合物です:
- FineWeb-2 Turkish: 41.2Bトークン(ウェブクロールデータ)。
- BertTurk Corpus: 6.2Bトークン。混合比率を調整し、高品質なテキストを活用するために5倍にアップサンプリング(実質31.0Bトークン)されています。
- ハイパーパラメータ: 学習にはDecoupled StableAdamWオプティマイザを使用し、ピーク学習率は 2×10−4、グローバルバッチサイズは256シーケンス(262Kトークン)、学習率スケジュールのウォームアップは1Bトークンとしたコサイン学習率スケジュールを採用しました。モデルは4枚のNVIDIA H100 GPUを用いて623 GPU時間で学習されました。
アブレーション研究
学習率、バッチサイズ、コサインスケジュールの最終比率 (αf)、およびデータ混合に関する体系的なアブレーションを実施しました。その結果、データの構成(特にBertTurk Corpusの5倍アップサンプリング)と学習率がダウンストリームの性能の主要な要因であり、バッチサイズと αf はテストされた範囲内では最小限の影響しか与えないことが示されました。
主な貢献
- ModernBERT-TR モデル: ModernBERTのアーキテクチャ上の進歩(RoPE、GLU、交互アテンション、アンパッディング学習)を活用した、初めて公開されるトルコ語エンコーダー。
- カスタム・トークナイザー: トルコ語の形態論に最適化され、優れた語彙効率を示す50K WordPieceトークナイザー。
- 精選されたコーパス: FineWeb-2とBertTurk Corpusを組み合わせたバランスの取れた学習コーパス。高品質なコーパスのアップサンプリングを支持する経験的証拠を提示。
- 体系的なアブレーション: トルコ語の単一言語事前学習の品質における、データ混合と学習率の重要性の特定。
- 最先端(SOTA)の結果: 主要な多言語モデルよりも大幅に小さいモデルでありながら、トルコ語NLPタスクにおいて新たなベンチマークを達成。
- オープンリリース: モデルの重み、トークナイザー、評価コード、および学習構成の公開。
結果
フリーズされたエンコーダーによるリニア・プロービング
11の多様なトルコ語NLPタスク(分類、回帰、トークン分類)において、フリーズされたエンコーダー・プロトコルを用いて評価:
- 全体的な性能: ModernBERT-TRは平均スコア 60.2% を達成し、次点のモデル(Turkish-E5-large、560Mパラメータ)を相対的に 13.1%、従来のBerturkベースラインを相対的に 70.3% 上回りました。
- 効率性: 約150Mパラメータ(E5-largeのバリアントの約1/4のサイズ)であるにもかかわらず、ModernBERT-TRはすべてのタスクカテゴリにおいてそれらを凌駕しました。
- タスク別の詳細: 不適切表現検出、ヘイトスピーチ分類、言語的受容性(TrCOLA)、命名エンティティ認識(WikiNER)を含む11タスク中5つのタスクで首位を獲得しました。
フル・ファインチューニング (TabiBench)
28のタスクからなるTabiBenchベンチマークにおいて、フル・ファインチューニングを用いて評価:
- ModernBERT-TRは 77.28 のスコアを記録し、同時期の TabiBERT(約1兆トークンの混合言語で学習)と 0.30ポイント 以内の差にまで迫りました。
- ModernBERT-TRは、8つのタスクカテゴリのうち5つ(テキスト分類、意味的テキスト類似性、NLI、学術的理解、情報検索)でリードしました。
- TabiBERTは、事前学習にコードや数学的データが含まれていることに起因して、コード検索と質問応答において優位性を維持しました。
重要性
本論文は、現代的なアーキテクチャの革新とターゲットを絞った単一言語事前学習を組み合わせることで、たとえ学習トークン数が大幅に少なくても(144.4B対1T)、より線形分離可能で効果的な表現を生み出せることを証明しています。
著者らは、リソース制約のある単一言語事前学習においては、単にバッチサイズを拡大したりスケジュールのパラメータを調整したりすることよりも、注意深いデータ・キュレーションと混合(特に高品質なコーパスのアップサンプリング)の方が大きな利益をもたらすと主張しています。ModernBERT-TRを公開することで、著者らはトルコ語NLP研究を加速させ、わずか623 GPU時間の学習で既存のベースラインを凌駕する基盤モデルを提供することを目指しています。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録