← 最新の論文
💬 NLP

MoganBert-TR: A Turkish Encoder Foundation Model Trained from Scratch with a CLM-to-MLM Curriculum

本論文は、新規のCLMからMLMへのカリキュラムおよび特化した長文コンテキスト・スケジューリングを用いてゼロから学習された、149Mパラメータを持つトルコ語エンコーダー基盤モデルであるMoganBert-TRを紹介するものであり、これはトルコ語NLPベンチマークにおいて最先端の性能を達成し、かつ7.57Bパラメータの教師モデルのスコアの99.5%に達する極めて効率的な埋め込みモデルを実現している。

原著者: Furkan Yilmaz, Habibe Aleyna Tasdemir, Muhammed Faruk Gozay

公開日 2026-08-27
📖 1 分で読めます☕ さくっと読める

原著者: Furkan Yilmaz, Habibe Aleyna Tasdemir, Muhammed Faruk Gozay

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能という広大な領域において、コンピュータが人間の言語を理解する方法には主に2つの方法があります。一つは、ニュースでよく取り上げられる手法で、物語を書いたり質問に答えたりと、ゼロからテキストを生成するモデルです。もう一つは、より静かではありますが同様に不可欠な手法であり、強力な検索エンジンや分類器として機能するモデルです。これらの「エンコーダー」モデルは、文章を読み取ってコンパクトな数学的要約へと変換し、それによってコンピュータはアイデアを比較したり、関連文書を見つけ出したり、情報を驚異的なスピードで分類したりすることができるのです。長年、これらのモデルを教えるための標準的な手法は、特定の種類の推測ゲームでした。つまり、コンピュータはある文章の中でいくつかの単語が隠された状態を目にし、欠けている部分を予測しなければならないというものです。「マスクド言語モデリング」として知られるこの手法はうまく機能してきましたが、研究者たちは、特にトルコ語のように、複雑で語形変化が豊かな言語に対して、機械に言語の構造を教えるためのより優れた方法があるのではないかと、長年疑問を抱いてきました。

ある研究チームは、現在、トルコ語理解のための新しい基盤を構築し、モデルをどのように教えるかが、そのモデルがどのようなアーキテクチャで構築されているかと同じくらい重要であることを実証しました。彼らは、膨大なトルコ語テキストのコレクションに基づいてゼロから訓練された「MoganBert-TR」と呼ばれるモデルを作成しました。従来の推測ゲームに固執する代わりに、彼らは二段階の学習カリキュラムを導入しました。まず、モデルは人間が本を読む時のように、シーケンス内の次の単語を予測しながら、左から右へとテキストを読むことを学びました。この初期段階を経て初めて、彼らは伝統的な手法、つまり単語を隠してそれを埋めるよう求める手法へと切り替えました。この教育戦略の転換は、注意深く精査されたデータセットおよび長い文章を扱う新しい手法と組み合わさることで、以前のバージョンよりもトルコ語をより良く理解するモデルをもたらしました。特に、大規模なデータベース内から関連情報を探し出す場面において顕著です。

研究者たちはまず、最近のウェブページや古いアーカイブを含むインターネットから膨大な量のテキストを集めましたが、単にこのデータをトレーニングシステムに投入したわけではありません。彼らは、スパムや繰り返される広告などの低品質なコンテンツを排除し、テキストが真に有用であることを保証するために、洗練されたパイプラインを構築しました。トルコ語のテキストの品質を自動的に判断する既存のツールが存在しなかったため、彼らは教師として機能する小さく特化したモデルを訓練し、そのモデルが高速なシステムに対して、同じ品質判断を行う方法を教えるようにしました。これにより、数百万のドキュメントを効率的に処理し、高品質な素材のみを保持することが可能になりました。また、彼らはモデルのための新しい辞書も作成しました。それは、トルコ語の単語を以前の試みよりも効率的に小さな断片へと分解するものであり、これはトルコ語の単語が文中での役割に応じて形態が大きく変化することを考えると極めて重要です。

彼らの発見の核心は、トレーニングにおける操作の順序にあります。彼らは、単語を隠す手法に切り替える前に、左から右への予測手法から始めることが違いを生むかどうかをテストしました。同じ計算資源とデータを用いた制御実験において、この新しい二段階のアプローチは、情報の検索に関して伝統的な手法を大幅に上回りました。両方の手法は単純な分類タスクでは同様のパフォーマンスを示しましたが、新しいアプローチは、検索テストにおいて関連文書を見つける能力が4倍近く優れていました。研究者たちは、伝統的な手法がモデルの内部表現を狭く役に立たない形状へと崩壊させ、すべての意味が似通って見えるようにしてしまうことを発見しました。新しいカリキュラムはこの崩壊を防ぎ、モデルが言語の意味に対してより広く明確な視点を維持することを可能にしました。

モデルをさらに洗練させるために、研究者たちはトレーニングの最終段階においてコンピュータがどのように学習するかについて実験を行いました。彼らはプロセスを二つの経路に分割しました。一つはモデルが短い文章で学習を続ける経路、もう一つは非常に長い文章で学習する経路です。これら二つの経路を比較することで、トレーニングを短い文章で終える方が、長い文章で終えるよりもモデルの全体的なパフォーマンスを向上させるということが分かりました。長いコンテキスト(文脈)の方が良いとされることが多い中で、この結果は驚くべきものでした。また、彼らは「モデル・スープ」と呼ばれる、訓練された異なるモデルの重みを平均化して、両方の利点を得ようとするテクニックもテストしました。しかし、わずかなコスト増だけで済んだ彼らのシンプルな分岐手法は、複雑な平均化テクニックよりも優れた結果を生み出しました。

最終成果物であるMoganBert-TRは、この研究で使用された現代的なアーキテクチャに基づいたトルコ語モデルの中で最高スコアを達成しました。このモデルは、自然言語による記述から適切なプログラミングコードの断片を見つけ出す「コード検索」のタスクにおいて非常に優れた成績を収め、これは古いモデルを大きく上回る成果でした。この成功は、コードの空白や構造を保持する彼らの新しい辞書と、トレーニングデータに大量のプログラミングテキストを意図的に含めたことの両方に起因しています。チームはまた、テキストの検索に適した要約を作成するために特別に設計されたコンパニオンモデルも作成しました。この小さなモデルに、より大規模で強力な教師モデルを模倣するように教えることで、巨大な教師モデルに限りなく近い結果を得つつ、実行に必要な計算能力を51分の1に抑えることに成功しました。

この研究は、トルコ語のような言語においては、単にモデルの構造を更新するだけでは不十分であり、トレーニング方法自体を再考する必要があることを浮き彫りにしています。研究者たちは、逐次的な予測から始まり、マスクド言語モデリングへと移行する二段階のカリキュラムが、より堅牢な言語理解を生み出すことを示しました。また、トレーニングの最終段階は、処理されるテキストの長さのような小さな変化がパフォーマンスに測定可能な影響を与える、極めて重要な設計領域であることを実証しました。モデルには、特定の文法テストにおける文構造の理解など、依然としていくつかの弱点があるものの、これは大きな前進を意味しています。チームは、彼らのモデル、辞書、およびそれを構築するために使用したコードを公開しており、他の人々がトルコ語テクノロジーの基礎の上にさらなる発展を築けるようにしています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →