← 最新の論文
💬 NLP

EuroBERT: Scaling Multilingual Encoders for European Languages

本論文は、欧州および世界の言語を網羅し、最新の生成モデルの革新を活用することで、多様なタスクにおいて既存の代替手法を凌駕するとともに、最大8,192トークンまでのシーケンスをネイティブにサポートするマルチリンガルエンコーダーのファミリーであるEuroBERTを紹介するものである。

原著者: Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Duarte M. Alves, André Martins, Ayoub Hammal, Caio Corro, Céline Hudelot, Emmanuel Malherbe, Etienne Malaboeuf, Fanny Jourdan, Gabriel Hautreux, João Alve
公開日 2026-06-02
📖 1 分で読めます☕ さくっと読める

原著者: Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Duarte M. Alves, André Martins, Ayoub Hammal, Caio Corro, Céline Hudelot, Emmanuel Malherbe, Etienne Malaboeuf, Fanny Jourdan, Gabriel Hautreux, João Alves, Kevin El Haddad, Manuel Faysse, Maxime Peyrard, Nuno M. Guerreiro, Patrick Fernandes, Ricardo Rei, Pierre Colombo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

膨大な数のヨーロッパ言語、そしてコードや数学の教科書が書かれた巨大な図書室を想像してみてください。長い間、これらすべての本を読み、理解できる「司書」(AIモデル)たちは、少し時代遅れになっていました。一方で、新しい世代の「ストーリーテラー」(生成AI)が、ゼロから新しい物語を書けるとして、あらゆる注目を集めてきました。

この論文の著者たちは、シンプルな問いを投げかけました。「なぜ私たちは司書たちを無視しているのか? 彼らをストーリーテラーと同じくらい賢くすることはできないのだろうか?」

彼らは、EuroBERTと呼ばれる新しい司書のファミリーを構築しました。その仕組みを、分かりやすく説明します。

1. 新しい司書の道具箱(アーキテクチャ)

古い司書たちは、情報を整理するための標準的で、少し使いにくい方法を使用していました。EuroBERTは、最も進歩したストーリーテラーから借りてきた、全く新しい道具箱を使用しています。

  • 比喩: 古い司書が、虫眼鏡を使って一行ずつ本を読んでいるのだとしたら、EuroBERTはページ全体を一目でスキャンし、文脈を瞬時に理解し、混乱することなく情報の場所を記憶できる司書のようなものです。彼らは不要な「ノイズ」(バイアス)を取り除き、非常に長い文書を扱っても場所を見失わないように、超高速のメモリツール(Rotary Position Embeddingsなど)を追加しました。

2. トレーニングの食事(データ)

司書を賢くするためには、適切な食べ物を与えなければなりません。

  • ご馳走: 彼らはEuroBERTに5兆語(トークン)という膨大な量の食事を与えました。これは単なるランダムなインターネット上の雑談ではありません。以下のような、慎重に厳選されたミックスです。
    • 15の言語: 主要なヨーロッパ言語(フランス語、ドイツ語、スペイン語など)に加え、広く話されているグローバルな言語(中国語、アラビア語、ヒンディー語など)。
    • 専門分野: 彼らは単に物語を食べさせただけでなく、コード(プログラミング言語)や数学も食べさせました。
    • 結果: 歴史、数学、コーディングを学ぶ学生がより優れた問題解決能力を身につけるのと同様に、EuroBERTはこれらすべての異なるトピックにわたって情報を探し出す能力が高まりました。

3. 二段階のトレーニング(レシピ)

彼らは単にすべての本を一度に司書に投げ込んだわけではありません。二段階の調理法を用いました。

  • フェーズ1:事前学習(下書き): 言語、コード、数学の基礎を学ぶために、巨大で多様なデータのミックスを与えました。このフェーズでは、単語の50%を隠して、モデルにそれを推測させるというゲームを行いました。これにより、モデルは文脈に真に注意を払うことを強制されました。
  • フェーズ2:アニーリング(仕上げ): これは「仕上げのタッチ」です。彼らはモデルを取り出し、より集中した食事を与えました。構成要素を調整して、より高品質な教育資料や、並行する翻訳(二つの言語が並んだ文章)を増やしました。決定的な違いとして、ゲームの内容を変更しました。50%の単語を隠す代わりに、隠す割合を10%に減らしたのです。これにより、モデルは単に欠落した単語を推測するのではなく、完全な文章を理解することに長けてようになりました。

4. 結果:どれほど優秀なのか?

著者たちは、他の有名な司書(XLM-RoBERTaやmGTEなど)に対し、一連の「試験」を行ってテストしました。

  • 検索テスト(リトリーバル): もしあなたが「フランス語で再生可能エネルギーに関する文書を探して」と頼んだら、EuroBERTは驚異的な速さと正確さで正しいページを見つけ出します。
  • 理解テスト(分類): 文を見せて「これはポジティブですか、それともネガティブですか?」あるいは「これら二つの文章は同じ意味ですか?」と尋せば、競合よりも高い頻度で正解を導き出します。
  • ニッチなテスト(コードと数学): ここがEuroBERTが最も輝く部分です。数学とコードを学習させたため、他の同規模のモデルよりもプログラミング言語や数学の公式を理解することにおいて著しく優れています。
  • 長文テスト: EuroBERTは、混乱したり最初の方の内容を忘れたりすることなく、最大8,192トークン(およそ6,000〜8,000語)の文書を読むことができます。古いモデルは長い物語の始まりを「忘れて」しまいがちですが、EuroBERTは記憶しています。

5. いくつかの驚くべき発見

EuroBERTを構築する中で、チームは直感に反するいくつかのことを学びました。

  • 品質がすべてではない: 彼らは、最高品質の教育的なテキスト「だけ」をモデルに与えれば、より賢くなると考えていました。しかし、そうではありませんでした。モデルは、厳密に「教育的」ではないものを含む、より幅広いデータのミックスを与えられたときの方が、より高いパフォーマンスを発揮したのです。
  • 英語が少ない方が良い: 彼らは英語データの割合を減らし、他の言語の割合を増やしました。これにより、モデルはよりバランスが取れ、非英語の言語をより良く理解できるようになりました。
  • コードはすべてを助ける: 学習データにプログラミングコードを含めることは、コーディングのタスクを助けるだけでなく、通常のテキスト内の情報を探す能力をも向上させました。

まとめ

著者たちは、EuroBERTを無料のツールとして公開しました。これは、現在、ヨーロッパおよびグローバルな言語において最高の「オールラウンダー」な司書である、3つのモデル(スモール、ミディアム、ラージ)のセットです。彼らは、強力であるために「ストーリーテラー」(生成AI)である必要はないことを証明しました。よく訓練された「理解者」(エンコーダー)は、検索、分類、およびテキストの分析において、依然として最高のツールとなり得るのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →