EuroLLM-22B: Technical Report
本論文は、既存のモデルにおける欧州言語の過小評価に対処するため、全24のEU公用語を含む35言語をサポートすべくゼロから学習された大規模言語モデルであるEuroLLM-22Bを紹介するものであり、推論、指示への追従、および翻訳において競争力のある性能を達成しつつ、今後の研究を支援するためにすべての関連データセット、モデル、およびコードを公開している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
EuroLLM-22B: ヨーロッパの多言語司書
人工知能の世界を、巨大な図書館だと想像してみてください。長い間、この図書館は英語で書かれた本によって支配されてきました。もしあなたが中に入って、フランス語、ドイツ語、あるいはポルトガル語での物語を求めたとしても、見つかるのは英語の物語の翻訳であったり、現地の文化を十分に理解していない著者によって書かれたものであったりすることがよくありました。
EuroLLM-22B は、この問題を解決するために設計された新しい大規模なプロジェクトです。これは「大規模言語モデル」(超スマートなデジタル司書と考えてください)であり、EU(欧州連合)の全24公用語に加え、アラビア語、中国語、日本語などの主要な11言語を話し、理解し、推論できるようにゼロから構築されています。
このデジタル司書がどのように作られたのか、簡単な言葉で説明します。
1. 設計図(アーキテクチャ)
家を建てる前には、設計図が必要です。チームは既存のデザインを単にコピー&ペーストしたのではなく、膨大な量の情報を処理できるように設計図を微調整しました。
- サイズ: このモデルには220億個の「ニューロン」(パラメータ)があります。例えを用いるなら、以前のバージョン(9B)が賢い高校生だったとすれば、このバージョンは非常に大きな記憶力を持つ経験豊富な大学教授です。
- 長い記憶: 最大のアップグレードの一つは「コンテキスト・ウィンドウ(文脈窓)」です。例えば、小説を読もうとしている場面を想像してください。古いモデルは、最初のページの内容を忘れてしまう前に、直近の数ページしか覚えておくことができませんでした。EuroLLM-22Bは、一度に32,000語を頭の中に保持できます。短い物語や長い法的文書を丸ごと読み込み、最初から最後まで詳細を失うことなく記憶することができます。
2. トレーニングの食事(データ)
優れたシェフは、質の悪い材料からは作れません。チームは、トレーニング中にモデルに与える「食べ物」に対して非常にこだわりを持っています。
- フィルター: 彼らはインターネット上のデータをただ放り込んだわけではありません。EuroFilterと呼ばれる特別なフィルターを使用して、テキストの質を0から5までのスコアで格付けしました。彼らはジャンクなもの(ランダムなコードや低品質なウェブページなど)を捨て、高品質な教育的・文学的なコンテンツのみを残しました。
- フェーズ(段階): 彼らは、生徒が学校を進級していくように、3つの段階を経てモデルを訓練しました。
- 初等教育: 基礎を教えるために、膨大な量の一般的なデータから始めました。
- 中等教育: 推論能力を高めるために、より高品質なデータを導入しました。
- 高等教育: 最終フェーズでは、数学、コーディング、翻訳された書籍を含む、利用可能な中で最も優れたデータを投入し、知能を研ぎ澄ませました。
- 言語のミックス: 他のモデルが英語に偏重しているのとは異なり、EuroLLM-22Bは初日からすべての欧州言語のバランスの取れた食事を与えられており、特定の言語を優遇しないようになっています。
3. 最後の仕上げ(インストラクション・チューニング)
モデルが事実を学んだ後、次に「どのように振る舞うべきか」を学ぶ必要があります。これは「ポスト・トレーニング」と呼ばれます。
- 教室: チームはEuroBlocksと呼ばれる新しいデータセットを使用しました。これは、「雨についての詩を書いてください」から「この数学の問題を解いてください」、「この文章を翻訳してください」まで、あらゆる内容をカバーする膨大な練習問題と回答のコレクションだと想像してください。
- 教師: 彼らは他の高度なAIモデルを使用して、これらの質問に対する高品質な回答を生成させ、それらのうち最良のものを選び出すことで、EuroLLM-22Bに指示に従う方法を教えました。また、出力がクリーンで直接的なものになるよう、「推論の痕跡」(内部的な独白)を取り除きました。
4. 成績表(結果)
チームは、EuroLLM-22Bがどのように機能するかを確認するために、他の有名なAIモデルと比較テストを行いました。
- 競合: 彼らは、他の「完全オープン」なモデル(コードと重みが誰にでも無料で公開されているモデル)や、一部の「オープンウェイト」モデル(モデルは使用できるが、どのように構築されたかを見ることはできないモデル)と比較しました。
- 結果:
- 欧州のチャンピオン: ヨーロッパで作られた完全オープンなモデルの中で、EuroLLM-22Bは最強です。より大規模なモデル(700億パラメータのモデルなど)をも上回る性能を示しました。
- 翻訳: 翻訳において非常に優れており、その性能はサイズの2倍のモデルに匹たないこともあります。
- 推論: 論理パズル、数学、および複雑な指示に従うことに非常に長けています。
- 効率性: 本論文では、競合他社が15兆語を使用しているのに対し、EuroLLM-22Bは「控えめな」量のトレーニングデータ(4兆語)でこれらの結果を達成したと記されており、データの量よりも質が重要であることを示唆しています。
5. 世界への贈り物
この論文の最も重要な点は、チームがこのライブラリを自分たちだけのものにしなかったことです。彼らはすべてを公に公開しています。
- モデル: 「ベース」バージョン(生の脳)と「インストラクト」バージョン(役立つアシスタント)の両方。
- データ: モデルの訓練に使用した実際のデータセット(EuroWebおよびEuroBlocks)であり、他の研究者が学習できるようにするためです。
- コード: モデルの構築とテストに使用したソフトウェアツール。
要約すると: EuroLLM-22Bは、欧州の言語がAI革命に取り残されないように設計された、強力なオープンソースのAIツールです。これは、注意深いデータの選択と品質への注力があれば、閉鎖的で秘密のプロジェクトにする必要なく、あなたの言語を流暢に話すワールドクラスのAIを構築できることを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。