A Sovereign, Open-Source Foundation Model for German and English
本論文は、ドイツ語と英語に焦点を当てて27兆トークンで学習された、ソブリンかつオープンソースのMixture-of-ExpertsハイブリッドMambaTransformerモデルであるSoofi S 30B-A3Bを紹介しており、これはオープンモデルの中で最先端の性能を達成しながら、長文脈アプリケーションに対して優れた推論効率を提供します。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
究極のバイリンガル・ロボット・シェフを想像してみてください。英語とドイツ語の両方で料理をバリバリこなせるロボットです。多くの人は、素晴らしいシェフの秘訣は、単により大きなキッチンを雇い、より多くの料理人を集めること(より多くのパラメータ)だと考えています。しかし、Soofi Sの開発チームは、異なるトリックを発見しました。それは、300億人の料理人を雇う代わりに、タスクの切り替えが非常に高速な、わずか30億人の超効率的なチームを雇い、残りの270億人を、即座に取り出せる膨大なレシピの「静かな図書室」として保持するという方法です。
これは単なる理論ではありません。著者たちが実際に訓練し、テストした、完全に構築されたオープンソースのロボット・シェフ、SoしくはSoofi S 30B-A3Bの実話です。ここでは、彼らがどのようにそれを行い、何ができるのか、そして現在どのような課題に直面しているのかについてお話しします。
秘伝のソース:ハイブリッド・キッチン
ほとんどのAIモデルは、全員が声を張り上げなければならない密集した群衆のようなもので、部屋が巨大になる(会話が長くなる)と、混乱し、速度が低下します。Soofi Sは異なります。これは、2種類の「料理人」をミックスしたハイブリッド設計を採用しています。
- Mamba-2 レイヤー: これらは、ノートに書き留める必要がなく、物語全体を頭の中に記憶できるシェフだと考えてください。物語が長くなるにつれて重くなっていく巨大なノート(「KVキャッシュ」と呼ばれます)を保持する必要がありません。
- MoE (Mixture of Experts): これが「30億のアクティブな」部分です。合計316億のパラメータのうち、モデルは単語を一つ生成するごとに、わずか32億のパラメータだけを「覚醒」させます。
その結果はどうでしょうか?このモデルに100万語の長編小説を読ませても、速度は落ちません。他のモデルは、重いノートを持ち歩かなければならないために動作が鈍くなりますが、Softii Sは速度を一定に保ちます。著者たちはこれを測定し、コンテキスト長が40,000トークン(約3万語)の時点で、Soofi Sは同規模の他のデンス(密)モデルよりもテキスト生成が8〜9倍高速であることを突き止めました。
レシピ:ドイツ語と英語へのフォーカス
チームは、単にランダムなインターネット上のテキストを鍋に投げ込んだわけではありません。彼らは、100の言語において並みのシェフになるのではなく、特にドイツ語と英語においてチャンピオンとなるよう設計された、厳格な3フェーズのレシピに従いました。
- フェーズ1(ビッグ・ミックス): 彼らは、多様なデータからなる大規模な20兆トークンからスタートしました。ドイツ語が単なるサイドディッシュにならないよう、意図的にドイツ語の割合を通常のモデルの5%よりも高い**7.2%**に引き上げました。
- フェーズ2(高品質なアニーリング): モデルが賢くなるにつれ、彼らは「高品質な」食事へと切り替えました。ジャンクフードを取り除き、最高のコード、数学、および推論データに焦点を当てました。ここで、ドイツ語の割合をさらに**15.3%**まで高めました。
- フェーズ3(ロングストーリーの拡張): 最後に、モデルに非常に長い物語を扱う方法を教えました。4,000から100万トークンの長さのデータを用いて訓練を行いました。
著者たちは非常に透明性が高く、特定の高品質なレシピを何回繰り返したか(エポック)、あるいはどのレシピを使用しないと決めたかを含む、正確な材料リストを公開しています。また、ドイツ語データの約**1.3%**が、生のテキストを共有できない商用ライセンス(Genios)によるものであることも認めており、誰でも監査できるように正確な統計を提供しています。
テスト:味の評価
チームは、Olmo 3 32B、Apertus 70B、Qwen3.5 35Bといった巨人を含む16の他のオープンモデルに対して、Soofi Sに厳格な味のテストを行いました。
- 大きな勝利: Soofi Sは、英語とドイツ語の両方において、完全なオープンモデルの中でトップのパフォーマンスを記録しました。テストしたすべての欧州主権ベースラインを打ち破り、多くの場合、圧倒的な差をつけました。例えば、ドイツ語のコードベンチマークでは、MBPP-DEで84.2を記録し、次点のモデルを大きく引き離しました。
- 「アクティブ」の優位性: 一度に30億のパラメータしか起動していないにもかかわらず、140億から270億のアクティブなパラメータを持つデンスモデルに匹常するか、あるいはそれらを上回りました。これは、軽量のランナーがヘビー級のボクサーに短距離走で勝つようなものです。
- 「オープン」の優位性: 最終的な重み(調理された料理)だけを共有し、レシピを隠してしまう多くの「オープン」モデルとは異なり、Soofi Sは重み、コード、ハイパーパラメータ、そして正確なデータ会計をすべて共有しています。
課題(限界)
著者たちは、このロボット・シェフが今なお躓いている点についても正直に述べています。
- ドイツ語の数学: ドイツ語の小学校レベルの算数には優れていますが(GSM8K-Platinum-DEで87.1)、より高度な競技レベルのドイツ語数学では苦戦します(Minerva MATH-DEで56.0)。これはQwen3.5のようなモデルに後れを取っています。
- メモリの想起: 30億のパラメータしかアクティブではないため、オープンな世界における無名の事実を思い出すのが時として苦手になります(NaturalQuestionsで79.0)。より大規模でデンスなモデルは、より多くのことを記憶しています。著者らは、実生活ではこれを修正するために検索エンジンと組み合わせることを提案しています。
- コードの汚染: モデルが単に訓練データを暗記しているかどうかをテストするLBPPという特定のコードベンチマークにおいて、スコアは31.0となり、一部の大型モデルよりも低い数値となりました。
結論
Soofi Sは、トップクラスのAIになるために、巨大で遅くて密な脳を持つ必要はないことを証明しています。ハイブリッドMamba-Transformer設計を使用し、ドイツ語と英語に集中的にフォーカスすることで、チームはソブリン(ドイツの土地でドイツの資金提供を受けて構築された)、オープン(完全に透明)、そして効率的(高速で安価に実行可能)なモデルを構築しました。
これはすべてを解決する魔法の杖ではありません。特に難しいドイツ語の数学や純粋な事実の想起については課題がありますが、長い会話、コーディング、およびバイリンガルのタスクにおいて、それは「ソブリン」な欧州モデルが達成できることの新しい基準を打ち立てています。著者らは、より高品質なドイツ語のデータがあれば、このモデルはさらに向上する可能性があると考えていますが、現時点では、テストされた中で最も強力な完全オープンなドイツ語・英語ベースモデルとなっています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。