← 最新の論文
💬 NLP

Marco-MoE: Open Multilingual Mixture-of-Expert Language Models with Efficient Upcycling

Marco-MoE は、より高密度な競合モデルと比較して言語横断的なスケーラビリティにおいて優れ、最先端の性能と計算資源の比率を実現する効率的なアップサイクリングを活用する、完全にオープンで極めてスパースな多言語混合専門家モデル群です。

原著者: Fan Jiang, Yu Zhao, Chenyang Lyu, Tianqi Shi, Yichao Du, Feihu Jiang, Longyue Wang, Weihua Luo

公開日 2026-04-29
📖 1 分で読めます☕ さくっと読める

原著者: Fan Jiang, Yu Zhao, Chenyang Lyu, Tianqi Shi, Yichao Du, Feihu Jiang, Longyue Wang, Weihua Luo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

64 種類の言語で書かれた本を収蔵する巨大な図書館を建設しようとしていると想像してください。この図書館を建設する従来の方法は、すべての言語のすべてを暗記しなければならない、一人の巨大で超賢い司書を採用することでした。問題は何でしょうか?この司書は圧倒されてしまいました。新しい言語を学ぼうとすると、古い言語を忘れ始めたり、「何でもできるが、何の達人でもない(ジャック・オブ・オール・トレードス、マスター・オブ・ナッシング)」状態になったりしました。研究者たちはこれを「多言語性の呪い」と呼んでいます。

Marco-MoEは、この図書館を建設する新しい、より賢明な方法です。一人の巨大な司書の代わりに、著者たちは協力する専門家のチームを構築しましたが、特定のタスクに対して実際に作業に現れるのはその中の数人だけです。

以下に、彼らがどのように行ったかを簡単な概念に分解して示します。

1. 「専門チーム」(Mixture-of-Experts)

Marco-MoE モデルを単一の脳ではなく、200 人の異なるパーソナルトレーナー(専門家)がいるジムとして考えてみてください。

  • 従来の方法(Dense Models): 質問をするたびに、200 人すべてのトレーナーが同時に答えようとします。騒がしく、高価で、非効率です。
  • Marco の方法(Sparse MoE): スペイン語で質問すると、システムはスペイン語の専門家である8 人の特定のトレーナーだけを呼び覚まします。日本語で質問すると、異なる 8 人のトレーナーのセットが呼び覚まされます。
  • 結果: 図書館は巨大です(総知識量は非常に多い)が、単一の質問に対しては、その脳力のほんの一部(約 5%)しか使用しません。これにより、多くの知識を持っているにもかかわらず、実行速度が驚くほど速く、コストも安くなります。

2. 「リノベーション」(効率的なアップサイクル)

通常、200 人のトレーナーのチームをゼロから構築するには数年と数百万ドルの費用がかかります。Marco-MoE は**「アップサイクル」**と呼ばれる巧妙なトリックを使用しました。

  • 彼らは、すでに多くのことに長けた既存のよく訓練された「一般主義者」の司書(Qwen3 という Dense モデル)を手にしたと想像してください。
  • 彼らを解雇して最初からやり直すのではなく、オフィスをリノベーションしました。彼らは一般主義者の知識を切り取り、より小さく専門的なピースに分割しました。
  • その後、これらすべてのピースが同じように考えないように、少し「揺さぶり」(ランダムなノイズの追加)を加えました。これにより、すべてをゼロから再訓練することなく、一人の大きくて遅い司書を、速く専門的なチームへと変えることができました。

3. 「カリキュラム」(学習方法)

チームは単にランダムな本を読んだわけではありません。厳格な 4 段階の学習計画に従いました。

  1. 段階 1: 堅固な基盤を築くために、高品質な英語と推論に関する本から始めました。
  2. 段階 2: 論理を鋭くするために、より多くの数学と科学の問題を追加しました。
  3. 段階 3: 学習が難しい 9 つの新しい言語(ウルドゥー語やカザフ語など)を導入し、チームが「ロングテール」の言語を無視しないようにしました。
  4. 段階 4: 文化に重点的に取り組みました。単語を学ぶだけでなく、文脈を学びました。モデルが人々が何を言っているかだけでなく、なぜそう言っているのかを理解できるよう、地域のニュース、文化的な物語、地域史を研究しました。

4. 「実践練習」(ポストトレーニング)

本を学んだ後、チームは人間と会話する方法を学ぶ必要がありました。

  • ステップ 1(SFT): 特定の質問に答え、指示に従う練習をしました。
  • ステップ 2(On-Policy Distillation): これは弟子が師匠から学ぶようなものです。モデルが自分自身で回答を生成し、「スーパー教師」(はるかに大きな AI)がそれを修正しました。モデルはその後、自分の間違いから学び、より有益で正確なスタイルに洗練されました。

結果:小さくても強力

この論文は、このアプローチによって 2 つの主要なモデルが作成されたと主張しています。

  • Marco-Nano: 06 億パラメータのみを活性化する小さなモデルです。その重さをはるかに超える活躍をし、3 倍から 14 倍の脳力を活性化するはるかに大きなモデルよりも優れたパフォーマンスを発揮します。
  • Marco-Mini: 0.86 億の活性化パラメータを持つやや大きなモデルで、3 倍から 14 倍の多い活性パラメータを持つ競合他社を凌駕します。

重要な要点:
Marco-MoE は、64 種類の言語を上手に話すために、巨大で高価な脳は必要ないことを証明しています。「専門チーム」のアプローチと賢明なリノベーション戦略を使用することで、現在の巨人たちよりも速く、安価で、多様な文化への対応に優れ、かつ誰でも利用・研究できる完全にオープンなモデルを構築しました。

また、モデルは人間言語学者がそうするように、言語を自然にグループ化すること(スペイン語、フランス語、イタリア語などをグループ化するなど)も発見しました。これは、単に暗記しているのではなく、言語間の関係を真に理解していることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →