Mellum2 Technical Report
Mellum 2は、ソフトウェアエンジニアリングおよびエージェント的タスクに特化し、マルチトークン予測や10.6兆トークンに及ぶ3段階のトレーニングカリキュラムといったアーキテクチャ上の革新を通じて、より大規模なモデルに匹敵する性能を実現した、12Bパラメータ(トークンあたり2.5Bのアクティブパラメータ)を持つオープンウェイトの混合エキスパート(Mixture-of-Experts)言語モデルです。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたのコンピュータの中に住む、超スマートなコーディングアシスタントを作りたいと考えていると想像してみてください。課題は、それが「非常にスマート(シニアエンジニアのように)」でありながら、「非常に高速で安価に動作する(標準的なオフィス用ノートPCのように)」であることです。通常、どちらか一方を選ぶことになります。つまり、「スマート」なバージョンは巨大で低速になり、「高速」なバージョンは難しい問題に対処するには単純すぎる、という選択です。
JetBrainsのチームは、まさにこの問題を解決するためにMellum 2を構築しました。その仕組みを、分かりやすく説明します。
1. 「スイスアーミーナイフ」のような脳(アーキテクチャ)
ほとんどのAIモデルは、あらゆることをこなす単一の巨大な脳細胞のようなものです。しかし、Mellum 2は異なります。これは**Mixture-of-Experts (MoE)**として構築されています。
- 比喩: 64人の異なる専門分野を持つ司書がいる巨大な図書館を想像してください。質問を受ける際、モデルは64人全員を呼び起こすわけではありません。代わりに、賢いマネージャーが、あなたの特定の質問に対して最も関連性の高い8人の司書だけを選び出します。
- 結果: このモデルは、120億パラメータを持つ「巨大な」脳の全知識を持っていますが、単語を一つ書き出すごとに、25億パラメータの脳のパワーだけで「思考」します。これにより、非常に高度な知識を持ちながら、標準的なハードウェアでも動作できるほど高速になります。
2. 「スライディングウィンドウ」と「ドラフト(下書き)」のテクニック
さらに高速化するために、彼らは2つの巧妙なショートカットを追加しました。
- スライディングウィンドウ: 会話の中で入力されたすべての単語をすべて記憶しようとする(これは動作を遅くさせます)代わりに、モデルは電車のスライディングウィンドウのように、直近の1,024単語に焦点を当てます。最新のコンテキストを鮮明に保ちつつ、古い詳細はフェードアウトさせることで、膨大なエネルギーを節約します。
- 「ドラフト」アシスタント: モデルには、組み込まれた小さな「ドラフト(下書き)」アシスタントがあります。最終的な回答を確定させる前に、この小さなアシスタントが次の数単語を予測します。もしその予測が正しければ、メインモデルはその作業をスキップして、そのまま受け入れます。これは、作家が隣にいる友人が次の文章をささやいてくれることで、より速くタイピングできるようなものです。
3. 「3フェーズ」の学校カリキュラム
彼らは単にランダムなデータをモデルに流し込んだわけではありません。学校のカリキュラムのように、3つの特定の段階を経て学習させました。
- フェーズ1(ジェネラリスト): 一般的なインターネットデータ(70%)と一部のコード(23%)を混ぜた巨大なデータセットから始めました。これにより、モデルは人間が話し、書くことについての幅広い理解を得ました。
- フェーズ2(スペシャリスト): 高品質なコード(42%)と数学の比率を高めました。ここでモデルは、プログラミングの特定のルールを学び始めました。
- フェーズ3(マスター): 最終段階では、混合内容のほとんどがコードと数学(59%のコード)となりました。これは、モデルがエキスパートになるための「ブートキャンプ」です。
4. 2つのパーソナリティ:「Instruct」と「Thinking」
同じ学習済み脳から、2つのバージョンのモデルをリリースしました。
- 「Instruct」モデル: これは直接的な作業員です。質問をすれば、すぐに回答を返します。クイックなタスクに最適です。
- 「Thinking」モデル: これは深く考えるモデルです。回答を出す前に、問題を解決するためのステップバイステップの説明である「推論トレース(reasoning trace)」を書き出します。これは、数学のテストで解答プロセスを記述する学生のようなものです。論文によれば、この「思考」モードによって、モデルはより困難な論理パズルや複雑なコーディングの課題を解く能力が大幅に向上します。
5. 「証明」(テスト)
彼らはMellum 2を他の人気のあるモデルと比較テストしました。
- スピード: 70億パラメータのモデルと同等の速さで動作しますが(これはその120億という総サイズよりもはるかに小さいサイズです)、そのサイズの中では非常にスマートです。
- コーディング: コードの記述、デバッグ、およびツール(ウェブ検索やコマンドの実行など)の使用において優れています。
- トレードオフ: コーディングのエキスパートに重点を置いて開発したため、一般的なチャットボット用に訓練されたモデルと比較すると、一般的な世界の事実(歴史や生物学など)に関する知識はわずかに少なくなっています。しかし、開発者を助けるという本来の目的においては、トップクラスの性能を発揮します。
まとめ
Mellum 2は、スマートかつ高速であるために「専門家チーム」のアーキテクチャを使用した、特化したコーディングアシスタントです。コードと数学をマスターするために注意深く設計されたカリキュラムを通じて訓練されており、クイックな回答用と、深くステップバイステップの推論を行う用の2つのタイプがあります。チームは、誰もがより良いソフトウェアを構築できるように、これを無料で公開しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。