← 最新の論文
💻 computer science

Darwin Family: MRI-Trust-Weighted Evolutionary Merging for Training-Free Scaling of Language-Model Reasoning

ダーウィンファミリーフレームワークは、追加の勾配ベースの学習なしに大規模言語モデルの推論能力を大幅に向上させるため、勾配不要の重み空間再結合、適応的信頼性に基づく融合、およびアーキテクチャ横断的な交配を活用する学習不要の進化的マージ手法を導入する。

原著者: Taebong Kim, Youngsik Hong, Minsik Kim, Sunyoung Choi, Jaewon Jang, Junghoon Shin, Minseo Kim

公開日 2026-05-15
📖 1 分で読めます☕ さくっと読める

原著者: Taebong Kim, Youngsik Hong, Minsik Kim, Sunyoung Choi, Jaewon Jang, Junghoon Shin, Minseo Kim

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

2 人の熟練したシェフがいると想像してください。一人はイタリア料理の巨匠(「父」と呼びましょう)、もう一人はフランス菓子の巨匠(「母」と呼びましょう)です。二人とも、同じ有名な料理学校(「事前学習済みベース」)で基本的な包丁の使い方やキッチンのレイアウトを学びました。

さて、完璧なパスタと完璧なクロワッサンの両方を調理できる究極の「スーパーシェフ」を作りたいとします。しかし、新しい料理学校に通わせて学ぶ時間はありません。また、彼らを訓練するために新しいチームを雇うこともしたくありません。ただ、今すぐ彼らの既存のスキルを混ぜ合わせたいのです。

これがまさにダーウィンファミリーの論文が達成したことですが、シェフの代わりに大規模言語モデル(LLM)(AI の脳)を混ぜ合わせ、新しい学習なしに推論(難しい論理パズルの解決)の能力を向上させています。

彼らがどのように行ったかを、簡単な比喩を使って説明します。

1. 問題:なぜ単なる「混ぜ合わせ」は通常失敗するのか

通常、2 つの AI モデルを混ぜようとすると、ステーキとバナナをスムージーに混ぜるようなものです。ぐちゃぐちゃになってしまいます。2 つのモデルが異なるものを異なる方法で学習しているため、AI は混乱します。

  • 従来の手法は、単に材料を平均する(ステーキ 50%、バナナ 50%)ようなものでした。これは、モデル同士が干渉し合うため、しばしばまずい味(性能の低下)をもたらします。
  • ダーウィンの解決策は、シェフ A からどの包丁を、シェフ B からどの泡立て器を正確に取り出し、完璧に組み合わせることを知っているスマートなサブシェフのようなものです。

2. ダーウィンの 3 つの秘密の材料

この論文は、この混ぜ合わせを機能させるための 3 つの主要なツールを導入しています。

A. 「14 次元ゲノム」(レシピブック)

AI モデルを、多くの部屋(層)を持つ巨大な建物だと考えてください。ダーウィンのチームは、14 種類の異なるノブを持つ「レシピブック」(ゲノムと呼びます)を作成しました。

  • 建物全体を一度に混ぜるのではなく、ノブを回して「思考の部屋はシェフ A から 80%、創造性の部屋はシェフ B から 20%」のように決定できます。
  • 彼らはコンピュータプログラム(進化探索)を使用して、何千ものレシピを自動的に試し、最も美味しいものを選び、悪いものは捨てます。

B. 「MRI-Trust Fusion」(スマートガイド)

これがこの論文の最大の革新です。スマートなサブシェフが、AI の脳の中をスキャンして、推論のために実際に重労働をしている部分を特定する特殊なスキャナー(MRI)を持っていると想像してください。

  • 問題点: 時々、スキャナーは少しぼやけていたりノイズがあったりします。また、レシピを推測するコンピュータも間違っていることがあります。
  • 解決策: システムには「信頼ダイヤル」(τ\tauと呼ばれます)があります。「MRI スキャナーをどの程度信頼し、コンピュータのランダムな推測をどの程度信頼すべきか?」と問うのです。
  • システムはこのバランスを学習します。スキャナーが「この部屋は論理にとって重要だ」と言えば、システムは耳を傾けます。スキャナーが混乱している場合は、システムはコンピュータの試行錯誤により依存します。このバランスこそが、最終結果を強力にする要因です。

C. 「アーキテクチャマッパー」(翻訳者)

時には、トランスフォーマー(標準的な AI 構造)のように構築されたモデルと、マンバ(より新しい、異なる構造)のように構築されたモデルを混ぜたい場合があります。これらは異なる「言語」を話しています。

  • アーキテクチャマッパーは翻訳者のように機能します。2 つのモデルを見て、「確かに外見は異なりますが、モデル A のこの特定部分はモデル B のこの部分と同じです」と言います。
  • これにより、通常は再学習なしには不可能だった、全く異なるタイプの AI ファミリーからの部分を混ぜ合わせることが可能になります。

3. 結果:「スーパーシェフ」の誕生

チームは、Darwin-27B-Opusというフラッグシップモデルでこれをテストしました。

  • テスト: 大学院レベルの科学および論理問題(博士課程入学試験のようなもの)をテストする非常に難しいGPQA Diamondに挑戦させました。
  • スコア: **86.9%**を獲得しました。
  • ランキング: 評価された 1,252 モデルの中で6 位となりました。
  • 魔法: 自身の「父」モデル(元のベースモデル)を打ち破り、数ヶ月間訓練されたはるかに大きなモデルさえも打ち破りました。
  • コスト: これを新しい学習なしで行いました。新しいデータを与えたり、高価な数学(勾配)を使用して重みを調整したりしませんでした。既存の重みを再配置しただけです。

4. 彼らが発見したこと(「アハ!」の瞬間)

  • 「焦点」の維持: 勝ったレシピを見ると、パターンに気づきます。システムはほぼ常に、元のベースモデルからの「Attention」部分(AI が正しい単語に焦点を当てるのを助ける部分)を維持し、専門モデルと「Feed-Forward」部分(実際の計算を行う部分)を交換していました。シェフの安定した手は保ちつつ、新しいレシピブックに差し替えるようなものです。
  • どこでも機能する: 彼らは、小規模(40 億パラメータ)から大規模(350 億パラメータ)までのモデルでこれをテストしました。同じ「混ぜ合わせの規則」がすべてに機能し、AI の推論を改善する普遍的な方法を見つけたことを示唆しています。

まとめ

ダーウィンファミリーの論文は、より賢い AI を訓練するために、何百万ドルもの資金と数ヶ月の時間を費やす必要があるとは限らないことを証明しています。代わりに、既存の AI モデルを取り、彼らが何を知識しているかを見るためのスマートな「スキャナー」を使用し、コンピュータを使って植物のようにそれらを「交配」させることで、親よりも推論に優れた新しい賢いモデルを作成できます。これらはすべて、新しい学習コードを 1 行も書かずに実現されます。

重要な教訓: 彼らは新しい知識を発明したのではありません。すでにモデルの中に隠れていた知識を再編成し、より良く機能するようにしただけです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →