← 最新の論文
🤖 machine learning

Generalizing the Geometry of Model Merging Through Frechet Averages

本論文は、対称性の不変性を保証するために適切な多様体上のフレシェ平均に基づくモデルマージのための一般的な枠組みを提案し、フィッシャーマージなどの既存の手法を包含する能力を実証するとともに、現在の手法の限界に対処する低ランクアダプター(LoRA)のマージのための実用的なアルゴリズムを提供する。

原著者: Marvin F. da Silva, Mohammed Adnan, Felix Dangel, Sageev Oore

公開日 2026-05-01
📖 1 分で読めます☕ さくっと読める

原著者: Marvin F. da Silva, Mohammed Adnan, Felix Dangel, Sageev Oore

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが専門家シェフのチームを持っていると想像してください。各シェフは特定の料理を完璧にマスターしています。一人は完璧なラザニアを作り、もう一人は理想的な寿司を、そして三人目は最高級のスフレを作ります。さて、あなたはこれら三つの料理をすべて完璧に調理できる「スーパーシェフ」を作りたいと考えていますが、ゼロから新しいシェフを訓練する時間はありません。既存のシェフたちの知識を組み合わせたいだけです。

AI の世界では、これをモデルマージと呼びます。異なる AI モデルの「重み」(内部設定)を取り出し、それらを一つにブレンドしようとするのです。

問題:「間違った地図」

この論文は、この作業を従来の行っていた方法は、単に紙の上でシェフたちのレシピの数値を平均化しようとするようなものだと主張しています。これが機能するのは、全員が同じ言語で書き、同じ単位を使用している場合に限られます。

しかし、AI モデルには隠れた特徴があります。対称性です。
次のように考えてみてください。シェフ A は「小麦粉 2 カップ」と書き、シェフ B は「小麦粉 1 カップ+小麦粉 1 カップ」と書くかもしれません。彼らが意味していることは全く同じですが、数値は異なります。あるいは、シェフ C はノートの中で材料の順序を入れ替えているかもしれませんが、料理の味は同一です。

AI においては、全く同じ「レシピ」(モデル)を異なる数値を使って記述する多くの方法が存在します。単に数値の平均を取る(単純平均)と、正と負の数値が互いに打ち消し合い、「小麦粉 0 カップ」というレシピになってしまう可能性があります。あなたは何も調理できない壊れたモデルを作ってしまったのです。

著者たちはこれを軌道からの逸脱と呼びます。「真の」レシピが円形のトラック(軌道)上に存在すると想像してください。もしトラック上の 2 点を結ぶ直線を描けば、円の真ん中を横切って泥の中(壊れたモデル)に落ちてしまい、良いレシピが存在するトラック上に留まることにはなりません。

解決策:「スマートコンパス」(GeoMerge)

この論文は、GeoMergeと呼ばれる新しい手法を提案しています。単に数値を平均するのではなく、AI モデルの空間を曲がった風景(リーマン多様体)として扱うのです。

  1. 地図:対称性(同じレシピを記述する異なる方法)があるため、「真の」地図は平らな紙ではないと彼らは気づきました。それは折りたたまれた曲がった表面であり、異なる点は実際には同じものを表しています。
  2. コンパス:彼らはフレシェ平均と呼ばれる数学的ツールを使用します。これは単純な平均ではなく、曲がった表面上での「重心」を見つけるようなものです。
  3. アライメント:モデルを混ぜる前に、まずそれらを「整列」させます。シェフ A とシェフ B がどちらも同じ計量カップを使用し、同じ順序で書いていることを確認するようなものです。数値が書かれている形式の表面的な違いを無視し、他のものに最も近い各シェフのレシピの特定バージョンを見つけます。
  4. 経路:泥の中を真っ直ぐ切り抜けるのではなく、「良いレシピ」の軌道上に残る曲がった経路(測地線)に沿って歩きます。

「LoRA」(専門のシェフ)にとってこれが重要な理由

この論文は、LoRA(低ランク適応)と呼ばれる人気のある手法に大きく焦点を当てています。これらはフルシェフではなく、料理を良くするために少数の特定の材料だけを調整する専門の Sous-chef(副料理長)だと想像してください。

著者たちは、これらの専門的な調整を古い手法でマージしようとすると、「対称性」の問題がさらに悪化することを発見しました。副料理長のメモは非常に柔軟で、すべて同じ意味を持つ何千もの異なる方法で書かれる可能性があります。

  • 旧手法(KnOTS):SVD という堅牢な段階的な数学的トリックを使用してメモの整列を強制しようとします。そこそこ機能しますが、四角い杭を丸い穴に無理やり押し込むようなものです。
  • GeoMerge:メモが自然に曲がった表面上に存在することを認識します。彼らを無理やり堅い形に押し込むことなく、「スマートコンパス」を使用してグループの真の中心を見つけます。

結果

研究者たちは、異なる種類の言語パズル(自然言語推論)に特化された大規模な AI モデル(Llama 3)でこれをテストしました。

  • 結果:GeoMerge は、以前の最良の手法(KnOTS)よりも優れたパフォーマンスを発揮する「スーパーシェフ」を作成しました。
  • 効率性:さらに良いことに、GeoMerge はレシピの「サイズ」を小さく保ちながらこれを行いました。旧手法は巨大で肥大化したレシピ(高ランク)で終わってしまいましたが、GeoMerge はそれをスリムで効率的に保ち、問題の幾何学をよりよく理解していることを証明しました。

要約

この論文はこう述べています:単に数値を平均してはいけません。 AI モデルは、多くの異なる言語で書かれることのできるレシピのようなものです。それらをマージしたい場合は、まず共通の言語(アライメント)に翻訳し、その後、平らな定規ではなく、世界の形状を尊重する地図(幾何学)を使用してグループの中心を見つける必要があります。これにより、「スーパーシェフ」が壊れたカオスになるのを防ぎます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →