← 最新の論文
💬 NLP

MeRoTune: RoPE-Safe Merging with a Tunable Dial

MeRoTuneは、RoPEを備えたモデルにおけるアテンション部分空間の不整合を、ベースとなる重みを変更することなく、事後的にファインチューニングされたモデルの調整可能なブレンディングを可能にする、制約付きかつRoPEと可換な補正行列を学習することによって解決するモデルマージ手法を導入する。

原著者: Salman Faroz

公開日 2026-09-09✓ Author reviewed
📖 1 分で読めます☕ さくっと読める

原著者: Salman Faroz

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界において、研究者たちはしばしばジレンマに直面します。彼らには強力で汎用的なコンピュータの脳があり、さらに、ある言語でのコーディングや別の言語での質問への回答といった特定のタスクに長けるよう訓練された、個別の特化したバージョンの脳があります。目標は、複数のプログラムを同時に実行するコストをかけずに、これら専門家たちを単一の多才なモデルへと統合することです。これを行う標準的な方法は、単に2つのモデルの数学的な重みを、2つのバッチの塗料を混ぜ合わせる時のように、単純に混ぜ合わせることです。しかし、この単純な混合は、両方のモデルの内部ロジックが完全に一致していることを前提としています。もし一方のモデルがある概念を少し異なる内部座標系を用いて考えている場合、それらを直接混ぜ合わせると、混乱した結果が生じ、元のどちらのモデルよりも劣ったものになってしまいます。これは、単語の順序を理解するために特定のメカニズムを使用し、位置に基づいて情報を回転させるシステムを用いている現代のモデルにおいて、特に厄介な問題となります。もし混合プロセスがこの回転を無視すれば、モデルの文脈理解能力が、訓練中には目に見えない形で静かに破壊されてしまうのです。

ある研究者が、この問題を解決するために「MeRoTune」と呼ばれる新しい手法を開発しました。2つのモデルを盲目的に平均化する代わりに、彼らはまず、混合する前に、それぞれのモデルが単語の順序をどのように扱うかに合意できるよう、自身の内部座標系を調整することを各モデルに教え込みます。彼らは、この調整がモデルを壊すことなく機能するためには、その変化が非常に具体的で限定的なルールに従わなければならないことを発見しました。彼らは、モデルを修正する唯一の安全な方法は、モデルが位置を扱う独特な方法を尊重する特定の種類の回転を適用することであると数学的に証明しました。彼らは、2つの特化したモデルが独自の修正を自律的に学習し、その後、ユーザーが望むあらゆる割合で組み合わせることができる、まるで調整可能なダイヤルのように機能するシステムを構築しました。

彼らは、このアプローチを、インドネシア語とコーディングのエキスパートになるよう訓練されたモデルと、日本語のエキスパートになるよう訓練されたモデルという、2つの異なるバージョンの言語モデルを用いてテストしました。モデルをマージする前に、彼らは、複雑なプロセスを必要とするほど両方のモデルが実際に十分に異なっていることを確認するために、厳格な数学的チェックを適用しました。彼らは、各モデルが自身の専門分野において真に優れており、もう一方の分野においては劣っていることを検証し、解決すべき真の衝突が存在することを確認しました。彼らは、この基準を満たさなかった他の候補ペアをいくつか拒絶し、真の問題に取り組んでいることを確実にしました。ペアが適していることを確認した後、彼らはモデルに独自の修正係数を学習させました。これらの係数は単純な回転として設計されており、プロセス中にモデルが歪んだり安定性を失ったりしないようにしました。

彼らがこの新しい手法を用いてモデルを結合したところ、結果は既存の技術よりも優れたものとなりました。彼らは、主にインドネシア語寄りから主に日本語寄りの範囲まで、幅広い混合比率を用いてマージされたモデルをテストし、彼らのアプローチが標準的な手法と比較して性能が低下することがないことを発見しました。実際、ほとんどのテストにおいて、彼らの手法は高い統計的信頼性の基準をクリアしましたが、競合する手法は、少なくとも一つのタスクにおいて、マージ前の元のベースモデルよりも性能が悪化しました。また、彼らは、混合比率を2つの独立した制御に分割し、各モデルがより自由に貢献できるようにできるかどうかについても調査しました。その結果、分割すると性能が崩壊することを発見し、混合比率を一体に保つことがこの手法を機能させるために不可避であることを証明しました。

この研究はまた、プロセス中にモデルが実際に何を学習したかについての興味深い詳細も明らかにしました。ほとんどの調整は非常に小さく、わずか数度の回転であり、これはモデルが元々大部分において整合していたことを示唆しています。しかし、モデルの特定のパーツのいくつかは、最大86度にも達する非常に大きな変化を必要とし、これらのパーツもまた規模が縮小していました。これは、一般的な構造は類似していたものの、特定の概念を扱う方法において、大幅な再調整を必要とする深い不一致が特定の部分に存在したことを示しています。彼らは、この手法はあらゆる可能なモデルのペアに対する魔法の解決策ではないことも指摘しています。それは、モデルが真に相反する形で特化しており、かつ、モデルの内部構造に彼らが対処した特定の位置処理メカニズムが含まれている場合にのみ機能します。

結局のところ、この研究は、AIモデルのマージが単なる数値の平均化ではないことを示しています。それは、モデルが情報を処理する隠れた幾何学を理解することを要求します。これらのモデルが単語の順序を扱う特定のルールを尊重することで、彼らは、どちらの質も損なうことなく、異なる専門能力の間をスムーズにダイヤル操作できるツールを作り上げました。この手法は、特化したAIの脳を組み合わせるための信頼できる方法を提供し、最終的な結果が混乱した混合物ではなく、一貫性のある高性能なモデルであることを保証します。コードとデータは公開されており、他者がこれらの知見を検証し、同様の注意深く数学的根拠に基づいたアプローチを自身のモデルの組み合わせに適用することを可能にしています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →