Asymmetric Collapse in Model Merging: When Refusal Over- writes Recognition
本論文は、標準的なモデル・マージ技術が、拒絶のファインチューニングが、ベクトルがほぼ直交しているにもかかわらずマージ過程において支配的となる著しく大きなタスクベクトルの大きさを誘発することによって、安全性認識能力が失われる一方で広範な拒絶挙動が保持されるという非対称な崩壊を引き起こすことが多いことを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、新しい芸を学ぶことができる、とても賢いロボットを想像してみてください。時には、フェイクニュースの見出しを見分ける方法のように、ある特定のことを教えたいことがあります。またある時には、「ノー」と言う方法のように、別の芸を教えたいこともあります。しかし、もしそのロボットに、両方を同時にこなしてほしいとしたらどうでしょう?人工知能の世界には、「モデル・マージング(モデルの結合)」と呼ばれる巧妙なショートカットがあります。ゼロからロボットを再学習させる代わりに、科学者たちは「芸A」のために訓練されたバージョンと「芸B」のために訓練された2つの異なるバージョンのロボットを取り出し、それらの脳を数学的にブレンドするのです。それは、2つの異なるフレーバーのアイスクリームを混ぜて、新しい完璧な渦巻き模様を作るようなものです。大きな疑問は、これら2つの「フレーバー」の安全訓練を混ぜたとき、両方に優れたロボットができるのか、それとも片方のフレーバーが完全に他方を飲み込んでしまうのか、ということです。これは、ロボットが危険を「理解」する能力と、それを「拒絶」する能力の両方を維持できるかどうかを調査した、ある新しい研究が解き明かそうとした謎です。
COLM 2026カンファレンスで発表されたこの研究の背後にいる研究者たちは、これをGemma-3-1B-ITと呼ばれる特定のロボットモデルでテストすることに決めました。彼らは、このロボットの2つの特別なバージョンを作成しました。最初のバージョンを、仮に「ディテクティブ(探偵)」と呼びましょう。これは、プロンプトがどの程度有害であるかを特定するエキスパートになるために、膨大な医療関連の質問データセットで訓練されました。これは、「これは少しリスクがあります」や「これは非常に危険です」といった、段階的な回答を与えることを学びました。2番目のバージョンは、「ガーディアン(守護者)」です。これは、ロボットのルールを破るように設計された、巧妙な敵対的プロンプトの巨大なコレクションで訓練されました。ガーディアンは、一つの単純でぶっきらぼうな教訓を学びました。もしそれが危険そうに見えたら、何も考えずに「ノー」と言って答えを拒否せよ、ということです。
チームは、これら2つのスペシャリストを、4つの異なる数学的な混合手法を用いて、1つのロボットへと再び統合しようと試みました。彼らは、その結果として、危険度を検知することもでき、かつ悪いものを拒絶することもできるロボットができることを期待していました。しかし、代わりに、奇妙で偏った結果が見つかりました。あらゆるケースにおいて、「ガーディアン」の振る舞いが完全に支配してしまったのです。マージされたロボットたちは、悪いプロンプトを拒絶することには非常に長けており、拒絶率を高く(81%から85%の間)維持していました。しかし、「ディテクティブ」のスキルはほぼ完全に消滅してしまいました。ロボットは、危険度を格付けする方法を忘れ、プロンプトの深刻さを分類する能力は、手法に応じて0.6%から12.9%にまで低下し、ほぼゼロになりました。それはまるで、ロボットがドアを閉め切って、そこに何があるのかを覗き見るための「のぞき穴」を通して確認することさえ忘れてしまったかのようでした。
なぜこのようなことが起きたのでしょうか?科学者たちは、原因を突き止めるために、これら2つのロボットの「DNA」を詳しく調べました。それは、2つのロボットが互いに戦っていたり、反対方向に向かおうとしていたりしたからではなく、実は、彼らの脳はほぼ直角の関係にあり、互いに衝突することなく全く異なることをしようとしていたことが判明しました。真の問題は、**ボリューム(音量)**の問題でした。「ガーディアン」のロボットは、「ディテクティブ」のデータセットよりも約29倍大きいデータセットで訓練されていたのです。このため、ガーディアンの脳に加えられた変化は、より「大きく」、より強力でした。科学者が脳を混ぜ合わせたとき、使用した数学的なツールは、大きい信号を大きくし、静かな信号を小さくするボリュームノブのようなものでした。「ガーディアン」の大きく力強い「ノー!」が、「ディテクティブ」の繊細でニュアンスのある「たぶん」をかき消してしまったのです。
研究者たちが、ガーディアンの訓練データ量をディテクティブのサイズに合わせて縮小することで修正を試みたとしても、すべてのマージ手法において問題が完全には解消されませんでした。これは、データのサイズが主要な要因であった一方で、マージングアルゴリズムがこれらの「大きい」対「静かな」更新をどのように扱うかが真の鍵であることを示唆しています。この研究は、標準的なマージングツールは、現在、大きくぶっきらぼうな振る舞い(すべてを拒絶することなど)を保持するように偏っており、誤って微細で詳細なスキル(なぜそれが悪いのかを理解することなど)を削除してしまう傾向があることを示唆しています。
では、これは将来にとって何を意味するのでしょうか?論文は、もし私たちが、悪いものを拒絶することもでき、かつ安全性のニュアンスを理解することもできる安全なAIを構築したいのであれば、現在の標準的なツールを使ってモデルを混ぜ合わせるだけでは不十分であると示唆しています。私たちは、「ガーディアン」の中にある「ディテクティブ」を失っているのかもしれません。研究者たちは、将来の手法は、これらの異なる「ボリューム」のバランスを取ることに、より賢くなる必要があると結論付けています。つまり、ロボットが単にすべてに対して「ノー」と言うだけでなく、わずかな警告と大きな危険の違いを理解することを確実にできるようにする必要があるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。