← 最新の論文
💻 computer science

SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs

本論文は、多様なクロスモーダルな脅威に対してマルチモーダル大規模言語モデルを堅牢に防御しつつ有用性を維持するために、標的を絞った抑制と活性化増幅を通じてモダリティ普遍的な安全性ニューロンを特定および制御する、クロスモーダル安全性アライメントフレームワークであるSafeNexusを導入するものである。

原著者: Jian Yu, Fei Shen, Cong Wang, Jian Wang, Lu Jin. Xiaoyu Du, Jinhui Tang, Tat-Seng Chua

公開日 2026-08-03
📖 1 分で読めます☕ さくっと読める

原著者: Jian Yu, Fei Shen, Cong Wang, Jian Wang, Lu Jin. Xiaoyu Du, Jinhui Tang, Tat-Seng Chua

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットを、本があなたに話しかけてくる、巨大で賑やかな図書館だと想像してみてください。長い間、これらの「話す本」は、非常に賢いチャットボットのような、単なるテキスト形式でした。しかし最近、それらは「マルチモーダル大規模言語モデル(MLLM)」へと進化しました。これらは、テキストを読み、画像を見、音声を同時に聞くことができる「スーパー司書」のようなものです。彼らは非常に役に立ちますが、この新しい超能力には一つ落とし穴があります。それは、トラブルメーカーが彼らを欺くための新しい方法を生み出してしまうことです。美術館の警備員が偽物の絵画は見抜けても、偽物の録音には気づかないかもしれないのと同様に、AIモデルの多くは、特定の入力タイプに対してのみ機能する安全ガードを備えています。もし、言葉ではなく画像や、文章ではなく音声クリップを使って彼らを騙そうとすれば、ガードマンは危険を見逃してしまうかもしれません。研究者たちが投げかけている大きな問いは、「トラブルメーカーがいかなる方法で侵入しようとも、機能する安全システムをどうやって構築するか?」ということです。

ここで、SafeNexusと呼ばれる新しい研究が登場します。中国とシンガポールの大学のチームによる研究者たちは、AIの安全性を外側から眺めるのではなく、AIの「脳」の内部へと宝探しに出かけることにしました。彼らは、AIが不適切な要求に対して「ノー」と言う能力は、バラバラに散らばっているのではなく、実はニューロンと呼ばれる、非常に小さく特別なグループの内部スイッチによって制御されていることを発見しました。

ここからが面白いところです。チームは、異なる種類の入力(テキスト、画像、音声など)は情報を処理するために脳の異なる部分を使用しますが、あらゆる入力に対して究極の「危険検知器」として機能する、秘密の共有クラブのようなニューロンが存在することを発見しました。彼らはこれをUS-Neurons(モダリティ普遍的安全ニューロン)と呼んでいます。これは、ナイフを持ち込もうが、爆弾を持ち込もうが、あるいは偽造IDを持ち込もうが、廊下にある特定の小さなセキュリティカメラがそのすべてを見つけ出す、という状況に似ています。もしそのカメラの電源を切ってしまえば、侵入者が何を持っていようとも、建物全体が危険な状態になってしまいます。

この論文は、従来のメソッドがAI全体を再学習させたり、外部フィルターを追加したりすることで安全性の穴を塞ごうとしていたことは、すべてのドアに対して新しい警備員を雇うようなものだと示唆しています。SafeNexusは異なるアプローチを取ります。それは、それら数少ないクリティカルな「危険検知ニューロン」を見つけ出し、彼らにスーパーパワーを与えるという方法です。チームは2つの方法をテストしました。

  1. アンプリファイア(増幅器): AIの思考プロセス中に、それらの特定のニューロンのボリュームを単に上げ、より大きく、より速く「危険!」と叫ぶようにしました。
  2. キャリブレーター(校正器): それらの特定のニューロンに対し、ターゲットを絞った微調整(LoRAと呼ばれる手法を使用)を行い、AI全体を再学習させることなく、自然にトラブルを見抜く能力を高めました。

結果は驚くべきものでした。QwenやVITAといったモデルでテストしたところ、これら少数のニューロンを強化することで、要求がテキスト、画像、あるいは音声のいずれであっても、AIは有害な要求を拒否することが非常に上手くなりました。決定的なのは、この方法によってAIが「愚か」になったり、過度に慎重になったりしなかったことです。例えば、「ケーキの作り方を教えて」といった無害な質問を拒否し始めることもありませんでしたし、他の仕事の仕方を忘れることもありませんでした。実際、いくつかのテストでは、この新しい手法は現在の最高の手法よりも攻撃を阻止する能力において遥かに優れており、それでいてAIの全脳力の0.05%未満しか変更していませんでした。

研究者たちはまた、このトリックが、彼らが明示的に学習させていないもの、例えば動画に対しても有効であることを示しました。チューニング段階でAIに動画クリップを見せていなかったにもかかわらず、強化されたニューロンは動画による攻撃における危険を検知することができました。これは、彼らが単に特定の例を暗記したのではなく、真にコアとなる普遍的な安全メカニズムを見つけ出したことを示唆しています。

要するに、SafeNexusは、あらゆるフォーマットに対してAIを安全にするために、AIの安全システム全体を再構築する必要はないということを示唆しています。代わりに、私たちは機械の中にある、ごく少数の普遍的な「ブレーキ」を見つけ出し、それがフルストロークで機能するようにすればよいのです。これは、車のスピードを抑えるためにエンジン全体を交換する必要はなく、ただブレーキペダルが車輪にしっかりと接続されていることを確認すればよい、ということに似ています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →