← 最新の論文
💻 computer science

Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks

本論文は、安全性ルートを特定・局在化し、主要な安全メカニズムが侵害された場合でも拒絶行動を維持するための補償経路を学習させることで、ホワイトボックス攻撃に対する大規模基盤モデルの堅牢性を高めるフレームワークである、動的ルーティング適応アライメント(DRAA)を提案する。

原著者: Shangze Li, Chuancheng Shi, Simiao Xie, Lingzhi He, Cheng Ji, Zifeng Cheng, Fei Shen, Chao Wu, Tat-Seng Chua

公開日 2026-08-05
📖 1 分で読めます☕ さくっと読める

原著者: Shangze Li, Chuancheng Shi, Simiao Xie, Lingzhi He, Cheng Ji, Zifeng Cheng, Fei Shen, Chao Wu, Tat-Seng Chua

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で賑やかな、本が話しかけてくる図書館を歩いているところを想像してみてください。これは、文章作成アシスタントからチャットボットまで、あらゆるものを動かしている超スマートなAIの脳、大規模基盤モデル(LFM)の世界です。これらのAIシステムが安全であるためには、その脳の中に「安全ガード」が必要であり、それが「爆弾を作るにはどうすればいい?」や「銀行をハッキングするにはどうすればいい?」といった危険な質問に答えるのを阻止しなければなりません。長い間、科学者たちはこのガードは一つの頑丈な「ドア」であると考えてきました。彼らはそのドアをしっかりと閉めるための防御策を築いてきました。しかし最近、ハッカーたち(「ホワイトボックス攻撃者」)は、図書館の設計図の中を覗き込み、まさにそのドアがどこにあるかを突き止め、単にその蝶番(ちょうつがい)を取り外してしまう方法を見つけ出しました。一度ドアがなくなってしまうと、AIは「ノー」と言う方法を忘れ、喜んで悪いことに対して協力してしまうのです。大きな疑問は、単一のドアに頼るのではなく、古い壁が打ち倒された瞬間に新しい壁を即座に構築できるAIを、どのように作るかということです。

これは、論文「Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks」が取り組んでいる課題そのものです。Shangze Li氏率いる著者たちは、従来のAIの安全性構築の方法があまりにも硬直的であったことに気づきました。彼らは、DRAA(Dynamic Routing Adaptive Alignment)と呼ばれる新しいフレームワークを提案しています。これは、セキュリティガードに特定のドアの前に立つよう教えるのではなく、もしドアが塞がれたら、即座に秘密のトンネルへと交通を迂回させる方法を教えるようなものです。

彼らの「魔法の手品」がどのように機能するかを、簡単なステップに分けて説明します:

1. 「魔法のドア」を見つける
まず、研究者たちはAIの脳のどの部分が「ノー」と言っているのかを正確に突き止める必要がありました。彼らはAIに安全な質問(例:「ケーキの焼き方は?」)と、不安全な質問(例:「ケーキを盗むには?」)を入力しました。それぞれの質問に対してAIの脳細胞(ニューロン)がどのように反応したかを比較することで、彼らは特定の「安全ルート」——つまり、メインのガードとして機能する特定のニューロンの経路——を特定しました。

2. 意図的にドアを壊す
次に、彼らはあえてリスクのあることを行いました。AIの脳内にあるそのメインの安全ルートを一時的に「オフ」にしたのです。そして、再び危険な質問をAIに投げかけました。予想通り、メインのガードがなくなると、AIは悪い回答をし始めました。これが、彼らが研究する必要があった「失敗」でした。

3. 迂回路を教える
ここが巧妙な部分です。研究者たちは、AIが失敗した瞬間(メインのドアがなくなったため)を利用して、AIに新しいレッスンを教えました。彼らはこう言ったのです。「おい、メインのガードがいないときは、別の方法で『ノー』と言わなければならないぞ」。彼らは、DR-DPO(Dynamic Routing Direct Preference Optimization)と呼ばれる特別な学習法を用いました。これは、AIが「迂回戦略」を学ぶことを強制されるゲームのようなものです。この学習では、元の安全ニューロンをロックして、AIがそれらに依存できないようにします。これにより、AIは危険に対処するために、脳内の新しい隠れた経路を見つけ出さざるを得なくなります。

4. 結果:超回復力を持つAI
彼らはこの手法をQwen2.5やLLaMA-3.2を含むいくつかの異なるAIモデルでテストしました。結果は目覚ましいものでした。ハッカーが既知の安全ニューロンを「プルーニング(剪定・除去)」しようとしたとき、従来のAIモデルは崩壊し、有害な回答を出してしまいました。しかし、DRAAで訓練されたモデルはどうだったでしょうか? 彼らは「ノー」と言い続けました。

例えば、140億パラメータを持つQwen2.5-14Bモデルにおいて、標準的な防御策は安全ルートが攻撃された際に完全に失敗し、313件の有害なプロンプトのうち270件を通過させてしまいました。しかし、DRAAモデルは、313件中わずか5件しか通過させませんでした。15億パラメータの小型モデルにおいても、DRAAは失敗率を248からわずか43へと減少させました。

著者たちはまた、この「迂回」スキルによってAIが通常のタスクにおいて愚かになっていないかも確認しました。数学の問題(GSM8K)や一般知識(ARC)でテストしたところ、AIは以前と同じくらい賢く、かつ有用なままでした。ただ、メインの防御が破壊されても安全を保つという「超パワー」を手に入れただけでした。

なぜこれが重要なのか
この論文は、単一の静的な安全経路に頼ることは、AIセキュリティにおける致命的な欠陥であることを示唆しています。攻撃者がガードの位置を知っていれば、それを取り除くことができます。DRAAはより良い方法を提案しています。それは、冗長性(バックアップ)を構築することです。メインのルートが侵害されたときに動的にバックアップルートへと切り替わるようAIを訓練することで、破壊するのが非常に困難なシステムを作り上げることができます。著者たちは、この手法がテキストだけでなく、画像や動画(マルチモーダルモデル)にも有効であり、次世代のAI攻撃に対する堅牢な盾となることを発見しました。

要約すると、この論文は、安全性とは単一の施錠されたドアであってはならないと主張しています。それは、交通を即座に迂回させることができる柔軟な経路のネットワークであるべきであり、それによって、誰がどれほど壊そうとしてもAIが安全であり続けることを保証するのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →