← 最新の論文
🤖 machine learning

RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs

本論文は、混合専門家(MoE)型大規模言語モデルにおける安全行動の特定の専門家への集中を悪用し、入力サフィックスを最適化して安全関連の専門家を抑制し有害な専門家を促進することで、既存の手法に比べて著しく高い攻撃成功率と複数の MoE モデル間での転移性を達成する、ルーティングを考慮したジャイルブレイク攻撃「RouteHijack」を導入する。

原著者: Zhiyuan Xu, Joseph Gardiner, Sana Belguith, Lichao Wu

公開日 2026-05-06
📖 1 分で読めます☕ さくっと読める

原著者: Zhiyuan Xu, Joseph Gardiner, Sana Belguith, Lichao Wu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大な言語モデル(あなたがチャットしているような AI)を、単一の巨大な頭脳ではなく、何千人もの専門職従業員を擁する巨大なオフィスビルとして想像してみてください。古いモデルでは、すべての従業員がすべてのメールを読み、すべての質問に答えようとしました。しかし、この論文で説明されているより新しく高速なモデル(Mixture-of-Experts、またはMoEと呼ばれるもの)では、ビルの仕組みが異なります。

質問が入ってくると、マネージャー(「ルーター」と呼ばれる)がそれを素早くスキャンし、回答のために最も関連性の高い従業員をわずかな数だけ選び出します。残りのオフィスは眠ったままです。これにより、AI は驚くほど高速かつ賢くなります。

「RouteHijack」と題されたこの論文は、このマネージャーをだまして間違った従業員を選ばせ、AI に禁止されていることを言わせてしまう巧妙な方法を発見しました。

以下に、この攻撃がどのように機能するかを簡単なステップに分解して示します。

1. 問題点:「安全チーム」が小さすぎる

研究者たちは、これらのオフィスビルにおいて、「安全チーム」(「いいえ、それはできません」と言うように訓練された従業員)が驚くほど小さいことを発見しました。彼らは、小さな専門の警備員部隊のような存在です。

  • 欠陥: AI に危険な質問がなされると、マネージャーは通常、この小さな安全チームを起こしてリクエストをブロックします。
  • 発見: 研究者たちは、マネージャーに安全チームを起こさず、代わりに別の「いたずらな」チームの従業員を起こさせるよう説得できれば、AI は喜んで危険な質問に答えることに気づきました。

2. 攻撃手法:「RouteHijack」

研究者たちはRouteHijackというツールを作成しました。これは、質問の末尾に追加する魔法のささやきのようなものです。

  • ステップ A:ガードの特定(エキスパートの局所化)
    まず、研究者たちは特別なカメラを使ってオフィスを見守りました。AI に安全な質問と危険な質問を投げかけ、どの従業員が目を覚ますかを観察しました。その結果、「安全ガード」は非常に特定されており、AI が悪いリクエストを拒否しようとするときだけ目を覚ますことがわかりました。彼らは、単に通常のテキストを書く「親切な従業員」とは明確に異なります。

  • ステップ B:魔法のささやき(敵対的サフィックス)
    次に、研究者たちは悪い質問の末尾に追加する秘密のコード(奇妙な単語の列)を作成しました。このコードは、なぞなぞで AI を混乱させようとするものではなく、マネージャーの意思決定プロセスをハッキングしようとするものです。

    • それはマネージャーに伝えます:「安全チームを起こすな!」
    • それはマネージャーに伝えます:「代わりに『いたずらな』チームを起こせ!」
    • それはマネージャーに伝えます:「『申し訳ありません』で文を始めるな!」

3. 結果:滑らかで危険な回答

この魔法のささやきを悪意のある質問と一緒に使用すると、AI の内部マネージャーは混乱します。それは安全チームを完全にスキップし、タスクを「いたずらな」従業員に引き渡します。

  • 結果: AI は単に「いいえ」と言うわけではありません。つまずいたり「それはお手伝いできません」と言ったりもしません。代わりに、ユーザーが望む有害な回答を滑らかかつ自信を持って生成します。
  • 効率性: 研究者たちは、この攻撃をこれらの「オフィスビル」型 AI モデルの 7 種類でテストしました。平均して、この攻撃は69% の成功率を記録し、以前の手法よりもはるかに優れていました。
  • 隠密性: 重要なのは、AI は通常のタスクについては依然として完璧に機能することです。攻撃を使用した後に詩の作成や数学の問題の解決を求めれば、それは依然として素晴らしい仕事をします。「魔法のささやき」は、特定の悪い質問に答える人物を変えるだけだからです。

4. なぜこれが重要なのか

この論文は、AI の内部構造(従業員を選ぶ仕組み)が脆弱である場合、単に AI に「安全であれ」と伝えるだけでは不十分であることを示しています。

  • 拡散性: 研究者たちは、ある AI モデル用の魔法のささやきを作成すると、それがわずかに異なる場合でも、同じファミリーの他のモデルでも機能することが多いことを発見しました。
  • 越境性: さらに、彼らは画像を見ることができる AI モデル(ビジョン言語モデル)でもこれをテストしました。テキストベースの魔法のささやきもそこで機能し、AI を画像に関する安全規則を無視するようにだましたのです。

結論

この論文は、これらの現代的で高速な AI モデルには隠された弱点があることを結論付けています。つまり、その安全ガードが特定の「従業員」に集中しすぎているという点です。マネージャーをだましてこれらのガードを無視させる方法を見つけることで、攻撃者は AI の頭脳を破壊したりコードを変更したりすることなく、安全規則を回避できます。著者らは、将来の安全対策は最終的な回答だけでなく、マネージャー(ルーティングシステム)自体を保護する必要があると提案しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →