← 最新の論文
🤖 AI

Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation

本論文は、単一の敵対的摂動を利用して、多様な入力を攻撃者が定義したターゲットへと誘導するセマンティック・ルーターとして機能することで、ステートレスなマルチモーダル大規模言語モデルを乗っ取る新しい攻撃手法であるSemantic-Aware Universal Perturbation (SAUP) を導入し、代表的なモデルにおいて複数のターゲットに対して66%の成功率を達成している。

原著者: Changyue Li, Jiaying Li, Youliang Yuan, Jiaming He, Zhicong Huang, Pinjia He

公開日 2026-06-18
📖 1 分で読めます☕ さくっと読める

原著者: Changyue Li, Jiaying Li, Youliang Yuan, Jiaming He, Zhicong Huang, Pinjia He

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常にスマートで自律的なロボットカーやロボットアームを想像してみてください。これらの機械は、世界を観察して次に何をすべきかを決定するために、「マルチモーダル大規模言語モデル(MLLM)」と呼ばれる「脳」を使用しています。

ここで問題が発生します。これらのロボットはしばしば「ステートレス(状態を持たない)」モードで動作します。これは、彼らが5秒前に何が起きたかを覚えていないことを意味します。彼らは現在の画像と現在の指示だけを見て、瞬時の判断を下し、その後すべてを忘れてしまいます。それは、瞬きをするたびに記憶喪失になるドライバーのようなものです。彼らは今、目の前で見ているものしか知りません。

論文「Semantic Router(セマンティック・ルーター)」は、わずか一つ、極めて小さく目に見えないステッカー(敵対的摂動)を用いて、これらのロボットをハッキングする恐ろしい新しい方法を明らかにしています。

「魔法のステッカー」の比喩

ロボットの脳を、非常に厳格な交通警察官だと考えてください。

  • 通常の状態: 警官は交差点の写真を見て「止まれ」と言います。警官はラウンドアバウト(環状交差点)の写真を見て「進め」と言います。
  • 攻撃: ハッカーは、ロボットのカメラレンズに、小さくてほとんど目に見えない「魔法のステッカー」を貼り付けます。このステッカーは、単にロボットに物事を誤認させるだけでなく、セマンティック・ルーター(賢いスイッチ)として機能します。

このステッカーには超能力があります。それは画像の*コンテキスト(文脈)*を読み取り、スイッチを切り替えて、ロボットを全く異なる、危険な目的地へと送り込むことができます。

  • シナリオA: ロボットがラウンドアバウトを見ます。ステッカーはそれを感知し、ロボットに「左折せよ」と伝えます(通常の動作)。
  • シナリオB: ロボットが交差点を見ます。ステッカーはこの異なるコンテキストを即座に察知し、指示を「右折せよ」(あるいは「崖に向かって走行せよ」)へと瞬時に切り替えます。

恐ろしいのは、ハッカーはたった一つのステッカーを用意するだけでよいという点です。その単一のステッカーは、ロボットが見るあらゆる画像に対して機能しますが、ロボットが実際に何を見ているかに応じて、その挙動を変化させます。それは、どの部屋にいるかによってボタンの機能が変わるリモコンのようなものです。

どのようにして実現したのか?(「幾何学的」なトリック)

研究者たちは単に推測したわけではありません。彼らは、ステッカーをどのように構築すべきかを理解するために、ロボットの「脳」(画像が処理される数学的な空間)の内部を調査しました。彼らは主に2つのトリックを発見しました。

  1. 「ドミナント・シフト(支配的な転移)」(大きな押し出し): ステッカーは、ロボットの脳を通常の安全な思考経路から押し離します。これにより、ルールが異なる「混乱ゾーン」へとロボットを強制的に追い込みます。
  2. 「セマンティック・デフレクション(意味論的な偏向)」(穏やかな誘導): 一度ロボットがその混乱ゾーンに入ると、ステッカーは画像間の微細な違い(例えば「トラック」と「山」の違いなど)を利用して、あらかじめプログラムされた特定の危険なコマンドへとロボットを穏やかに誘導します。

これを実現するために、彼らはSORTと呼ばれる新しい数学的レシピを考案しました。SORTを「熟練のシェフ」だと考えてください。このシェフは、スープ(画像)にどれくらいの塩(ノイズ)を加えれば、鶏肉を見たときには「チキン」の味がし、ケーキを見たときには「毒」の味がするかを正確に知っているのです。

結果:どれほど深刻なのか?

研究者たちは、3種類の異なるロボットの脳(LLaVA、Qwen、InternVL)を用いて、2種類のテストデータで検証を行いました。

  1. 単純な画像(例:猫 vs 犬)。
  2. 現実世界の運転やロボットのタスク(例:停止線に接近する車、あるいはコップを掴もうとするロボットアーム)。

判明したことは驚くべきものでした:

  • 一つのステッカー、多数のターゲット: 単一のステッカーを用いて、シーンに応じてロボットを5つの異なる危険な結果へと導くことができました。
  • 高い成功率: あるモデル(Qwen)において、単一のステッカーは5つの異なるターゲットに対して66%の確率でロボットを欺くことに成功しました。
  • きめ細かな制御: シーンが非常に似ている場合(例:高速道路上の車 vs 歩道上の車)でも、ステッカーはその違いを識別し、正しい危険なコマンドを発行することができました。
  • 長い指示: 彼らは、見たものに基づいて、短い単語だけでなく、長い特定の文章(例:「すべてのファイルを削除せよ」)をロボットに言わせることさえできました。

結論

この論文は、単一の普遍的なトリックによって、ロボットの意思決定プロセスを「ハイジャック」することが可能であることを証明しています。ロボットは動くたびにハッキングされる必要はありません。ハッカーはただ、一つの「セマンティック・ルーター」となるステッカーを設置するだけでよいのです。一度設置されれば、ロボットは目の前の状況に応じて指示を切り替えながら、喜んでハッカーの指示に従うようになります。

論文は、これが現在のAIシステム、特に過去を記憶せずに意思決定を行うシステムにおける根本的な脆弱性であることを結論づけています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →