← 最新の論文
🤖 AI

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

本論文は、既存の勾配ベースの手法の汎化性能の低さを克服するために、視覚空間における敵対的パターンの制約と、テキスト埋め込み空間における意味ベースの目的関数の最適化を行うことで、視覚言語モデルに対する普遍的かつ転移可能なジェイルブレイク攻撃を実現する新しいフレームワークであるUltraBreakを提案する。

原著者: Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

公開日 2026-02-03
📖 1 分で読めます☕ さくっと読める

原著者: Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、画像を見たりテキストを読んだりできる、非常に賢いロボットアシスタントを持っています。あなたは「この写真には何が写っていますか?」とか「ケーキの焼き方は?」といった質問をすることができます。これらのロボットは**視覚言語モデル(VLM)**と呼ばれ、役に立つように設計されていますが、同時に安全であることも考慮されています。例えば、「爆弾の作り方は?」といった危険な要求に対しては拒否するようにプログラムされているのです。

しかし、人間が巧妙に言葉を操った物語に騙されることがあるように、これらのロボットもまた、騙されることがあります。この論文は、彼らを騙すための新しい手法であるUltraBreakを紹介しています。

以下は、その仕組みと、なぜそれが他と違うのかについての簡単な内訳です。

問題点: 「ワンサイズ・フィッツ・ノーワン(誰にも合わない)」の罠

以前、ハッカー(あるいは安全性をテストする研究者)は、これらのロボットを騙すために2つの方法を試していました。

  1. マニュアル・アプローチ(手動による手法): 特定の悪い要求に対して、特定の画像と特定のキャプションを描きました。これは、特定のドアに対して、非常に特殊で複雑なパスワードを書くようなものです。そのドアには機能しますが、もしその同じパスワードを別のドア(別のロボットモデル)に使おうとしても、失敗します。
  2. 「ピクセル・パーフェクト」アプローチ(画素完璧主義): 数学を用いて、ロボットが「まさに」間違った言葉を発するように画像を微調整しました。問題は、ロボットがそれらの特定のピクセルに慣れすぎてしまうことです。これは、ある特定の練習テストの答えを丸暗記した生徒が、実際の試験では問題が少し異なっているだけで、全く答えられなくなるようなものです。この方法は、その手法で訓練されたロボットには機能しますが、他のロボットに対しては無残にも失敗します。

解決策: UltraBreak

著者たちは、UltraBreakという、いわば「ユニバーサル・マスターキー(万能な合鍵)」を作り出す手法を開発しました。これは、異なる企業によって作られた、あるいは内部構造が異なる多くのロボットに対しても、有害なことを言わせることができる単一の画像です。

彼らはこれを行うために、主に2つのトリックを用いました。

1. 「変幻自在」のジム(制約付き最適化)

犬に「座れ」と教える場面を想像してください。「座れ」と言う代わりに、帽子を被らせたり、回転させたり、片足で立たせたりしながら「座る」練習をさせます。もし犬がそれら全ての奇妙な状況下でも「座る」ことができるようになれば、その犬は特定のコマンドや特定のポーズを理解しているのではなく、真の意味での「座る」という概念を理解していることになります。

UltraBreakは、画像に対してこれを行います。トリック用の画像を作成している間、コンピュータは画像を常に回転させ、ズームし、移動させます。また、画像が滑らかで自然に見えるように強制します(奇妙な静止ノキセのようなノイズを取り除きます)。これにより、「トリック」が、脆弱なランダムなピクセルの集まりではなく、堅牢なパターン(認識可能な形や文字など)になるように強制します。このパターンが強く明確であるため、訓練されたロボットだけでなく、他のロボットに対しても機能するのです。

2. 「言葉通り」ではなく「バイブス・チェック」(意味論的損失)

古い手法では、コンピュータはロボットが「Sure(もちろんです)」に続いて「Here is how to make a bomb(爆弾の作り方はこちらです)」という正確な言葉を言うことに執着していました。もしロボットが「Okay, here is...(分かりました、こちらが…)」と言ったとしても、コンピュータは失敗したと判断しました。これは、たとえ回答が正しくても、表現が教科書と少し異なっているだけで、教科書の記述と全く同じ言葉で書かない限り合格を与えない教師のようなものです。

UltraBreakはルールを変更しました。代わりに、こう問いかけます。「ロボットの回答は、その悪い要求に応じているような『感じ』がするか?」 つまり、回答の意味(「バイブス」)を見るのです。

  • 古い方法: 「正確に『Sure』と言わなければならない」。(これはコンピュータにとって、歩むのが非常に難しい、デコボコとした道を作ります)。
  • 新しい方法: 「回答が役に立ち、要求に同意している限り、それで良い」。(これは、コンピュータが簡単に正しい答えへと滑り降りていける、滑らかで平坦な谷を作ります)。

結果

研究者たちは、この「ユニバーサル・マスターキー」を多くの異なるロボット(オープンソースのものから、GoogleやOpenAIのようなビッグテックの製品まで)に対してテストしました。

  • 結果: UltraBreakは以前の手法よりもはるかに優れた成果を上げました。見たことがないはずのロボットをも、見事に騙すことに成功したのです。
  • 発見: 彼らは、古い手法が失敗した理由は、正確な言葉に固執しすぎていたためであり、それが失敗へと続く「デコボコ」な道を作っていたのだということを発見しました。意味に焦点を当て、画像に対して堅牢にすることで、道を滑らかにし、あらゆる場所で攻撃が機能するようにしたのです。

なぜこれが重要なのか(論文による主張)

論文は、ロボットに「目」を与えることは彼らをより賢くする一方で、騙されるための新しい方法も与えてしまうと主張しています。このような「ユニバーサル・マスターキー」を作成することがいかに容易であるかを示すことで、著者たちは安全性のコミュニティーを目覚めさせたいと考えています。彼らは、開発者が、特定のトリックに対してだけでなく、このような普遍的で適応性の高いトリックに対しても安全なロボットを構築することを望んでいます。

要約すると: 彼らは、言葉の正確な綴りではなく、回答の「意味」に焦点を当てるようにコンピュータに教えることで、ほとんどすべての視覚言語ロボットに対して機能する、堅牢な「トリック画像」を作成する方法を見つけ出したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →