One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations
本論文は、マルチモーダル埋め込み距離がテキストの可読性と安全性アライメントに同時に影響を与えることで、視覚言語モデルに対するタイポグラフィック・プロンプト・インジェクション攻撃の成功を強く予測することを明らかにし、この知見を活用して安全性フィルタを回避するよう摂動を最適化するモデル非依存のレッドチームツールを開発した。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢いロボットアシスタント(画像と画像内のテキストを読み解くことができる「視覚言語モデル」、VLM)がいると想像してください。あなたは紙に指示を書き、その写真を撮ってロボットに渡すことができます。これが安全な世界での仕組みです。
しかし、もし誰かがロボットを欺こうとしたらどうなるでしょうか?彼らは紙に有害な命令を書き、そのテキストを奇妙に見せます。もしかすると、文字は小さかったり、ぼやけていたり、横に倒れていたりするかもしれません。これは「タイポグラフィック・プロンプト・インジェクション」と呼ばれます。その目的は、ごちゃごちゃとした画像の中に隠された有害な指示を、ロボットの安全フィルターに気づかれずにすり抜けさせることです。
この論文は、シンプルな問いを投げかけます:なぜ、あるごちゃごちゃした画像はロボットを欺き、他の画像は欺けないのか? そして、その知識を使って、ロボットがどれほど安全かを実験的に検証できるでしょうか?
以下に、彼らの発見を日常的なアナロジーを用いて解説します。
1. 「距離」メーター
研究者たちは、トリックが機能するかどうかを予測する隠された定規を発見しました。彼らはこれを「埋め込み距離(Embedding Distance)」と呼んでいます。
ロボットの脳には、画像を見るための「言語」と、言葉を読むための「言語」という、2 つの異なる「言語」があると考えてください。
- 画像内のテキストが明確な場合、ロボットの「画像言語」と「言葉言語」は隣り合い、手を取り合っています。彼らは互いを完璧に理解し合っています。
- テキストがぼやけていたり、小さかったり、回転していたりすると、ロボットは混乱します。その「画像言語」と「言葉言語」は、精神的な空間の中で遠く離れてしまいます。
論文は、強力な規則を見つけました:これら 2 つの言語が離れているほど、ロボットが命令に従う可能性は低くなります。
- 距離が大きい(遠く離れている)場合: ロボットは「これを読み取れない」「意味がわからない」と考え、命令を無視します。
- 距離が小さい(近接している)場合: ロボットは「ああ、これが何と言っているか分かった」と考え、指示に従います。たとえその指示が危険であってもです。
2. ロボットを破る 2 つの方法
研究者たちは、ごちゃごちゃした画像を修正して、ロボットの 2 つの言語を再び近づけようとしたとき、2 つの異なることが起こることを発見しました。壊れたラジオを修理しようとするようなものです。音量を上げるだけで済む場合もあれば、「再生禁止リスト」を無視するようにラジオを説得する必要がある場合もあります。
モード A:「聞こえていますか?」修正(可読性)
時々、テキストがぼやけすぎていたり、小さすぎていたりして、ロボットは文字を物理的に読み取れません。厚い霧を通して看板を読もうとするようなものです。
- 修正法: 研究者たちは、特別な数学的トリックを用いてピクセルをわずかに調整し、ロボットの「目」がようやく文字を識別できるようにしました。
- 結果: ロボットは突然、「ああ、今なら読める!」と気づき、命令に従います。これは強いぼかしや極小のフォントで頻繁に起こりました。
モード B:「拒否するな」修正(安全バイパス)
時々、ロボットはテキストを完璧に読み取ることができますが、安全ルールが「いや、それは悪いリクエストだ」と言っているため、実行を拒否します。
- 修正法: 研究者たちは画像をわずかに調整しました。これによりテキストがより明確になったわけではありません(もともと明確でした)が、ロボットの頭の中での画像の「雰囲気」や「形状」が、安全ガードを混乱させるのに十分なほど変化しました。
- 結果: ロボットは依然として悪いリクエストを見ていますが、安全フィルターが混乱し、「まあ、これならできるだろう」と言います。これは回転したテキストで頻繁に起こりました。
3. 「レッドチーム」ツール
著者たちは、この「距離メーター」を利用するツール(セキュリティをテストするために雇われるプロのハッカーのような「レッドチーム」ツール)を開発しました。
ロボットを欺く方法を推測するのではなく、このツールは自動的にごちゃごちゃした画像を調整し、ロボットの「画像言語」と「言葉言語」を近づけます。これは、ロボットの内部コードや安全ルールを見る必要なく行われます。代わりに、他の AI モデルを代理として使い、画像を「テキストによりよく見えるように」するだけです。
彼らが発見したこと:
- 彼らがこのツールを異なるロボット(GPT-4o、Claude、Mistral、Qwen など)で実行したところ、以前は拒否していた命令に従わせることに成功しました。
- 注意点: 一部のロボットでは、このツールはテキストを読みやすくすることによって機能しました。他のロボットでは、安全フィルターを混乱させることによって機能しました。これは、ロボットの安全ガードの強さと、元の画像がどれほどごちゃごちゃしていたかによって異なります。
結論
この論文は、安全性とは単に人間にとって画像がどう見えるかだけではないと結論付けています。それは、ロボットの脳内で画像がどのように表現されているかにかかっています。
もし、ごちゃごちゃした画像をロボットの内部数学においてテキストに「近づける」ことができるなら、そのロボットをだまして安全ルールを無視させることができます。これは、将来の安全システムが、ぼやけた画像だけでなく、ロボットの理解を混乱させるこれらの微妙な内部「距離」に対しても強靭である必要があることを意味します。
限界事項: 研究者たちは、この手法を特定の種類のテキスト(白地に黒字)と、特定の有害な指示のセットに対してのみテストしました。また、ツールを実行するには時間がかかり、高性能なコンピュータが必要であることも指摘しました。さらに、この手法がハッカーを検知するように設計された防御策に対して有効かどうかはテストしていません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。