Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models
本論文は、視覚モダリティと言語モダリティの間に動的なフィードバックループを確立してクロスモーダルな意味的整合性を回復し、かつ意味的アンカーを用いて更新を制約し特徴の破損を軽減することにより、視覚言語モデルの敵対的堅牢性を高める新たな防御機構である「クローズドループ双方向プロンプティング」を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ビジョン・ランゲージモデル(VLM)を、2 人のパートナーからなる熟練した探偵チームとして想像してみてください。一人は画像を見る視覚探偵、もう一人は説明文を読むテキスト探偵です。彼らは画像と言葉を一致させるために、完璧に連携して働くように訓練されています。
しかし、これらの探偵は敵対的攻撃に対して脆弱です。攻撃者を、写真に目に見えない「ノイズ」や、わずかで混乱を招くような小さな汚れを追加する、熟練した偽造師だと考えてください。このノイズは人間には見えないほど微妙ですが、視覚探偵を完全に異なるものだと誤認させるように仕向けます。2 人の探偵は密接にリンクしているため、視覚探偵が混乱すればテキスト探偵も混乱し、チーム全体が失敗します。
現在の防御策の問題点
これらの探偵を守るための以前の試みには、2 つの主な欠陥がありました。
- 一方通行の交通: ほとんどの防御策は、視覚探偵を再訓練すること、またはテキスト探偵のメモを変更することのどちらか一方のみを試みました。彼らはもう一方のパートナーを、固定され変更不可能な背景として扱いました。しかし、攻撃者が彼らの間の接続を破壊しようとしている場合、片側だけを修正しても十分ではありません。
- 静的なメモ: 一部の防御策は、テキスト探偵にすべての画像に対して使用する単一の、事前に書かれたスクリプトを与えました。しかし、画像も攻撃もそれぞれ異なるため、万能なスクリプトはしばしば失敗します。
解決策:クローズドループ双方向プロンプティング(CLBP)
著者らは、2 人の探偵の間に動的なフィードバックループとして機能する、CLBPと呼ばれる新しい戦略を提案しています。孤立して働くのではなく、彼らは再訓練を必要とせずに、リアルタイムで誤りを修正するために絶えず互いに会話します。
このプロセスがどのように機能するかを、創造的な比喩を用いてステップごとに説明します。
1. セマンティックアンカー(「北極星」)
探偵たちが厄介な画像の作業を開始する前に、**「セマンティックアンカー」**で合意します。これを固定された信頼できるコンパス、あるいは「北極星」と想像してください。それは、クラスの真実で汚されていない意味を表す、汎用的で安全な記述(例:「[猫] の写真」)です。
- なぜ重要か: このアンカーは、探偵たちが混乱の中に迷い込むのを防ぎます。彼らを訓練中に学んだ、元々の安全な知識に留まらせておくのです。
2. ステップ 1:テキストからビジョンへのノイズ除去(「クリーナー」)
視覚探偵は、ノイズの混じった攻撃された画像を見て混乱します。彼らはテキスト探偵に尋ねます。「北極星に基づけば、これは実際にはどのように見えるべきですか?」
- テキスト探偵は、安定した「北極星」を用いてクリーニングプロンプトを生成します。
- このプロンプトは視覚探偵に戻され、視覚探偵はそれを用いてノイズを「フィルタリング」します。これは、テキスト探偵が視覚探偵に、偽造師の汚れを取り除く特別な眼鏡を渡すようなもので、彼が真の画像を再び見ることを可能にします。
3. ステップ 2:ビジョンからテキストへの洗練(「編集者」)
視覚探偵がより明確な画像を得た今、テキスト探偵に向かい、「わかった、画像がはっきり見えるようになった。現在の記述は私が目撃しているものと一致していますか?」と言います。
- 視覚探偵はテキスト探偵に信号を送り返します。
- テキスト探偵は、この画像に特化してメモを更新し、クリーニングされた視覚証拠に一致するように記述を調整します。
4. ループの閉鎖
これら 2 つのステップは、高速なサイクルで発生します。テキストがビジョンをクリーニングし、ビジョンがテキストを洗練します。
- 魔法: 著者らは数学的に、このループが収束的であることを証明しています。ゴムバンドを想像してください。探偵たちが会話するたびに、彼らは互いに真実へと引き寄せられます。たとえ彼らが(強力な攻撃により)遠く離れて始まったとしても、この会話の 1 回または 2 回のラウンドで、彼らは正しい答えへと戻ります。彼らは制御不能に螺旋を描くのではなく、急速に収束します。
5. セーフティネット:マルチビュー集約
さらに確実にするために、システムは画像を 1 回見るだけではありません。画像の32 種類のわずかに異なるバージョンを作成します(わずかに異なる角度や照明で 32 枚写真を撮るようなものです)。
- 「クリーニングと洗練」のループを、これら 32 種類のバージョンすべてで実行します。
- 次に、投票を行います。32 のバージョンのうち 30 が答えに同意し、2 つが外れ値であれば、システムは外れ値を無視し、コンセンサスに従います。これにより、攻撃者がチーム全体をだますことが非常に難しくなります。
これが重要である理由
この論文は、この方法が優れていると主張しています。
- 双方向の通り道: 片側だけを修正する以前の手法とは異なり、CLBP は画像と言葉が互いに修正し合えるようにします。
- 効率的: 巨大な AI モデルの再訓練(時間と費用がかかる)を必要としません。既存のモデルの上に、小さく賢い会話レイヤーを追加するだけです。
- どこでも機能する: 著者らは、猫や車の認識から衛星画像やテクスチャの分析まで、11 の異なるデータセットでこれをテストしました。ほぼすべてのケースで、CLBP は正常でクリーンな画像においても正確性を保ちながら、以前の手法よりもはるかに攻撃への耐性がありました。
まとめ
CLBPを、写真家とキャプションライター間の自己修正的な会話と考えてください。偽造師が偽の画像で写真家をだまそうとしたとき、キャプションライターは真実に関する知識を用いて、写真家が偽物を見抜くのを助けます。その後、写真家はキャプションライターが完璧な記述を書くのを助けます。彼らはノイズを無視し、両者が真実で合意するまで話し合い続けます。これは非常に速く、非常に効果的に起こるため、偽造師のトリックは単に機能しません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。