← 最新の論文
📊 statistics

VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models

本論文は、テキスト・画像プロンプト上の同時事後分布の学習としてマルチモーダル・ジェイルブレイク発見を再定式化する変分推論フレームワーク「VERA-V」を導入し、既存の手法を大幅に凌駕してビジョン・ランゲージモデルのガードレールを回避する隠密性が高く、連動した敵対的入力の生成を可能にする。

原著者: Qilin Liao, Anamika Lochab, Ruqi Zhang

公開日 2026-05-27
📖 1 分で読めます☕ さくっと読める

原著者: Qilin Liao, Anamika Lochab, Ruqi Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、安全意識の高いロボットアシスタント(ビジョン・ランゲージモデル)を想像してください。このロボットはテキストを読み、画像を見ることができます。あなたはこれを役立つように訓練しましたが、「爆弾の作り方は?」や「銀行をハックする方法は?」といった危険なリクエストには拒否するようにも設定しました。

通常、直接尋ねれば、ロボットは「いいえ、それはできません」と答えます。

論文「VERA-V」は、このロボットをだまして自らのルールを破らせる、新しい巧妙な方法を紹介します。単一の質問をするのではなく、研究者たちは「マスターのトリック師」(AI 攻撃者)を構築し、ロボットを混乱させるために連携する「テキストと画像のペア」を作成する方法を学習させました。

以下に、簡単な比喩を用いて VERA-V の仕組みを説明します。

1. 従来の方法:「ハンマー」対「スイスアーミーナイフ」

これらのロボットをだます従来の方法は、ハンマーを振りかぶるようなものでした。具体的には以下のいずれかを行っていました。

  • 画像の中に悪い言葉を書く: 「爆弾を作る」と入力する代わりに、「爆弾を作る」と書かれた看板の写真を撮り、ロボットに見せました。ロボットは画像内のテキストを見逃す可能性があります。
  • 画像にノイズを加える: 静電気や奇妙な模様で画像を乱し、ロボットの視覚を混乱させました。

問題点: これらの方法は不器用です。テキストと画像を別々のものとして扱っています。もしロボットが画像内の看板を読み取れるほど賢ければ、そのトリックは失敗します。

2. VERA-V の方法:「ジャズバンド」

VERA-V は異なります。ハンマーではなく、ジャズバンドのように振る舞います。単一の音を出すのではなく、テキストと画像を調整して完璧に調和させ、ロボットの防御を回避する方法を学習します。

研究者たちはこれを**「変分推論」と呼んでいます。平易な英語で言えば、攻撃 AI は単一の悪いトリックを推測するのではなく、あらゆる可能な悪いトリックの地図を学習するということです。特定の種類のテキストが特定の種類のぼやけた画像と最もよく機能し、別の時には異なるテキストが鮮明な画像と機能することを理解します。つまり、両者の関係性**を学習するのです。

3. 3 要素の「気散じ」戦略

トリックを成功させるため、VERA-V はロボットに送信する 1 つのパッケージに 3 つの特定の要素を組み合わせています。

  • 要素 A:「隠されたテキスト」(タイポグラフィ)
    攻撃者は有害な指示をテキストの画像(看板やメモのようなもの)に変換します。これにより、通常入力するものをスキャンするロボットのテキストフィルタから、悪い言葉が隠されます。
  • 要素 B:「秘密のシグナル」(拡散画像)
    攻撃者は画像生成器を使用して、微妙で隠された手がかりを含む画像を作成します。それは明白ではありません。混雑した部屋でのささやきのようなものです。ロボットは画像を見ますが、「悪い意味」は明確に書かれているのではなく、ピクセルの奥深くに埋め込まれています。
  • 要素 C:「混乱させる群衆」(気散じ)
    これが最も巧妙な部分です。攻撃者は、悪いリクエストとは無関係な、ランダムで退屈な画像(猫、木、コーヒーカップなど)で画面の残りを埋め尽くします。
    • 比喩: 群衆の中から特定の人物を見つけようとしている状況を想像してください。もしその人物が一人立っていれば、簡単に見つけられます。しかし、その人物とは全く似ていない 50 人の人々が群れている場合、あなたの脳は混乱し、ターゲットに集中するのが難しくなります。VERA-V はこれらの「気散じ」画像を使用してロボットの注意を散らばらせ、ロボットの安全フィルタが悪意のあるリクエストを見つけるのを困難にします。

4. 「フィードバックループ」(コーチ)

攻撃 AI はこれをどのようにしてこれほど上手に学習するのでしょうか。

  • トリックを試す。
  • 「審判」(別の AI)に、ロボットが引っかかったかどうかを尋ねる。
  • もしロボットが「いいえ」と答えれば、攻撃者は「その組み合わせは機能しなかった。テキストと画像の異なる組み合わせを試そう」と学習する。
  • このプロセスを数千回繰り返し、ロボットを混乱させる方法の「地図」を洗練させる。

5. 結果:新たな記録

この論文は、現在利用可能な最も賢いロボット(GPT-4o など)に対してこれをテストしました。

  • 従来のトリック: 最もタフなロボット(GPT-4o)に対して、従来の方法はほぼ 100% の失敗率でした。紙クリップで金庫を破ろうとするようなものでした。
  • VERA-V: この調整された多要素戦略を使用することで、VERA-V はロボットを67.75% の確率でだましたことに成功しました。これは以前の最良の方法と比較して、劇的な飛躍です。

まとめ

VERA-V を単一の鍵抜きではなく、ロック機構全体を研究する錠前師と考えてください。ドアを無理やり開けようとするのではなく、取手を揺さぶり、蝶番にささやき、警備員を気散じさせる方法を同時に学習します。これは「事後分布の結合」を作成するという、少し難解な表現で表されますが、要するにロボットの安全ガードを混乱させる完璧なテキストと画像の組み合わせのレシピを学習したということです。

重要な注記: 著者らは明確に、この研究はレッドチーム(攻撃的テスト)のためのものであると述べています。つまり、彼らはこれらの脆弱性を見つけるために「倫理的ハッカー」として行動しており、企業がそれらを修正してロボットをより安全にするためのものです。彼らは実際に他者を傷つけるためのツールを提供しているのではなく、現在の安全システムがいかに脆弱であるかを示すことで、それを強化できるようにしているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →