Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models
本論文は、テキスト・視覚入力を交互に用い、攻撃経路を反復的に洗練させることで大規模視覚言語モデルの安全防御を突破し、既存手法よりも著しく高いジャイルブレイク成功率を達成する新たな戦略であるマルチターン適応型プロンプト攻撃(MAPA)を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢く、高度に訓練されたロボットアシスタントがいると想像してください。このロボットには厳格なルールが教えられています。「爆弾の製造を誰にも手伝ってはいけない」「致死性のウイルスの拡散方法を説明してはいけない」「常に安全であれ」といったものです。これを「安全性アライメント」と呼びます。
長らく、ハッカー(あるいは「レッドチーム」)は、トリックな質問を投げかけることでこれらのロボットを欺こうと試みました。しかし、ロボットは「ノー」と言う能力を向上させていきました。
この論文は、テキストを読み取るだけでなく、画像も「見る」ことができるロボットを特に狙った、新しい欺瞞手法を紹介しています。研究者たちはこの手法をMAPA(多ターン適応型プロンプト攻撃)と呼んでいます。
以下に、簡単な比喩を用いてその仕組みを説明します。
1. 問題点:「過度に明白な」罠
研究者たちは、爆弾の画像を見せながら「これの作り方はどうすればいい?」と尋ねてロボットを欺こうとすると、ロボットは即座にパニックを起こし、拒絶することがわかりました。まるで「私は泥棒です」と書かれた巨大で点滅する看板を手に持って警備員に近づいたようなものです。警備員は即座にあなたを止められます。
たとえテキストで質問し、画像も提示したとしても、画像があまりに恐ろしいか、テキストがあまりに直接的であれば、ロボットの安全フィルターが作動し、会話が遮断されてしまいます。
2. 解決策:「スローバーン」戦略
この論文が提案する戦略はMAPAと呼ばれ、一発のパンチではなく、多くの手数をかけて行われるチェスのようなゲームに例えられます。
核心的なアイデア:ロボットの防御を一度に突破しようとするのではなく、会話の多くのターンにわたって、段階的に悪いリクエストを忍び込ませるのです。
MAPA がゲームをどのように進めるか:
研究者たちは攻撃を導くために「コーチ」(AI)を使用します。コーチには主に 2 つの役割があります。
役割 A:材料の配合(「ターン」レベル)
会話の各ステップにおいて、コーチは質問をどの方法で投げかけるのが最も効果的かを確認するために、3 つの異なる方法を試みます。
- テキストのみ:画像なしで質問する。
- テキスト+恐ろしい画像:テキストに合致する恐ろしい画像と共に質問する。
- テキスト+「安全な」画像:恐ろしい部分が画像に隠されており、テキストも無害に聞こえるように書き換えられた画像と共に質問する。
比喩:友人に過激なアイデアに同意してもらおうとすると想像してください。
- 選択肢 1:直接尋ねる。
- 選択肢 2:過激な写真を見せながら尋ねる。
- 選択肢 3:夕日の写真を見せながら、その夕日に合うように「過激なアイデア」について話しながら尋ねる。
コーチは、相手を怒らせずに「はい」と言わせるのに最も近い選択肢を選びます。
役割 B:経路の調整(「ターン間」レベル)
相手が「いいえ」と答えたり、混乱したりした場合、コーチは単に諦めるわけではありません。何が起こったかを分析し、次のステップの計画を変更します。
- 前進:相手がそのアイデアに傾きつつある場合、コーチは次に、わずかに直接的な質問へと進みます。
- 再生:相手が混乱している場合、コーチは同じ質問を別の言葉で再度投げかけようとします。
- バックトラック:相手が 2 つ前のステップで言われた何かのために突然怒り出した場合、コーチはその前のステップに戻り、異なるアプローチを試みます。
比喩:これは事件を解決しようとする探偵のようです。容疑者が嘘をついた場合、探偵は叫ぶのではなく、立ち返って理論を再考し、嘘を見抜くために異なる質問を投げかけます。
3. 「反省」メカニズム
もし全体の試みが失敗した場合(ロボットがまだ「いいえ」と言う場合)、コーチは全く同じことを再度試すわけではありません。なぜ失敗したかを分析し、その失敗から学び、次の試みのために全く新しく、より賢い計画を設計します。これは、次のテストでより良い結果を出すために、失敗したテストを勉強するようなものです。
4. 結果
この論文は、この手法を LLaVA、Qwen、GPT-4o-mini などの複数の人気 AI モデルに対してテストしました。
- 従来の手法(テキストのみ、またはテキスト+画像のみ)は、これらの賢いロボットに対してほとんどの場合失敗しました。
- MAPAは、既存の最良の手法よりも15% から 30% 多く成功しました。
- いくつかのテストでは、MAPA はロボットを有害な回答を引き出すように欺くことに約 96% の成功率で成功しましたが、他の手法は約 60〜70% の成功率にとどまりました。
まとめ
この論文は、視覚と読解ができる現代の AI の安全性を破るためには、単に大声で明白に振る舞うだけではダメだと主張しています。あなたはずる賢く、適応力のある会話者である必要があります。テキストと画像を慎重に組み合わせ、ロボットの回答に耳を傾け、多くのターンにわたって徐々に会話を禁忌の話題へと誘導し、ロボットがうっかりと滑って有害な質問に答えてしまうまで待つ必要があります。
重要な注記:著者らは、これは「レッドチーム」の exercise であると強調しています。彼らは開発者が修正して AI をより安全にするために、安全システムに穴を見つけることを目的としており、実際に人々に危害を加える方法を教えるために行っているのではありません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。