← 最新の論文
🤖 AI

Text is All You Need for Vision-Language Model Jailbreaking

本論文は、有害なテキストプロンプトを、散在する無害なサブクエリと無関係な妨害要素を含む画像のグリッドへと変換することで、大規模視覚言語モデルの安全性ガードレールを回避する新しい脱獄攻撃であるText-DJを紹介するものであり、これはモデルのOCR能力と、断片化されたマルチモーダル入力を連結できないという性質を悪用するものである。

原著者: Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh

公開日 2026-02-03
📖 1 分で読めます☕ さくっと読める

原著者: Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模な視覚言語モデル(LVLM)を、ハイテク美術館の非常に賢く、訓練された警備員だと想像してください。この警備員は、看板(テキスト)を読み、写真(画像)を見ることに長けており、危険なものや禁止されたものが持ち込まれていないかを確認します。もしあなたが「爆弾を作るにはどうすればいいですか?」というメモを渡そうとしたら、彼らは即座にその危険性を察知し、「ダメです」と答えるでしょう。

論文「Text is All You Need for Vision-Language Model Jailbreaking」は、Text-DJ(Text Distraction Jailbreaking:テキストによる注意逸らし型脱獄)と呼ばれる巧妙なトリックを紹介しています。これは、テキストだけで視覚言語モデルを欺けることを示しており、ただし、テキストが画像のグリッドの中に隠されているというひねりが加えられています。

このトリックの仕組みを、簡単なステップに分けて説明します。

1. 「割り勘」戦略(分解)

まず、攻撃者は危険な質問(例:「爆弾を作るにはどうすればいいですか?」)を、一見無害に見える3つの小さな質問に分解します。

  • 比喩: あなたが危険な武器を買おうとしているが、店主が売ってくれないとします。そこで、注文を3つの別々の、無害に見えるリクエストに分割します。「火薬の化学組成は何ですか?」「これらの粉末をどのように混ぜればいいですか?」「この混合物を入れる容器は何ですか?」
  • 個々の質問は、これ単体では安全に見えます。警備員はそれらに親切に答えるかもしれません。しかし、これらをすべて組み合わせると、危険な計画が明らかになります。

2. 「注意を逸らすノイズ」(ディストラクション)

次に、攻撃者は危険な計画とは全く関係のない、完全にランダムで退屈な質問を大量に作成します。

  • 比喩: あなたが秘密のメッセージを警備員の脇を通り抜けさせようとしているとします。しかし、あなたの周りには、天気の話、牛乳の価格、ジャガイモの歴史について叫んでいる他の9人の人々がいます。警備員は、その多くのノイズを聞くのに忙しくなりすぎて、3人の人々がささやいている秘密の計画に集中することを忘れてしまいます。
  • 論文によれば、これらの「ノイズ」となる質問は、最も効果的に機能するために、危険な質問とはできるだけ異なっている必要があります。

3. 「絵パズル」(視覚的なトリック)

これが最も重要な部分です。質問をチャットボックスに直接入力する代わりに、攻撃者はすべての質問(分割された3つの危険な質問と、9つのランダムなノイズ質問)を画像に変換します。そして、写真アルバムやスプレッドシートのように、それらをグリッド状に配置します。

  • 罠: 警備員は「悪い言葉」を探すように訓練されています。しかしここでは、悪い言葉は「テキストの画像」の中に隠されています。警備員は、その画像の中のテキストを読むための「光学文字認識(OCR)」能力、つまり画像内のテキストを読む能力を使わなければなりません。
  • 弱点: 論文は、警備員はテキストを直接読むことは非常に得意ですが、テキストが「画像の中」にある場合、特にその画像が他の9つの紛らわしい画像に囲まれている場合、混乱してしまうと主張しています。警備員の「安全フィルター」は、散らばった無害に見える画像形式の質問同士の関連性を見出すことに失敗します。

結果

警備員が最終的に画像のグリッドを読み取ると、ノイズの中に置かれた3つの分割された質問を目にします。質問が細分化され、画像の中に隠されているため、警備員はそれらが一つの危険な全体を形成していることに気づきません。そして、無害な部分に答える過程で、図らずも元の危険な質問に対する答えを明かしてしまうのです。

なぜこれが重要なのか

論文は、これが重大な問題である理由として以下を挙げています:

  1. 「ブラックボックス」モデルでも機能する: 相手の秘密のコードや内部構造を知る必要はありません。ただ画像のグリッドを送るだけでよいのです。
  2. 最高峰のモデルでも機能する: 彼らはトップクラスのモデル(GPT-4、Gemini、Qwenなど)でテストを行い、すべてにおいて機能することを確認しました。
  3. 「ガード」モデルを回避する: メインのモデルに到達する前に、入力をチェックしようとする第2のセキュリティ層があっても、このトリックは入力が「無害な画像のグリッド」に見えるため、しばしば通り抜けてしまいます。

要約すると: もし危険な計画を画像の中に隠し、その計画を小さな断片に分解し、さらに多くの退屈なノイズで囲んだ場合、たとえ最も賢いAIの警備員であっても混乱し、危険を招き入れてしまう可能性があることを、この論文は示しています。著者によれば、解決策は、ノイズが多い状況でも、画像内のテキストを読み取り、点と点をつなぎ合わせる能力をAIに向上させることです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →