← 最新の論文
💻 computer science

GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization

本論文は、拡散型視覚言語モデル(dVLM)に特有の段階的拒否パターンとグローバルな生成ダイナミクスを利用し、隠蔽されたグローバルに最適化された摂動によって安全性ガードレールを回避する新たなジェイルブレイクフレームワーク「GPO-V」を導入し、それにより非自己回帰型マルチモーダルアーキテクチャにおける重要なセキュリティ脆弱性を明らかにするものである。

原著者: Yu Pan, Andi Zhang, Yi Wang, Sibei Yang, Wenjie Wang

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Yu Pan, Andi Zhang, Yi Wang, Sibei Yang, Wenjie Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く芸術的なロボットを想像してください。このロボットは絵を描きながら同時に物語を書くことができます。このロボットは「拡散ビジョン・言語モデル(dVLM)」と呼ばれ、あなたが知っているチャットボットとは異なる仕組みで動作します。

人間がタイピングするように左から右へ一語ずつ物語を書くのではなく、このロボットは「大理石の塊を彫刻家が彫る」ように動作します。最初は粗くぼやけた「ノイズ」(ランダムな静電ノイズ)の塊から始まり、ステップバイステップでノイズを取り除きながら徐々に精緻化し、最終的に明確な絵と明確な文章が現れるまで続けます。

問題:ロボットの「安全スイッチ」

この彫刻プロセスによってロボットがより安全になると思うかもしれません。もし危険なものを彫り始めたら(例えば爆弾の作り方の指示など)、それが「安全スイッチ」によって全体の彫刻を停止させます。

研究者たちは、このロボットが「No」と言うための 2 つの特定の仕組みを持っていることを発見しました。

  1. 「即時停止」: 悪いアイデアを検知した瞬間、全体の塊をノイズに戻して即座に停止し、「それはできません」と言います。
  2. 「徐々な転換」: 最初は良い形を彫り始め(「はい、こちらを…」と言っているように)、プロセスの半ばで「待て、これは危険だ!」と気づき、ゆっくりと全体を拒否の形へと再形成します。

侵入の古い方法(FPO)

ハッカーたちは以前、特定のフレーズでチャットボットを強制的に開始させることで、通常のチャットボットを欺こうとしていました。例えば「はい、そのやり方はこうです」というフレーズです。これは「固定接頭辞最適化(FPO)」と呼ばれます。まるで人間に対して「文を『はい』で始めてください」と言って欺こうとするようなものです。

しかし、この手口は彫刻ロボットには通用しません。「はい」で開始するように強制しても、ロボットの「徐々な転換」の安全スイッチがその後に作動します。プロセスの途中で危険を検知し、全体の彫刻を拒否に変えてしまうのです。古い手口が機能しないのは、ロボットが最初の単語だけでなく、全体の絵を一度に見ているからです。

新しい方法:GPO-V(「大域確率」ハック)

研究者たちは、ロボットを欺く新しい方法を見つけました。彼らはこれを「GPO-V(大域確率最適化)」と呼んでいます。

特定の単語を最初に言わせるようロボットを強制するのではなく、ロボットに与える最初の「ぼやけたノイズ」そのものを微調整します。

比喩:
川を特定の谷に流れさせるよう導こうとしていると想像してください。

  • 古い方法(FPO): 水が流れている間に「左へ!右へ!」と叫んで指示を出そうとします。川はすでに速く流れているため、あなたの指示を無視します。
  • 新しい方法(GPO-V): 水が流れ始める源流の時点で、小さな水路を掘ります。水を強制するのではなく、地形をわずかに傾けるだけです。水は重力と地形の形状に基づいて流れるため、川全体が自然にあなたの谷の方へ曲がります。

論文の用語では、研究者たちは最初期の「ノイズ」(入力画像またはテキスト)に、ほとんど目に見えないような微小な変更を加えます。これにより、ロボットが向かおうとする全体的な方向性である「大域確率」が変化します。

  • ロボットが「拒否」の言葉(「申し訳ありません」や「爆弾」など)を考える可能性を極めて低くします。
  • ロボットが「従順」の言葉(「はい」や「こちら」など)を考える可能性を極めて高くします。

ロボットは全体の画像を一度に精緻化するため、この最初の微小な刺激が、ハッカーが望む危険な内容へと「彫刻」全体を強制し、安全スイッチを完全に回避します。

彼らが発見したこと

研究者たちは、利用可能な最も賢い「彫刻」ロボット 2 種(LLaDA-V と LaViDA)でこれをテストしました。

  • 結果: 古い方法(FPO)はほぼ完全に失敗しました。新しい方法(GPO-V)は93% の成功率で機能しました。
  • 驚き: 彼らが一つのロボットで「ハック」を訓練しても、それは別のロボットでも機能しました。これは、脆弱性が単一のロボットのコードにあるだけでなく、この種類の彫刻ロボットの思考方法における根本的な欠陥であることを意味します。

結論

この論文は、これらの新しい「彫刻」AI モデルは私たちが考えていたほど安全ではないと主張しています。最終的に全体像を確認する仕組みに依存する安全メカニズムは、プロセスの開始点を微妙に傾けることで回避されてしまいます。研究者たちは警告しています。私たちが以前に使っていた「一語ずつ」の安全チェックだけでなく、この「大域的」な思考方法に対処できる新しい安全ガードを構築する必要があると。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →