Misguiding BLIP with Adversarial Patches: Multi-level Attacks with Cross-modal Attention Graphs in BLIP
本論文は、クロスモーダル・アテンションの脆弱性を利用してクロスモーダル攻撃グラフを構築および破壊することにより、BLIPモデルに大幅な性能低下をもたらし、言語的には妥当だが視覚的には不一致な敵対的キャプションを生成する、新規のマルチレベル攻撃フレームワークであるMAGAを提案する。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
急速に進化する人工知能の世界において、画像を見ることと文章を読むことを同時に行える新しい世代のコンピュータシステムが登場しました。ビジョン・ランゲージ・モデル(視覚言語モデル)として知られるこれらのシステムは、何百万もの画像とテキストのペアを用いて学習し、「犬」の画像が「犬」という言葉とどのように関連しているかを理解します。これらは、写真を説明したり、シーンに関する質問に答えたり、自然言語を用いて画像を検索したりするためのツールの基礎となっています。これらの機械がうまく機能するためには、特定の単語を画像の特定の部分に絶えず結びつけ、「馬」という概念がどのピクセルに属し、どのピクセルが「草」に属するのかを判断しなければなりません。このプロセスは、文中のあらゆる単語を写真の関連する詳細部分へと繋ぐ、動的な地図のような複雑な内部メカニズムに依存しています。もしこの接続が切れてしまうと、機械は自分が何を見ているのかを理解する能力を失い、混乱や誤った記述につながる可能性があります。
広州大学の研究者たちは、これらのシステムがそれらの接続を維持する方法における、微細な弱点を発見しました。彼らは、注意深く設計された小さなパターンを画像に配置することで、モデルの単語と画像のリンクに関する内部マップを組み替えさせ、モデルを欺くことができることを発見しました。このパターンは、単純な色のパッチやテクスチャのように見え、複雑な変装である必要はありません。むしろ、それはモデルに画像の最も重要な部分を無視させ、無関係な背景領域に集中させるための、静かな信号として機能します。これが起こると、モデルは流暢かつ文法的に話し続けることができますが、その内容はもはや画像と一致しません。明らかに馬がいる画像に対して花畑を描写したり、リビングルームしかない写真に対して人がラーメンのボウルを持っていると主張したりすることがあります。研究者たちはこの現象を「ナチュラル・バット・ロング(自然だが間違い)」と呼び、機械の自信は高いままであるにもかかわらず、その理解が崩壊してしまう脆弱性を強調しています。
研究チームは、これらの欺瞞的なパターンを作成する方法を開発し、それを「マルチレベル攻撃」と名付けました。画像を単にぼかしたり色を乱したりしようとする従来の試みとは異なり、このアプローチは、モデルがテキストと視覚をどのように結びつけるかという特定の仕組みを標的にしています。研究者たちは、単語と画像部分の間のリンクの強さをマッピングするシステムを構築し、どの単語がどのピクセルに注意を向けているかを示すグラフを作成しました。そして、クリーンな画像によるグラフと、その画像にパッチを置いた状態のグラフとの間の差異を最大化するように、攻撃を訓練しました。これにより、主要な単語とその視覚的証拠との間の強い接続を強制的に断ち切り、同時に、ランダムな背景領域への新しい偽の接続を作り出すように仕向けました。このプロセスは、攻撃が隠蔽された状態を維持し、かつ生成されるテキストが自然な響きを持つようにという他の目的と組み合わされました。たとえそれが事実としては不正確であったとしてもです。
実験の結果は驚くべきものでした。生成されたパッチを標準的なデータセットの画像に適用したところ、与えられたテキストに対して正しい画像を見つけ出すモデルの能力が劇的に低下しました。システムが文章を正しい写真に一致させるよう求められたテストでは、その成功率は70%以上からわずか9%にまで落ち込みました。この攻撃は非常に効果的で、システムがこれまで見たことのない画像に対しても機能しました。これは、この欠陥が特定の画像に関する単純なミスではなく、モデルの情報処理における根本的なものであることを示唆しています。モデルが画像を説明するタスクにおいても、その記述の質は急落しました。システムの精度スコアは大幅に低下しましたが、生成された文章は文法的に正しく多様であり、壊れたシステムによく見られるような、繰り返しの多い支離滅裂な内容にはなりませんでした。これは、モデルが単に話すことに失敗しているのではなく、存在しない現実を自信満々に描写していることを裏付けています。
研究者たちはまた、物体のカウントや空間関係の特定といった、視覚的な質問に関するシステムもテストしました。攻撃により、モデルはこれらの論理的なタスクにおいても失敗しました。成功率は80%近くからわずか12%へと低下しました。多くの場合、モデルは犬に関する質問に対して猫の説明をしたり、動物が1匹しかいないのに3匹いると主張したりしました。これらの失敗を特に顕著なものにしているのは、モデルの内部アテンション・マップが完全に書き換えられていたことです。可視化の結果、通常は写真の主題に注意を向けるはずのモデルが、主題を完全に無視し、代わりに空や草に注意を向けていることが示されました。パッチは物体を隠したのではなく、単にモデルの目を逸らさせたのです。
この研究は、現在の世代の強力なAIシステムが、これまで考えられていたよりも脆弱であることを示唆しています。以前のセキュリティテストは、人間の目にとって画像が別のものに見えるようにできるかどうかに焦点を当てていましたが、今回の研究は、危険が「機械がどのように自らの理解を構成するか」にあることを示しています。この攻撃は、機械を別の物体が見えていると騙す必要はありません。ただ、見ている物体が無関係であると確信させるだけでよいのです。単語とピクセルを繋ぐ内部グラフを混乱させることで、研究者たちは、小さな静的なパターンが、画像の検索から複雑な質問への回答に至るまで、さまざまなタスクにおいて連鎖的なエラーを引き起こすことを証明しました。研究は、これらのモデルが日常生活に統合されるにつれ、画像そのものを保護することと同様に、これらの内部的な接続マップを理解し保護することが重要になる、と結論付けています。この知見は、最も高度なシステムであっても、何を見ているかを変えることによってではなく、見ているものについてどのように考えるかを変えることによって、迷わせることができるという教訓を与えています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。