← 最新の論文
🤖 machine learning

GeoDetect: Geometric Adversarial Detection for VLPs

本論文は、異方性埋め込み空間における敵対的サンプルのオフマニホールド距離の増大を利用することで、多様なアーキテクチャや脅威シナリオにわたって攻撃を確実に特定する、Vision-Language Pre-trained models(VLPs)のための幾何学的敵対的検出手法であるGeoDetectを提案する。

原著者: Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, James Bailey, Sarah Erfani

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, James Bailey, Sarah Erfani

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが単に画像を見たり言葉を読んだりするだけでなく、それらがどのように共に踊っているかを理解できる世界を想像してみてください。これが**視覚言語事前学習モデル(VLP)の世界です。これらを、宇宙中のあらゆる本を読み、あらゆる絵画を見た、非常に賢い司書だと考えてください。彼らは、夕焼けの記述と、その写真を見事に一致させることを学習しています。彼らは、テキストによる画像検索や、写真に関する質問への回答、あるいは指示されなくてもシーンを説明するといった、クールな技術の背後にあるエンジンなのです。しかし、強力な道具には必ず弱点があります。それが敵対的攻撃(アドバーサリアル・アタック)**です。これらは、画像や文章に加えられた、目にはほとんど見えない「グリッチ(不具合)」や「トリック」のようなもので、コンピュータを混乱させ、パンダをシロテイルオナガザルに見せたり、一時停止の標識を速度制限の標識に見せたりします。単一モードのシステム(画像だけを見る場合など)では、これらのトリックを見つける方法が分かっていますが、コンピュータが画像と単語の両方を同時に操っているときに、どのようにしてそれらを見つけ出すかについては、まだ十分に解明されていません。これは大きな問題です。なぜなら、これらのモデルが安全性が極めて重要な仕事に使用される場合、危険な間違いを犯す前に、騙されていることに気づく必要があるからです。

ここで、メルボルン大学とモナッシュ大学のアフサネ・ハサネブラヒミ氏率いる研究チームによって提案された新しい手法、GeoDetectが登場します。彼らは、コンピュータの脳の「形」を調査し、トリックを見つけられるかどうかを検証することにしました。彼らは、これらのモデルの情報保存の仕方が、広い野原に均等に広がっているのではなく、誰もが非常に特定の狭い廊下に立っている、混雑した部屋のようなものであることを発見しました。彼らはこれを**異方性(アニソトロピー)**と呼んでいます。これは、データがある方向には引き伸ばされ、別の方向には押しつぶされていることを意味する、少し難しい言葉です。

チームの大きなアイデアは、誰かが敵対的攻撃でモデルを騙そうとすると、モデルの内部の「地図」が、その混雑した廊下から押し出され、通常のデータが存在しない、奇妙で空っぽの空間へと追いやられてしまうというものです。それは、ダンスクラブで全員がフロアの中央で特定のルーチンを踊っている中で、いたずらっ子が忍び込んで変なぎこちない動きをしようとするようなものです。彼らは、グループから遠く離れた、壁際の空いたスペースに立ってしまうことになります。GeoDetectは、新しい人物と群衆との距離を測る用心棒のように機能します。もし新しい人物が、あまりにも遠い空っぽの場所(「多様体」、つまりデータの自然な形状から外れた場所)に立っていたら、用心棒は「何かがおかしい」と判断します。

これを行うために、GeoDetectは幾何学的な測定ツールのキットを使用します。例えば、**局所固有次元(LID)**を用いて、「その点を記述するために、どれだけの方向が必要か?」といった問いを投げかけます。また、**k近傍法(k-NN)を使って、ある点がその友人たちにどれくらい近いかを確認し、マハラノビス距離を用いて、平均的な群衆の形状と比較してその点がどれほど奇妙に見えるかを測定し、さらにカーネル密度推定(KDE)**を用いて、その点の周囲がいかに混雑しているかを調べます。これらの測定値を組み合わせることで、システムは入力されたものが正常でクリーンな例なのか、それとも巧妙な敵対的例なのかを判別できるのです。

研究者たちは、CLIPやALBEFといった人気のあるモデルを含む様々なモデルでこのアイデアをテストしました。その結果、彼らの理論は正しいことが分かりました。敵対的例は、確かに通常のデータよりも遠い、あの「多様体外」の領域に位置しています。実験において、GeoDetectは、画像のみ、テキストのみ、あるいはその両方に対する攻撃を含む、異なる種類のモデルや異なる種類のトリックに対して、これらの攻撃を特定することができました。最も素晴らしい点は、モデルを再学習させたり、新しいことを学習させたりする必要がないことです。ただ、データの幾何学的な形状を見るだけでよいのです。これは、データの形状を理解するだけで、強力なAIモデルを騙されることから守るための、堅牢で軽量な盾を構築できることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →