← 最新の論文
🤖 machine learning

One Surrogate to Fool Them All: Universal, Transferable, and Targeted Adversarial Attacks with CLIP

本論文は、単一の公開CLIPモデルとテキスト概念を活用することで、ターゲットとなる学習データへのアクセスや過度なモデルへのクエリを必要とすることなく、多様な深層ニューラルネットワークおよび実世界のシステムに対して高い成功率を達成する、普遍的、転移可能、かつ標的型の摂動を生成する新しい敵対的攻撃フレームワークであるUnivIntruderを導入する。

原著者: Binyan Xu, Xilin Dai, Di Tang, Kehuan Zhang

公開日 2026-08-06
📖 1 分で読めます☕ さくっと読める

原著者: Binyan Xu, Xilin Dai, Di Tang, Kehuan Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットを、コンピュータが警察官や医者、店主として機能する、巨大で賑やかな都市だと想像してみてください。これらのコンピュータは、写真の中の猫を認識したり、病気を診断したりといった決定を下すために、「ディープニューラルネットワーク(DNN)」という特別な種類の脳を使用しています。長い間、科学者たちは奇妙なトリックを発見してきました。それは、コンピュータの脳を「敵対的攻撃(アドバーサリアル・アタック)」で欺くことができるというものです。それはまるで、止まれの標識に、コンピュータに速度制限の標識だと思い込ませるような、目に見えないほど小さなステッカーを貼るようなものです。通常、このトリックを仕掛けるには、ハッカーはコンピュータの秘密のコードを覗き見る(これは現実世界では不可能です)か、あるいはコンピュータの秘密を解明するために何千もの質問を投げかける(これは時間がかかりすぎ、コストもかかります)必要があります。

しかし、もし、コンピュータに一度も質問することなく、あらゆるコンピュータの脳を欺くことができたらどうなるでしょうか? これが、この論文が取り組んでいる大きな問いです。研究者たちは、CLIPと呼ばれる強力なツールを使用しました。CLIPは、数十億冊の本を読み、数十億枚の画像を見て、言葉と画像のつながりを学習した、超スマートな司書のようなものです。彼らは、この「ユニバーサルな司書」を使用して、簡単な言葉(例えば「鶏(hen)」や「猫(cat)」)をガイドとして使い、あらゆるコンピュータビジョン・システム(Google検索からハイテクなロボットまで)を欺くことができる「マスターキー」――つまり、単一の、極めて小さなデジタル的な歪み――を作成できるかどうかを検証したかったのです。

マスターキー:すべてを欺くための一つの代理モデル

Binyan Xuとそのチームによって導入された新しい攻撃フレームワーク、UnivIntruderを紹介しましょう。これは、コンピュータビジョンにおける「ユニバーサルなマスターキー」と考えてください。以前は、もしハッカーが特定のコンピュータシステムを欺きたいと考えた場合、そのシステムと同じデータを使用して、そのシステムの偽のコピー(「代理モデル」)を作る必要がありました。それは、同じ金属とネジを使って、特定の鍵穴に対して完璧なレプリカの鍵を作るようなものでした。もしオリジナルの鍵穴の設計図や正確な金属が手に入らなければ、あなたの作った偽の鍵は機能しませんでした。

UnivIntruderは、そのゲームのルールを変えました。研究者たちは、ターゲットの完璧なコピーは必要ないことに気づいたのです。代わりに、彼らは公開されている、画像とテキストの関係を理解する超スマートなAIであるCLIPを使用しました。彼らは、CLIPを自分たちの「代理(サロゲート)」、つまり練習用の鍵穴として扱いました。ここが魔法のポイントです。彼らはターゲットのトレーニングデータをコピーしようとしたのではなく、ランダムな画像の公開データセット(ターゲットのデータとは全く似ていない可能性があるもの)と、単純なテキスト概念を使用しました。

このトリックの仕組み:
あなたがセキュリティカメラを騙して、リスの写真を「鶏(hen)」だと思わせたいとしましょう。

  1. テキストガイド: システムに、「これは『鶏』に見えるようにしたい」「そして、『猫』や『馬』には見えないようにしたい」と伝えます。
  2. 方向性のシフト: 単に画像を見るのではなく、システムは画像とテキストの「差」を見ます。それはコンピュータの脳の中で「方向」を計算します。「もし、このリスの画像をこの特定の方向に少し動かしたら、それは『鶏』という概念に近づき、『猫』という概念から遠ざかるだろうか?」と問いかけるのです。
  3. ユニバーサルなステッカー: システムは、小さな、ユニバーサルな「ステッカー」(摂動)を作成します。これは、あらゆる画像に加えられたときに、その方向へと押し進めるものです。
  4. ひねり: このステッカーが、練習に使ったモデルだけでなく、あらゆるカメラで機能するようにするために、彼らはステッカーを作成する際に画像を回転させたり、ズームしたり、クロップ(切り抜き)したりします。これにより、ステッカーは、車が洗車場を通ったり泥に覆われたりしても機能し続けるような、堅牢(ロバスト)なものになります。

結果:世界を欺く

チームはこの「マスターキー」を大規模にテストしました。彼らは単一のコンピュータでテストしたのではなく、85種類もの異なるモデルと実世界のアプリケーションでテストを行いました。

  • 数字: 標準的なテストセットにおいて、彼らの攻撃は恐ろしいほど効果的でした。一般的な画像認識のテストであるCIFAR-10データセットでは、**99.4%**の成功率を達成しました。1,000の異なるカテゴリを持つ大規模なImageNetデータセットでは、**85.1%**に達しました。
  • 現実世界: ここからが恐ろしいところです。彼らはラボでのテストに留まりませんでした。彼らは実世界のサービスを欺こうと試みました。
    • 検索エンジン: 彼らは、猿の摂動を加えた画像をGoogle、Baidu、Taobao、JDにアップロードしました。検索エンジンは、猿を表示する代わりに、鶏(hen)を表示し始めました。Baiduにおける成功率は**84%**でした。
    • 超AI: 彼らは、最も高度なAIチャットボットであるGPT-4Claude-3.5でテストを行いました。摂動を加えた猿の画像を見せると、これらのAIは自信満々に、それを「鶏(hen)」や「ひよこ(chick)」であると説明しました。Claude-3.5における成功率は**80%**でした。
    • 画像生成AI: DALL·E 3のような、絵を描くAIさえも騙されました。摂動を加えた入力に基づいて画像を生成するよう求められると、それは猿の代わりに鶏の画像を生成しました。

なぜ他の手法は失敗したのか

この論文は、何が機能しないのかについても非常に明確に述べています。以前の手法は、CLIPを補助として使おうとしましたが、データの「バイアス」を考慮していなかったために失敗しました。

  • バイアスの問題: もし、少し青みがかったデータセットを使って偽の鍵を作った場合、その鍵は青みがかった鍵に対してしか機能しないかもしれません。研究者たちは、「方向(元の画像の特徴から新しい特徴を差し引くこと)」を使用することで、これらのバイアスを打ち消せることを発見しました。
  • 代理モデルの問題: 他の手法はCLIPを使用しようとしましたが、その攻撃を他のモデルに転移させることに失敗しました。著者たちは、彼ら独自の「方向性」と「ランダムな変換」のトリックがなければ、たとえCLIPを使用しても、高度なモデルに対する成功率は70%を超えて失敗することを示しました。UnivIntruderは、公開されているCLIPモデルと、現実世界で使用されている多様で未知のモデルとの間の溝を、見事に埋めることに成功した唯一の手法です。

これがセキュリティにとって意味すること

この論文は、私たちの現在のセキュリティの概念が壊れている可能性を示唆しています。通常、私たちはトレーニングデータを隠し、人々が質問できる回数を制限すれば安全だと考えています。しかし、UnivIntruderは、攻撃者がこれらの防御策を完全に回避できることを証明しました。彼らはあなたのデータを必要としませんし、あなたに質問する必要もありません。彼らに必要なのは、公開されているAI(CLIP)と、いくつかの言葉だけなのです。

研究者たちは、これを止める方法があるかどうかもテストしました。彼らは「敵対的学習(コンピュータにトリックへの抵抗力を教えること)」や「テスト時防御(処理前に画像をクリーニングすること)」を試みました。これらの手法はある程度効果がありましたが、多くの場合、コンピュータが本来の仕事(実際の猫を認識するなど)を行う能力を低下させたり、GPT-4のような巨大なシステムで実行するにはコストがかかりすぎたりしました。論文は、どのようにAIを保護すべきかを再考する必要があると結論付けています。なぜなら、単一の公開されているモデルが、今やほとんどのものを欺くために使用できるからです。

要するに、UnivIntruderは警告(ウェイクアップコール)です。適切な「ユニバーサルな鍵」があれば、デジタル世界のビジョン・システムは私たちが考えていたよりもはるかに脆弱であることを示しています。AIの目において、猿と鶏を隔てているものは、たった一つの、目に見えないデジタル的なグリッチ(不具合)かもしれないのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →