← 最新の論文
💻 computer science

Unifying Adversarially Robust Model Experts in Vision-Language Models

本論文では、多様な評価設定において優れた相補的な敵対的堅牢性を備えた単一の視覚言語モデルを構築するために、埋め込み空間の調和を通じて複数の特化した堅牢なモデルエキスパートを統合する、協調的敵対的微調整フレームワークであるCAREを提案する。

原著者: Nguyen Duc Thai, Junhao Dong, Sua Qi Rong, Hua Yu, Yew-Soon Ong

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Nguyen Duc Thai, Junhao Dong, Sua Qi Rong, Hua Yu, Yew-Soon Ong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたの目の前には、写真を見てそれが何かを即座に言い当てたり、その写真について詩を書いたりすることさえできる、超スマートなロボットの友達がいます。この「ビジョン・ランゲージ・モデル(VLM)」と呼ばれるロボットは、画像と単語の両方を同時に理解できるという点で非常に優れています。しかし、賢い子供には弱点があるように、このロボットにも弱点があります。それは、簡単に騙されてしまうことです。もし誰かが写真に、目に見えないほど微細な「ノイズ」を加えたら——例えば、ほんのわずかな隙間でピクセルをずらしただけでも——ロボットは突然、パンダをトースターだと思い込んだり、猫を車だと思い込んだりしてしまうかもしれません。これは「敵対的攻撃(adversarial attack)」と呼ばれ、ロボットを現実世界で安全かつ信頼できるものにする上で大きな問題となっています。

これを解決するために、科学者たちはロボットに「トリッキーな写真」を使って練習させています。このプロセスは「敵対的学習(adversarial training)」と呼ばれます。これは、まるで空手の生徒がパンチをブロックすることを学ぶために、パートナーとスパーリングをしているようなものです。これから読む論文は、ある魅力的な発見について探求しています。それは、ロボットにブロックの教え方には一つではないということです。ある先生は、特定の動きを暗記すること(特定の単語を認識することを学ぶ)に焦点を当て、別の先生は、どんな状況でもバランスを保つこと(画像の特長を一定に保つこと)に焦点を当てます。問題は、動きの暗記が得意な生徒は戦い方が変わると転んでしまうかもしれず、バランスを取るのが得意な生徒は、特定の動きの名前を忘れてしまうかもしれないということです。この論文は、シンプルですが強力な問いを投げかけます。「もし、両方の良いところを同時に手に入れることができたらどうだろうか?」


二人の専門家と魔法の接着剤の物語

AIの安全性という世界では、研究者たちはビジョン・ランゲージ・モデルを攻撃に対してよりタフにするために、「専門家」を訓練してきました。しかし、ここには落とし穴があります。これらの専門家は、少し特殊なアスリートのようなものです。一方のタイプの専門家、仮に**「ワード・ウィズ(言葉の達人)」**と呼びましょう、は、画像を特定のテキスト記述に一致させることに非常に長けています。もし彼らにパンダの写真を見せて「これはパンダですか?」と尋せれば、彼らは非常に堅実です。しかし、見たことがない新しい動物の写真を見せると、彼らは暗記したテキストに頼りすぎているため、つまずいてしまうことがあります。

もう一方のタイプの専門家、**「ステディ・ハンズ(安定した手)」**は、誰かが内容をかき乱そうとしても、画像自体が同じように見えるようにすることに注力します。彼らは、特定の言葉をあまり気にせず、「猫のような形」とはどういうものかを理解しているため、未知の動物に対しても優れた対応力を発揮します。しかし、彼らは馴染みのある動物に対して、テキストの手がかりを使って正解を導き出す鋭さには欠けています。

長い間、科学者たちは一方の専門家を訓練し、次に別の専門家を訓練し、最後にそれらを無理やり結合させることでこの問題を解決しようとしてきました。しかし、それは濡れた状態の異なる種類の粘土をくっつけようとするようなものでした。粘土は引き離されてしまうか、あるいは最終的な結果は、何に対しても優れたものにならない、ひどい塊になってしまいました。

CARE:コラボレーティブ・コーチの登場

この論文の著者であるNguyen Duc Thai氏とそのチームは、異なるアプローチを試みることにしました。彼らはCARE(Embedding alignmentを用いた協調的敵対的堅牢性微調整)と呼ばれるフレームワークを構築しました。CAREを、先ほどの「ワード・ウィズ」と「ステディ・ハンズ」を同じジムに入れ、隣同士で一緒にトレーニングさせる優秀なコーチだと考えてください。

魔法が起こる仕組みは以下の通りです:

  1. 共通の準備運動: 専門家たちがそれぞれの特定のドリルを開始する前に、彼らは「ユニバーサルな摂動(perturbation)」を共有します。イメージとしては、二人が同じ少し歪んだ写真を見て、どのようなトラブルが発生するかを感じ取ることです。これにより、彼らは同じスタートラインに立つことができます。
  2. 専門的なドリル: 「ワード・ウィズ」は、歪んだ画像を正しいテキストに一致させる練習をします。「ステディ・ハンズ」は、画像がその形状をあまり変えないようにする練習をします。
  3. 秘密の握手(ハーモナイゼーション): これが最も重要な部分です。トレーニング中、コーチは彼らに互いに会話することを強制します。「ワード・ウィズ」は「ステディ・ハンズ」に、「ねえ、僕がどうやってテキストと一致させているか見て!」と伝え、「ステディ・ハンズ」は「ねえ、僕がどうやって画像を安定させているか見て!」と言います。彼らはリアルタイムで知識を交換します。これにより、彼らが互いに離れすぎるのを防ぎ、双方の強みから学び合うことができるのです。
  4. 最終的な融合: 一日の終わりには、コーチは彼らの脳を一つのスーパー・エキスパートへと融合させます。この新しいモデルは単なる混合物ではありません。言葉を一致させる方法と、画像を安定させる方法の両方を理解した、統一された脳なのです。

彼らが発見したこと

チームはこの新しい手法を、ImageNetという有名なデータセットや、他の多くのトリッキーな画像セットでテストしました。その結果は非常に素晴らしいものでした。

  • スペシャリストを打ち負かす: 新しいCAREモデルは、「ワード・ウィズ」単独よりも優れており、「ステディ・ハンズ」単独よりも優れていました。実際、攻撃が強力な場合(摂動サイズが ϵ=4/255\epsilon = 4/255 のとき)、CAREは「ワード・ウィズ」(TeCoA)を約2%、「ステディ・ハンズ」(FARE)を約8%上回りました。
  • 未知への対応: CAREモデルは既知の動物に対して上手くなっただけでなく、新しい動物を推測することについても上手くなりました。「ステディ・ハンズ」は通常、未知のものに対して勝ち、「ワード・ウィズ」は既知のものに対して勝ちます。CAREはその両方において最高の結果を出すことができました。
  • 実世界のタスク: 彼らはまた、画像のキャプション作成や、画像に関する質問への回答といったタスクでもテストを行いました。画像が攻撃を受けている状態でも、CAREは他の手法よりも高い頻度で正しい答えを出し続けました。例えば、画像内の「ホットドッグ」を特定するテストでは、攻撃を受けていてもCAREは正しく「ホットドッグ」と答えましたが、他の手法は混乱することがありました。

偉大さの代償

もちろん、このチームワークには代償があります。二人の専門家を同時に訓練するには、より多くのコンピュータ・パワーが必要です。論文によると、CAREの訓練は、単一の専門家の訓練(48〜50時間)よりも約1.5倍長く(83時間)、より多くのメモリ(25〜29 GBに対し52.6 GB)を使用します。しかし、著者らは、使用したデータをすぐに削除するといった巧妙なエンジニアリングを用いれば、メモリ使用量を管理可能な範囲に抑えられると示唆しています。

結論

この論文は、一つの戦略を選んでそれに固執するという古い考え方は、あまりにも制限が多い可能性があることを示唆しています。異なるタイプのAI専門家を協力させ、互いの強みから学び合うことで、より騙されにくいモデルを構築できるのです。著者らは、これがAIの安全性に関するすべての問題に対する最終的な解決策であると主張しているわけではありませんが、この「協調的」なアプローチが非常に有望な方向であることを示しています。これは、真に堅牢であるためには、ただ強いだけでなく、他者と協力できる必要があるということを思い出させてくれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →