ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models
ZOMPは、同時摂動確率近似を用いることで、凍結されたCLIPモデルの視覚およびテキストの両方のブランチにおけるディーププロンプトを最適化する、クエリ効率の高い完全なフォワードオンリーの手法であり、クロスモーダル低ランク再パラメータ化、勾配補正モメンタム、および動的ランクスケジュールの活用によって、複数のベンチマークにおいて既存のゼロ次近似手法を凌駕している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたは、インターネット全体を読み込み、画像と言葉の両方を理解することを学んだ、超スマートなロボットを持っています。それは、写真が何であるかを一目見ただけで即座に言い当てたり、完璧な文章でシーンを説明したりできる、天才的な司書のような存在です。このロボットは「ビジョン・ランゲージ・モデル(Vision-Language Model)」と呼ばれ、驚くほど強力です。しかし、ここには落とし穴があります。通常、このロボットに新しい技(例えば、特定の種類の珍しい花や、奇妙な医療スキャンを認識することなど)を教えるには、自分自身の「脳」を「作り直す(リワイヤリング)」必要があります。このプロセスは、大規模な図書館を一般公開したまま整理し直そうとするようなもので、非常に重労働であり、膨大な計算能力とメモリを必要とします。
しかし、時にはそれができないこともあります。例えば、そのロボットがあなたのポケットの中にある、バッテリー駆動の小さなデバイスの中に住んでいたり、あるいは、思考プロセスを見ることができないチャットウィンドウを通じてしか会話できない秘密のサービスであったりする場合です。このような場合、ロボットの脳を作り直すことはできず、ただ新しい指示を「ささやく」ことしかできません。これは「プロンプト・チューニング(prompt tuning)」と呼ばれます。ロボットの脳を作り変える代わりに、新しいパズルを解くための特別なヒントや「プロンプト」を与えます。問題は、完璧なヒントを見つけるには通常、多くの試行錯誤が必要だということです。もしロボットの内部の思考(勾配/グラディエント)が見えないのであれば、それは目隠しをした状態で干し草の山の中から針を探すようなものです。正解にたどり着くまでに、何千回もの推測が必要になり、現実の世界ではあまりにも遅く、コストがかかりすぎてしまいます。
ここで、ZOMPと呼ばれる新しい手法が登場します。ZOMPを、検索方法を変えることで「目隠しの針探し」問題を解決する、賢い探偵だと考えてみてください。すべての詳細を一気に推測しようとするのではなく、ZOMPは最も重要な部分から先に推測し、それからゆっくりと残りを埋めていくというスマートな戦略をとります。
その仕組みを、いくつかの楽しい比喩を使って説明しましょう。
「共有設計図」のトリック
通常、ロボットに新しいことを教えようとする際、「目(視覚)」と「声(テキスト)」に対して別々のヒントを書かなければなりません。もし、両方のために同時に深く複雑なヒントを書こうとすると、可能性の数が膨大になりすぎて、目隠しをした探索は迷子になってしまいます。ZOMPはゲームのルールを変えます。「共有設計図を使おう」と言うのです。イメージとしては、目と声のためのヒントが、どちらも同じ小さなレゴブロックのセットから作られていると考えてください。あなたは、そのわずかなブロックをどう配置するかを考えるだけでよく、そうすれば自動的に、目と声の両方に適したヒントが構築されます。これにより、ヒントが深く複雑であっても、探索範囲を小さく、管理可能な状態に保つことができます。
「予算インデックス型」の拡張
共有設計図があっても、目隠しをした状態で全てのブロックを一度に配置しようとするのは、依然として困難です。そこでZOMPは「予算」システムを使用します。イメージしてみてください、あなたには最適なヒントを見つけるための推測(クエリ)の回数に制限があります。ZOMPは、まず、最も重要で最初の1個目のブロックを扱うことだけを自分に許可します。そして、その1つのピースに対して正しい方向を見つけ出します。その進むべき道筋が確実になったと判断したら、次のブロックを「アンロック」し、また次のブロックへと、信頼できる方向が得られるたびにゆっくりと探索を広げていきます。これは車の運転を学ぶ過程に似ています。最初は空いている駐車場(小さな探索空間)から始め、慣れてきたら近所の通りへ、そして最終的には高速道路へと、徐々に移動していきます。初日からいきなり高速道路を走ろうとはしませんよね。
「モメンタム(慣性)」の記憶
探索は目隠し状態で行われるため、得られる手がかりはしばしばノイズが多く、不安定です。まるで、荒れた海の上にあるボートに乗っているようなものです。ZOMOは「モメンタム(慣性)」の記憶を追加します。これは、単に波に反応するだけでなく、海が全体としてどの方向に押し寄せているかを記憶しているサーファーのようなものです。たとえ波に横に押し流されても、進むべき方向を覚えているので、正しい方向へと進み続けることができます。これにより、ロボットはノイズを無視し、実際に機能する経路に集中することができます。
結果
研究者たちは、この手法を、花の識別から衛星画像による車両の認識まで、13種類の異なる課題でテストしました。彼らはZOMPと他の手法に対して、全く同じ数の推測回数(5,000クエリ)を与えました。その結果、ZOMPは一貫して他の手法よりも優れたヒントを見つけ出しました。単に少し良くなっただけではありません。ロボットが通常苦戦するような難しいタスクにおいて、しばしば大幅に高い精度を叩き出しました。
本当に素晴らしいのは、ZOMPが訓練された特定のタスクに対して良くなっただけではないという点です。ZOMPは、見たこともない新しい奇妙な状況(例えば、物体の写真ではなくスケッチの認識など)に対しても、より上手く対処できるようになりました。これは、ZOMPが注意深く効率的に探索することで、ロボットの既存の知識を単に暗記するのではなく、より賢い方法で活用することを学んだことを示唆しています。
要約すると、ZOMPは、ロボットをより賢くするために脳を作り直す必要はないということを証明しています。共有設計図を使い、探索をゆっくりと広げ、一定の方向性を保つ記憶を持つことで、たとえ「ささやき」しか許されず、試行回数に制限があったとしても、強力なAIに新しい技を教えることができるのです。これは、ポケットの中のスーパーコンピュータを必要とせずに、これらの巨大なモデルから最大限の成果を引き出すための、実用的で効率的な方法なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。