✨ 要約🔬 技術概要
何千ものゲスト(画像のピクセル)を招いた大規模なパーティーを整理しようとしていると想像してください。
旧来の方法:「全員が全員と話す」パーティー
ビジョン・トランスフォーマー(ViT)と呼ばれる従来の AI モデルは、部屋を理解するためにゲスト全員が互いに自己紹介しなければならない ような混沌としたパーティーのように機能します。
問題点: ゲストが 100 人いれば、握手は 10,000 回必要です。ゲストが 1,000 人(高解像度の写真)いれば、握手は 100 万回必要になります。これを整理するのにかかる時間は爆発的に(二次関数的に)増加します。あまりにも遅く、高価であるため、これらのモデルは高解像度の画像を処理するのに苦労します。
前提: 従来のモデルは、コンピュータが物体を「見る」ためには、すべてのピクセルが他のすべてのピクセルと直接会話する必要があると仮定していました。
新しい方法:VECA(「VIP コア」パーティー)
この論文の著者であるアラン・ソン氏と共著者たちは、「ちょっと待てよ。本当に全員が全員と話す必要があるのか?」と言います。彼らはVECA (Visual Elastic Core Attention:視覚的弾性コア・アテンション)と呼ばれる新しいシステムを提案します。
VECA を、VIP コアグループ と一般ゲストリスト を持つパーティーだと考えてみてください。
VIP コア: 何千ものゲストが互いに話す代わりに、モデルは少数の固定された「VIP」グループ(コア・トークン と呼ばれる)を作成します。VIP が 64 人だけだとしましょう。
コミュニケーションのルール:
ゲスト (画像のパッチ)は、VIP とだけ話します。ゲスト同士は直接話しません。
VIP は、全員 (すべてのゲストと他の VIP)と話します。
結果: 情報はゲスト → VIP → ゲストという流れで伝わります。ゲスト同士が互いに握手する必要はありません。
効率性の向上:
旧来の方法では、ゲストの数を倍にすると作業量が 4 倍になりました。
VECA では、ゲストの数を倍にしても作業量は 2 倍になるだけです(線形成長)。これは、すべての従業員に他のすべての従業員を管理させるのではなく、少数の効率的なマネージャーチーム(VIP)が混沌を処理するようなものです。
「弾性」のスーパーパワー
VECA の最も素晴らしい点は、それが弾力的 (伸び縮みする)であることです。
トレーニング: トレーニング中、モデルは自らの VIP をランク付けすることを学びます。一部の VIP は「スーパー VIP」であり、最も重要なこと(「ここに犬がいる」など)を知っており、他の VIP は「ジュニア VIP」であり、より細かい詳細(「その犬は垂れ耳だ」など)を知っています。
推論(パーティーの実践):
速度が必要ですか? モデルに「上位 8 人の VIP のみを使用せよ」と指示できます。モデルはジュニアスタッフを無視するため、即座に高速に実行されます。詳細度はわずかに低下するかもしれませんが、非常に迅速です。
高品質が必要ですか? 「64 人すべての VIP を使用せよ」と指示できます。モデルは少し遅くなりますが、超詳細で高精度な回答を提供します。
再トレーニング不要: 速度や品質のために新しいモデルを構築する必要はありません。VIP の数をその場で伸縮させるだけです。
彼らは何を見つけましたか?
著者たちは、写真内のものを認識する(分類)や物体の輪郭を描く(セグメンテーション)など、さまざまなタスクでこれをテストしました。
性能: ピクセルが直接話すという「ショートカット」を採用したにもかかわらず、VECA は現在利用可能な最高で最も高価なモデル(DINOv3 など)とほぼ同等の性能を発揮しました。
「魔法」の発見: 彼らは、VIP(コア・トークン)が自然に物体検出器 のように振る舞うことを学び取っていることに気づきました。明示的に指示されなくても、VIP は「ボウルの中の卵」や「車の車輪」などの特定のものを表すためにグループ化し始めました。それらは、曖昧な情報の塊から、具体的な意味を持つグループへと進化しました。
解像度: 旧来のモデルとは異なり、このモデルは小さな画像でも優れて機能し、クラッシュしたり遅くなりすぎたりすることなく、巨大な高解像度の画像までスケールアップします。
結論
この論文は、賢いビジョン AI を構築するために、高価で二次関数的な「全員が全員と話す」方法が必要ではないと主張しています。コミュニケーションを仲介する少数の賢い「コア」トークン・チームを使用することで、以下のモデルを構築できます。
より速く、より安価 (特に高解像度の画像の場合)。
柔軟 (その場で速度と精度をトレードオフ可能)。
現在の最先端の巨人たちと同等に賢い 。
これは、高解像度の AI を実用的かつ効率的にする、コンピュータ・ビジョンの未来のための新しい構築ブロックです。
技術的概要:スケーラブルなビジョントランスフォーマーのための弾性アテンションコア
問題定義
ビジョントランスフォーマー(ViT)は、グローバルな受容野と柔軟な表現学習を可能にするオールツーオール自己アテンションを活用することで、強力なデータ駆動型のスケーリングを達成しています。しかし、この柔軟性は、画像解像度に対して二次関数的(O ( N 2 ) O(N^2) O ( N 2 ) )に増大する計算コストを伴い、ここで N N N は画像パッチの数を表します。この二次関数的なスケーリングは、高解像度の領域において許容しがたいものとなり、標準的な ViT の適用可能性を制限しています。
ViT 設計における支配的な仮定は、豊かな視覚意味表現を学習するためには、密なペアワイズなトークン相互作用が必要であるというものです。本論文はこの仮定に挑戦し、直接パッチ間相互作用なしでも効果的な視覚表現を学習できることを主張します。
手法:VECA(Visual Elastic Core Attention)
著者らは、標準的な密な自己アテンションをブロックスパースなコア・ペリファリーアテンション メカニズムに置き換えるビジョントランスフォーマーアーキテクチャVECA を提案します。
コアアーキテクチャ
コア・ペリファリー構造: このアーキテクチャは、通信インターフェースとして機能する学習された C C C 個の「コア」トークンの小さなセットを導入します。画像パッチは「ペリファリー」を形成します。
相互作用メカニズム:
コアトークン: 完全に接続されたクライクを形成し、他のすべてのコアトークンとすべてのパッチトークンにアテンションを向けます。
パッチトークン: 活動中のコアトークンのみに対してアテンションを向けます。他のパッチトークンには直接アテンションを向けません。
情報フロー: パッチ間のすべての情報交換は、コアトークンを介してのみルーティングされます。
計算複雑性: アテンションコストは O ( N 2 ) O(N^2) O ( N 2 ) から O ( 2 N C + C 2 ) O(2NC + C^2) O ( 2 N C + C 2 ) に削減されます。事前決定されたコア数 C C C (C ≪ N C \ll N C ≪ N )の場合、複雑性は画像解像度に対して線形(O ( N ) O(N) O ( N ) )にスケーリングします。
空間的ダイナミクス: コアトークンは学習可能な 2 次元座標で初期化され、軽量な座標ヘッドを介して層を超えて更新されます。これらは 2 次元軸方向のロータリー位置符号化(RoPE)を利用し、意味表現と進化する空間的位置の両方を維持します。
弾性トレーニングと推論
ネストドドロップアウト: トレーニング中、モデルは順序付けられたコアトークンのバンクに対してネストドドロップアウトを適用します。モデルは、分布からサンプリングされた可変のコアアクティブ予算(C C C )でトレーニングされます。
暗黙的なランキング: この手順により、コアトークンは重要性に応じて暗黙的にランキングされます。初期のコアはすべての予算でアクティブとなり、最も本質的で広範に有用な視覚情報をエンコードすることを学習します。後続のコアは、より微細な空間的詳細や特定の意味概念に特化します。
推論の柔軟性: テスト時には、再トレーニングなしでアクティブなコアの数を調整できます。これにより、計算コスト(速度)と精度の間の弾力的なトレードオフが可能になります。C C C を削減すると、アテンションマップは粗くなりますが、FLOPs は大幅に削減されます。
トレーニング目的
モデルは、凍結されたDINOv3 教師からの特徴蒸留を用いてトレーニングされます。損失関数は、ラベルなしの Objects365 画像を用いて、最初のコアトークンからのグローバル画像表現と密なパッチ表現の両方を教師のターゲットに整合させます。
主要な貢献
VECA アーキテクチャ: 各層で二次関数的な自己アテンションを線形時間のコア・ペリファリーアテンションに置き換える視覚バックボーンであり、トークン相互作用を解像度不変のボトルネックを通じて強制します。
性能対コスト: 分類および密な空間タスクにおける評価により、VECA が最先端の基盤モデル(特に DINOv3)と競争力のある性能を達成しつつ、計算コストを大幅に削減することが示されました。
分類: ViT-Base サイズにおいて、VECA は ImageNet-1k で 81.93% の Top-1 精度を達成し、DINOv3(83.56%)から約 1.6% 以内の性能を示しました。これは、アテンション相互作用のほんの一部しか使用していないにもかかわらずです。
密な予測: PASCAL Context セグメンテーションベンチマークにおいて、VECA は 57.46 mIoU を達成し、DINOv3 の 57.74 mIoU と比較して、層あたりのアテンション相互作用が 87.1% 少ないにもかかわらず、高い性能を維持しました。
創発的行動: 著者らは、コアトークンが物体中心の表現を発達させ、明示的な監督なしで、初期層では等方的(球状)な分布から、より深い層では意味的にクラスター化された構造へと進化することを特定しました。
結果
スケーラビリティ: VECA は、入力解像度(256px から 1024px)が変化しても安定した性能を維持しますが、標準的な ViT は二次関数的な FLOP 増加に苦しみます。VECA は解像度の増加に伴い、FLOPs とレイテンシにおいて線形スケーリングを示します。
弾性: モデルは精度と速度の間の弾力的なトレードオフが可能です。例えば、コア予算を C = 64 C=64 C = 64 から C = 8 C=8 C = 8 に削減しても、分類におけるフルモデル性能の 96% 超を維持しつつ、計算量を劇的に削減できます。
密な特徴: 可視化(UMAP)は、VECA が DINOv3 と同等の、高解像度でも堅牢な安定した高品質な密な特徴を生成することを確認しています。
意義と主張
本論文は、高品質な密な視覚表現を学習するために直接パッチ間自己アテンションが厳密に必要ではない と主張します。学習されたコアトークンのコンパクトなセットを介して情報をルーティングすることで、VECA は弾性コア・ペリファリーアテンション を、ビジョントランスフォーマーのスケーラブルな代替構成要素として確立します。
この研究は、オールツーオールアテンションの柔軟性が、空間的整合性と密な特徴の品質を維持する構造化された線形時間インターフェースに置き換えられ得ることを示唆しています。これは、計算効率が重要な高解像度領域におけるビジョントランスフォーマーの展開にとって有望な道筋を提供し、利用可能なリソースやタスク要件に応じて推論コストを動的に調整できるモデルを可能にします。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×