あなたは、超スマートなロボットに世界を理解させる方法を教えようとしているところだと想像してください。単に本を読ませるのではなく、映画を見せながら同時にサウンドトラックを流すのです。これが「オムニモーダル(Omni-modal)」AIの刺激的な世界です。そこでは、コンピュータは視覚、聴覚、そして読解を同時に学習します。しかし、ここに落とし穴があります。映画やサウンドトラックは膨大な量です。わずか1秒のビデオやオーディオでも、数千もの「トークン」と呼ばれる小さなデジタルの「レンガ」に分解されます。もし映画全体をロボットに食べさせようとすれば、ロボットは、まるで1分間で図書館全体の蔵書を読もうとする学生のように、圧倒されてしまいます。処理には永遠に時間がかかり、電気代も莫大になり、情報のあまりの多さに混乱してしまうこともよくあります。科学者たちは、ロボットが読み始める前に「退屈な」レンガを捨ててしまうことで、この問題を解決しようとしてきました。重要なものだけを残そうとしたのです。しかし、従来の捨て方の方法は少し不器用でした。隣り合うものと見た目が違うというだけで重要な手がかりを捨ててしまったり、ロボットが実際に物語を理解する前に、何が重要かを予測しようとしたりしたのです。
そこで登場するのが、これら全ての感覚を持つロボットが、正気を保ったままより速く機能できるように設計された、賢い新戦略「OmniPack」です。OmniPackを、混沌とした映画の脚本に対する2段階の編集プロセスだと考えてください。まず、ロボットが脚本を読み始める前に、OmniPackは厳格な編集者として生の映像をスキャンします。単に静かな部分を削除するだけではありません。「大きな音」がする瞬間(突然の衝突や明るいフラッシュなど)を探し出し、さらに、時間の経過とともに遠くで起きている静かで重要な背景描写を見逃さないようにします。似たようなレンガをグループ化して余分なスペースを取らないようにし、物語の構造を維持したまま「ハイライト集」を作り上げます。
しかし、本当の魔法は第2ステップで起こります。一度ロボットが脚本を読み始め、自分自身に語りかけ始めた後、OmniPackが再び介入します。今度は、ロボットの「問い」に耳を傾けます。もしロボットが「車の色は何色だった?」と尋ねていたら、OmniPackは、たとえその音が小さかったり、車が小さかったりしても、車や色に関連するトークンを保持するように動きます。ロボット自身の好奇心を利用して情報を洗練させ、最も有用な詳細を統合していくのです。その結果、ロボットが行うべき作業量は劇的に減少します。特定のモデルである「Qwen2.5-Omni-7B」において、OmniPackは、元の知能の98.0%を維持しながら、必要な作業量をわずか16.7%にまで縮小することに成功しました。限界まで押し込み、作業量をわずか6.8%にまで減らした場合でも、ロボットは本来知っているべきことの92.9%を記憶していました。それは、巨大な百科事典をたった一冊のパンフレットに縮小するようなものですが、そのパンフレットには、必要な答えがすべて含まれているのです。
研究者たちは、従来のメソッドが失敗することが多かった理由を、情報を圧縮するのが早すぎたか、あるいは単純すぎたためであると指摘しました。単に「音の大きさ」や「類似性」に基づいてトークンを捨てようとすると、散らばった重要な手がかりを見逃してしまうことがよくあります。また、ロボットが二つの感覚を混ぜ合わせる機会を与える前に、オーディオを使ってビデオを圧縮しようとしたり(あるいはその逆)、試みたりすることはうまくいかないことも示しました。代わりに、OmniPackは「ステージ特化型」のアプローチを提案しています。まず、特定のメディア(ビデオまたはオーディオ)に基づいて構造的なクリーンアップを行い、次に、ロボットがそれらを混ぜ合わせた後に、特定のタスクや質問を用いて最終的なスマートな圧縮を行うのです。
5つの異なるチャレンジセットを用いたテストにおいて、OmniPackは比較対象としたあらゆる手法を一貫して打ち破りました。短いクリップであっても長いビデオであっても、この新メソッドは常にスピードと知能の最高のバランスを提供しました。著者らは、これら二つのステージ(まず構造的なクリーンアップを行い、次に質問に応じたスマートな洗練を行うこと)を調整することで、モデルを一から再学習させることなく、強力なAIモデルをより効率的にできると考えています。これは、超スマートなロボットを、情報が洪水のように押し寄せている時でも鋭敏なまま、より速く、より安価に動かすための方法なのです。
技術要約: OmniPack
問題提起
オムニモーダル大規模言語モデル(Omni-LLMs)は、テキスト、画像、ビデオ、オーディオを統合的にモデリングすることにより、統一された音響・視覚理解において顕著な成功を収めています。しかし、視覚および音声入力に求められる高密度なトークン化は、テキストよりも大幅に長いシーケンスを生成し、推論時における計算量とメモリのオーバーヘッドを極めて高いものにします。トークンの圧縮は効率的なデプロイメントのために不可欠ですが、既存の手法は、アグレッシブなトークン予算の下では決定的な限界に直面します。
- 不適切な構造モデリング: LLM前の圧縮手法は、局所的な重要性や類似性に依存することが多く、長距離の時空間構造を捉えることができません。これにより、長いビデオ内の疎なイベントや、一過性の音響的手がかりといった、グローバルに分散したエビデンスの喪失を招きます。
- 不十分なクロスモーダル協調: 既存のアプローチは、LLMの前で圧縮を行うもの(オーディオとビジュアルの表現間の意味的な相互作用が限定的である)か、あるいはLLM内で行うもの(テキストによるガイダンスには依存しているが、オーディオ・ビジュアルの協調を明示的にモデリングしていない)のいずれかです。その結果、タスクに関連するクロスモーダルなエビデンスを十分に活用できていません。
手法: OmniPack
著者らは、LLM前の構造的圧縮と、LLM内でのセマンティックな精緻化を調整するように設計された、トレーニングフリーの2段階進行フレームワークであるOmniPackを提案しています。
1. モダリティ固有のPre-LLM圧縮
LLMの前で行われるこのステージでは、顕著なエビデンスとグローバルなカバレッジを維持しながら、構造的な冗長性を除去します。これには3つの異なるメカニズムが用いられます。
- 重要度選択 (Importance Selection): エンコーダーのアテンション統計量とモダリティ固有の構造的キューを用いて、支配的なトークンを特定します。ビデオの場合、これには隣接フレームの変化や空間的な識別性が含まれ、オーディオの場合は、音響境界を検出するための隣接トークンの変化が含まれます。
- カバレッジ選択 (Coverage Selection): 顕著な領域への過度な集中を防ぐため、特徴量の類似性と正規化された時間的/時空間的距離を組み合わせた結合距離指標を用いて、追加の代表的なトークンを選択します。広範な時空間カバレッジを確保するためにDPC-KNNを利用します。
- 類似度を考慮したトークン・マージング (Similarity-Aware Token Merging): 未選択のトークンを単に破棄するのではなく、保持された代表トークンへと情報を集約します。未選択のトークンは、特徴量の類似性、位置の近接性、およびターゲットとなるトークンの重要性に基づいて、最も類似した保持トークンに割り当てられ、冗長な情報が保持セットへと効果的に転送されます。
2. クエリ条件付きInner-LLM圧縮
最初のℓ個のTransformerブロック内で十分なマルチモーダル相互作用が発生した後、第2の圧縮ステージが保持された表現を精緻化します。このステージは以下を活用します。
- テキストによるガイダンス: テキストの隠れ状態から派生したグローバルなクエリ表現が、タスクに関連するトークンの選択をガイドします。
- オーディオ・ビジュアル協調: トークンの関連度スコアは、テキストクエリとの類似性、および「他方」のモダリティのプロトタイプとの類似性(例:オーディオのコンテキストを考慮したビジュアルトークンなど)と、モダリティ内の代表性を考慮して算出されます。
- 多様性を考慮した選択: 関連性とセマンティックな多様性のバランスを取るために、トークンが反復的に選択され、保持されるセットが必要な情報のスペクトラムをカバーすることを保証します。
- 関連度によって変調されたマージング (Relevance-Modulated Merging): 未選択の隠れ状態は、関連度スコアによって変調された類似度重み付き平均を介して、保持された代表トークンに組み込まれます。
主な貢献
- 限界の特定: 本論文は、既存のOmni-LLMの圧縮が、不適切な長距離構造モデリングと、クエリ条件付きのクロスモーダル・エビデンスの活用不足により、アグレッシブな予算下で失敗することを明らかにしています。
- 統一されたフレームワーク: OmniPackは、モダリティ固有のPre-LLM圧縮(構造的)と、クエリ条件付きのInner-LLM圧縮(セマンティック)を組み合わせ、除去された情報を保持された代表者にマージすることで、情報の損失を最小限に抑える、トレーニングフリーの進行型戦略を導入しています。
- パフォーマンスと効率のトレードオフ: 本フレームワークは、高いマルチモーダル理解性能を維持しながら、アグレッシブなトークン圧縮を可能にするよう設計されています。
実験結果
3つのOmni-LLMバックボーン(Qwen2.5-Omni-3B/7BおよびMiniCPM-o-2.6)を用い、5つのベンチマーク(AVUT, WorldSense, DailyOmni, VideoMME, LVOmniBench)で広範な実験が行われました。
- パフォーマンス: Qwen2.5-Omni-7Bにおいて、OmniPackは元の性能の**98.0%を維持しながら、FLOPsを16.7%に削減します。極端な圧縮(元のFLOPsの6.8%のみを保持)においても、元の性能の92.9%**を維持します。
- 比較: OmniPackは、多様な保持比率において、既存の最先端のトレーニングフリー・ベースライン(FastV-om, VisionZip-om, OmniZip, OmniSIFT, SEATSの各バリアントを含む)を一貫して上回っています。
- 効率性: 15%/7.5%の保持比率(Pre-LLM/最終)において、OmniPackは元の性能の95.6%を維持しながら、10.0倍のFLOPs削減と4.5倍のプリフィル高速化を達成しています。
- アブレーション研究: 重要度選択、カバレッジ選択、およびトークン・マージングの組み合わせが、最高のPre-LLM結果をもたらすことが確認されました。さらに、Inner-LLM圧縮は、独立した戦略や汎用的な戦略と比較して、オーディオ・ビジュアルの協調とテキスト認識ガイダンスから大きく恩恵を受けることが示されました。
意義
本論文は、OmniPackがモデルの再学習を必要とせずに、Omni-LLMにおける計算オーバーヘッドという決定的なボトルネックに対処することを主張しています。圧縮を純粋な構造的キューから、協調的な2段階プロセスを通じたタスク条件付きのセマンティクスへとシフトさせることで、本フレームワークはリソース制約のあるデバイスへのOmni-LLMの実用的なデプロイを可能にします。結果は、アグレッシブなトークン圧縮を行っても、複雑で動的、かつ時間的に進化する現実世界のシナリオを理解するモデルの能力を損なうことなく、この分野における新たな最先端のパフォーマンス・効率トレードオフを確立できることを示しています。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録