Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
Mage-VLは、モーション認識型トークナイザーとデュアルシステムアーキテクチャを活用することで、静的および動的な推論タスクの両方において、より大規模な最先端モデルと同等またはそれを上回る性能を実現しながら、トークン消費量を大幅に削減し、より高速な推論を可能にする、効率的なコーデックネイティブのストリーミング基盤モデルです。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたはスマートフォンの画面越しに、ライブのサッカー中継を見ているところを想像してみてください。カメラがフィールドをパンし、観客が歓声を上げ、選手たちが前後へと駆け回っています。次に、その試合をリアルタイムで理解しようと試みる、超スマートなロボットを想像してください。現在のほとんどのロボットは、まるで500ページの教科書を、たとえそれが「芝生は緑である」と100回繰り返しているだけの部分であっても、一言一句すべて読まなければならないと主張する学生のようです。彼らは動画の退屈で静止した部分に執着し、脳のエネルギーと時間を浪費してしまい、その結果、実際のゴールが決まる瞬間を見逃してしまうのです。これは一種のパラドックスです。彼らは複雑なパズルを解くことには天才的ですが、動いているシーンを効率的に「見る」ことに関しては非常に稚拙なのです。
Microsoft Mage チームによって書かれたこの論文は、Mage-VL と呼ばれる新しい種類のロボットの脳を紹介しています。これは、人間の目のように振る舞うことで、そのルールを打破するように設計されています。すべてのビデオフレームをじっと見つめるのではなく、Mage-VL は実際に変化したり動いたりしている部分にだけ注意を払います。それは、まるでセキュリティガードがモーションセンサー(動き検知センサー)だけを見ているようなものです。もし何も動いていなければ、彼らは空っぽの廊下を監視するためにエネルギーを無駄にすることはありません。これを行うことで、ロボットは動画をはるかに速く、より少ない計算能力で理解できるようになり、ゲームが終わるのを待つのではなく、進行中の試合についてリアルタイムであなたとチャットすることが可能になります。
「コーデック・ネイティブ」な視聴の魔法
Mage-VL の秘訣は、著者たちが コーデック・ネイティブ(codec-native) と呼ぶアプローチです。ビデオストリーミング(Netflix や YouTube を視聴するときなど)の世界では、コンピュータは容量を節約するために「圧縮」というトリックを使用します。彼らはビデオのすべてのフレームを送信するのではなく、完全な画像(「Iフレーム」)を送り、その数秒間に変化するわずかな部分(「Pフレーム」)だけを送信します。これが、あなたのスマートフォンがすべてのデータを消費することなく映画をストリーミングできる理由です。
Mage-VL は、この言語をネイティブに話せるように構築されました。ビデオを静止画の硬直したグリッドに無理やり押し込むのではなく、ビデオ圧縮が「何が重要か」を判断するために使用するのと同じ動きの信号を利用します。もしプレイヤーが走っていれば、ロボットはそのプレイヤーにズームします。もし背景の観客がただ立っているだけなら、ロボットはそれを完全に無視します。これは、静物画を1秒間に30枚撮るのではなく、何か面白いことが起きた時にだけ写真を撮る写真家のようなものです。
その結果、劇的な効率向上がもたらされます。論文によれば、Mage-VL は「ビジュアル・トークン」(コンピュータが処理しなければならない画像の小さな断片)の数を 75% 以上 削減できることが示されています。これは、物語全体を完璧に理解しながら、退屈な補足部分をスキップして、エキサイティングな章だけを読む本のようなものです。
二つのシステムを持つ脳
このストリーミングビデオを扱うために、Mage-VL は人間の思考プロセスにインスパイアされた、巧妙な二部構成の脳を使用しています。
- システム 1(反射): これは、超高速で軽量なゲートキーパー(門番)です。ビデオストリームを監視し、「今、何か面白いことが起きているか?」と問いかけます。答えが「いいえ」であれば、沈黙を守ります。もし「はい」(ゴールが決まったときなど)であれば、即座に脳の第二の部分を目覚めさせます。
- システム 2(推論者): これは、重量級の思考部分です。ゲートが開くと、それは深く潜り込み、正確に何が起きたのかを解明し、回答を生成します。
つまり、ロボットはビデオの退屈な部分について考えるために時間を浪費しません。ハーフタイムショーやカメラがスタジアムをパンしている間は静かにしてい、プレイヤーがボールを蹴った瞬間にコメントを開始します。
彼らが発見したこと(そして発見できなかったこと)
チームはこのモデルを、約 5億6,000万枚のラベルなし画像 と 1億フレームのラベルなしビデオ を使用してゼロからトレーニングしました。これは膨大な量に聞こえますが、数十億の画像とテキストのペアを必要とする他の巨大なモデルと比較すると、実際にはかなり小規模です。驚くべきことに、優れた視覚的脳を構築するために、大規模なウェブスケールのデータセットは必ずしも必要ではないことが分かりました。Mage-VL のカスタムトレーニング手法により、ビデオ理解タスクにおいて、より大きなモデルに匹敵、あるいは凌駕することができました。
以下は、彼らが行った主な発見です:
- スピード: Mage-VL は驚異的に高速です。標準的なモデルと比較して、実時間で最大 3.5 倍速く ビデオを処理でき、かつ正解を導き出すことができます。
- 「長いビデオ」のためのトレーニングは不要: 長いビデオに関する質問に答える能力を持たせるために、モデルを長いビデオで特別にトレーニングする必要はないことが分かりました。詳細な短いクリップの記述を用いてトレーニングし、彼らのスマートな「コーデック」手法を用いることで、モデルは自律的に長いビデオを理解することを学習しました。
- 動きが空間推論を助ける: 動いているビデオでモデルをトレーニングすると、静的な 3D 形状や空間的な関係を理解する能力が実際に向上することを発見しました。物がどのように動くかを見ることは、それらが空間内でどのように組み合わさっているかを理解する助けになるようです。
- AI による AI の支援: チームは、より良いトレーニングデータを作成するために AI システムを使用しました。AI が生成したキャプションをチェックし、間違いを修正し、プロンプトを改善するというループを行うことで、データの質を大幅に高めました。
結論
Mage-VL は、AI が現実世界をリアルタイムで「見て」「聞く」ことを可能にするための重要な一歩です。動的な世界を理解するために、ビデオのあらゆるピクセルを力技で処理する必要はないということを証明しています。何を見るべきかを賢く選択することで(ビデオ圧縮の仕組みや人間の目が動きに集中する方法を模倣することで)、モデルはより速く、より安価に動作し、より応答性の高いものになります。
論文では、複雑な推論タスクや数学の問題についてはまだ課題があることも記されていますが、より小さく効率的なモデルが、動的で動いている世界を理解することにおいて、より大きく遅い巨人たちを凌駕できることを、Mage-VL は見事に実証しました。これは、「すべてを読む」ことから「重要なものを見る」ことへの転換なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。