LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
本論文は、新しいコーデックストリームトークン化戦略、統一された3D RoPE座標系、および大規模なオープン監視を活用することで、動画、空間、および時間的グラウンディングタスクにおいて最先端のパフォーマンスを達成する次世代の視覚言語モデルであるLLaVA-OneVision-2を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
30 分の映画を友人に説明しようとしているが、見せられる写真が 30 枚しかないと想像してみてください。
現在のほとんどの AI モデル(この新しいモデル以前のもの)は安全策を取ります。30 枚の写真を均等な間隔で選びます。1 分に 1 枚です。もし 10 分と 11 分の間に何か興奮すべきことが起こっても、AI はその瞬間を正確に見ていないため、完全に見逃してしまいます。まるで、1 分ごとに得点板だけを見て激しいサッカーの試合を理解しようとするようなものです。ゴールを見逃してしまうでしょう。
LLaVA-OneVision-2は、ルールを変える新しい種類の「超観察者」です。映画を静止画の連続として見るのではなく、圧縮されたデジタルファイル(あなたの携帯電話がスペース節約のために使うようなもの)として扱います。
これがどのように機能するか、簡単な比喩を使って説明します。
1. 「ビットコスト」コンパス
動画を圧縮する(生映画を MP4 に変えるなど)とき、コンピュータは動きが速かったり激しく変化したりする部分(車の衝突やダンサーの回転など)を記述するために、より多くの作業を強いられることになります。それらの部分により多くの「デジタルエネルギー(ビット)」を費やします。何も起こらない退屈な部分(静止した壁など)には、ほとんどエネルギーを費やしません。
LLaVA-OneVision-2 は、この「エネルギーマップ」を読み取ります。
- 古い方法:「1 秒見て、1 秒スキップし、また見る。」
- 新しい方法:「この動画ファイルは、アクションが激しいので今、多くのエネルギーを使っている!ここに集中しよう。ここはエネルギーが低いから、この部分は飛ばそう。」
それは、均等に分散させるのではなく、アクションが起きている場所に「脳力(トークン)」を集中させます。
2. 「動きの探偵」
このモデルはまた、「残差」も探します。人が歩いている動画を見ていると想像してください。背景(部屋)は同じままです。モデルは、「すべてのフレームで部屋を再説明する必要はない」と気づきます。それは、変化している部分(動く人)にのみ注意を向けます。
それは、最も重要な動く部分を効率的に縫い合わせた「視覚的キャンバス」を作成します。これにより、退屈で反復的な部分を無視し、「物語」にズームインするため、15 分の動画を見ても圧倒されることなく見ることができます。
3. 「縄跳び」テスト
これが機能することを証明するために、研究者たちはJumpScoreと呼ばれる新しいテストを作成しました。縄跳びをしている人の動画を想像してください。彼らは数百回ジャンプします。通常の AI にとっては、すべてのジャンプが全く同じに見えます。ユーザーがどの特定のジャンプについて尋ねているのかを特定するのは困難です。
- 古い AIは混乱してランダムに推測し、100 点中 30 点でした。
- LLaVA-OneVision-2は、縄が地面に当たった瞬間や、人の足の位置が変わった瞬間のような、わずかな瞬間を見抜きました。そして100 点中 75 点を獲得しました。
それは単に「ジャンプ」を見たのではなく、ジャンプが起きた正確な瞬間を見たのです。
4. 「空間ナビゲーター」
このモデルは、空間の理解においても非常に優れています。「コーヒーカップとラップトップの間の空いている場所を指し示して」と尋ねれば、高い精度でそれを行うことができます。さらに、動画内を移動する物体(部屋を走る猫など)を追跡し、猫が部分的に隠れても見失うことなく、その目を離さずに追うことができます。
全体像
研究者たちは、単に大きな脳を作ったわけではありません。彼らは見るためのより賢い方法を作りました。
- 以前:AI はハイキング中に景色を見逃さないよう、1 分ごとに写真を撮る観光客のようでした。
- 現在:AI は、景色がどこにあるかを正確に知っているガイドのようであり、風景が実際に変化したときだけ写真を撮るために立ち止まります。
その結果、以前のモデルよりも長編動画を理解し、高速なアクション内の特定の瞬間を見つけ、空間についてより良く推論するモデルが生まれました。しかも、すべて同じ量のコンピュータパワーを使用しながらです。彼らは、コード、データ、そしてモデル自体を誰でも無料で利用できるように公開しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。