← 最新の論文
🤖 AI

One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory

本論文は、非効率な時空間パッチをパンオプティックなサブオブジェクト軌道に置き換えるグラウンディングされた動画トークナイズ手法であるTrajViTを導入し、従来のViT3Dエンコーダーと比較して動画検索および理解タスクにおいて優れた性能を達成しつつ計算コストを大幅に削減することを提案する。

原著者: Chenhao Zheng, Jieyu Zhang, Mohammadreza Salehi, Ziqi Gao, Vishnu Iyengar, Norimasa Kobori, Quan Kong, Ranjay Krishna

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Chenhao Zheng, Jieyu Zhang, Mohammadreza Salehi, Ziqi Gao, Vishnu Iyengar, Norimasa Kobori, Quan Kong, Ranjay Krishna

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

友人に映画を説明しようとしているが、使える単語数に制限がある状況を想像してください。

従来の方法:「グリッド」アプローチ
現在、ほとんどの AI モデルは、画面の小さな正方形(ピクセル)の巨大なグリッドを監視員が見ているように動画を視聴しています。動画が再生されるたびに、AI はすべてのフレームのすべての単一の正方形に対してメモを書き留めなければなりません。

  • 問題点: 動画が長い場合、またはカメラが静止した壁を単にパンしている場合、AI は空の空間や同じ壁について何千回も何千回もメモを書き留めます。何も起こらない 1 分間の動画に対して「壁、壁、壁、壁」と書き続けるようなものです。これは膨大なコンピュータメモリとエネルギーを浪費します。
  • 欠陥: AI が「退屈な」メモを削除しようとしても、カメラが動くと混乱することがよくあります。なぜなら、それは実際の物体ではなく、まだ単に正方形を見ているだけだからです。

新しい方法:「一つの軌跡、一つのトークン」
この論文(TrajViT)の研究者たちは、映画を見るより賢い方法を見つけ出しました。正方形のグリッドを見るのではなく、彼らは「動きの物語」を見ています。

彼らは動画を、シーン内を移動するキャラクター(物体)の集合として扱います。

  • 比喩: サッカーの試合を想像してください。
    • 従来の AI: 各フレームで、すべての草の葉、すべての土の粒、そして空のすべての部分を数えます。カメラがパンすると、草を再度数えます。
    • TrajViT: 「わかった、サッカーボールが左から右へ動き、選手がそれを追いかけて走っている」と言います。そして、ボールの全経路に対して単一のメモを、選手の経路に対しても単一のメモを作成します。
  • 結果: 1 分間の動画に対して何千ものメモが必要だった代わりに、AI は物体の旅程ごとに必要なメモを数十個に減らすことができます。

どのように実現したか(「探偵」パイプライン)
これを機能させるために、彼らは 3 段階のプロセスを構築しました。

  1. 始まりの発見: 動画のスキャンを行い、新しいものが現れる「重要な瞬間」(フレームにボールが入ってくるなど)を見つけます。
  2. 痕跡の追跡: 一時的に隠れたりカメラが揺れたりしても、それらの物体が移動するにつれて追跡するシステムを使用します。
  3. 旅程の要約: 物体の全経路(その「軌跡」)を取り、その物体がどのように見え、どこへ行ったかを AI に伝える単一の賢い「トークン」(デジタル要約)に圧縮します。

なぜこれが重要なのか
この論文は、この新しい方法が主に 2 つの理由でゲームチェンジャーであると主張しています。

  1. はるかに速く、軽量である: ピクセルを数えるのではなく、動き全体を要約しているため、従来の方法よりもメモ(トークン)を 10 分の 1しか使用しません。これにより、コンピュータははるかに少ないエネルギーとメモリを使用します。
  2. 実際に賢い: 少ないメモを使用しているにもかかわらず、AI は動画をよりよく理解します。テストでは、以下の点で優れていました。
    • テキストの説明に基づいて動画を見つけること(例:「犬がボールを追いかける動画を探せ」)。
    • 動画で何が起こったかについての質問に答えること。
    • 長い動画であっても、動作を認識すること。

「VideoLLM」テスト
研究者たちはまた、この新しいシステムを「動画大規模言語モデル」(動画について会話できる AI)に接続しました。

  • 結果: 新しいシステムを使用した AI は、トレーニングが4 倍速くなり、標準システムと比較して実行に必要な計算能力が18 倍少なくて済みました。それにもかかわらず、動画に関する質問により正確に答えました。

要約すると
従来の方法は、すべてのページのすべての文字を数えることで本を理解しようとするようなものです。新しい方法(TrajViT)は、文章を読み、プロットを理解します。それは空の空間を無視し、キャラクターと彼らの旅程に焦点を当てるため、動画で実際に何が起こっているかを理解する際に、はるかに速く、安価で、正確になります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →