← 最新の論文
💻 computer science

EarlyTom: Early Token Compression Completes Fast Video Understanding

本論文は、視覚エンコーダ内で初期段階の視覚トークン圧縮を実行し、精度をフルトークンベースラインと同等に維持しながら、最初のトークンまでの遅延と計算コストを大幅に削減する、トレーニング不要なフレームワークであるEarlyTomを提案する。

原著者: Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

公開日 2026-05-29
📖 1 分で読めます☕ さくっと読める

原著者: Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

30 分間の映画を、非常に賢いけれど非常に忙しい友人(AI)に説明していると想像してください。その友人は、質問に答える前に、まず映画全体を視聴する必要があります。

問題:「遅いスタート」
現在、AI が動画を理解しようとする際、まるで教科書のページをすべて読み終えるまで、一度も質問に答えようとしない学生のように振る舞います。

  • 従来の方法: AI は動画のすべてのフレームを視聴し、それを数千もの小さな断片(トークン)に分解し、その巨大な山を「脳」(大規模言語モデル)に渡して処理させます。
  • ボトルネック: その論文が明らかにしたのは、最大の遅延は AI の思考時間ではなく、最初に動画を単に「視聴」し、「整理」するのにかかる時間だということです。まるでゲームを始める前に、40 分もトランプの整頓に費やすようなものです。他の手法が後からカードを捨てようと試みても、最初の整頓自体が遅かったのです。

解決策:EarlyTom(「賢い編集者」)
著者たちは、EarlyTomと呼ばれる新しい手法を開発しました。EarlyTom は、動画が視聴された「後」ではなく、視聴「中」に介入する、超効率的な映画編集者だと考えてください。

動画が完全に処理されるのを待って何を残すかを決めるのではなく、EarlyTom は視聴プロセスの最中に動画を編集します。それは主に 2 つのトリックを使用します。

1. 「マージ」のトリック(時間圧縮)
10 秒間、人物が立ち止まって話している動画があると想像してください。その人物の同じ映像が 300 フレーム含まれています。

  • 従来の方法: AI はその 300 フレームをすべて個別に処理します。
  • EarlyTom: 「おい、この 300 フレームはほとんど同じだな」と気づきます。すべてを処理する代わりに、それらを 1 つの高品質な要約フレームにマージします。まるで 10 分間の独白を、次の段階へ渡す前に 1 文に要約するようなものです。これはカメラレンズ(ビジョンエンコーダ)の内部で行われるため、重労働がはるかに高速に完了します。

2. 「スポットライト」のトリック(空間選択)
次に、AI が動画内の群衆を見なければならない状況を想像してください。

  • 罠: その論文は、AI が「アテンション・シンキング(Attention Sinking)」と呼ばれる奇妙な癖を持っていることを発見しました。これは、特定の場所(例えば、無地の壁やロゴ)に固定されてしまい、そこで過度に輝き、他の場所で行われている実際の動作を見逃してしまうスポットライトのようなものです。「最も明るい」場所だけを拾うと、重要な動作を見逃してしまう可能性があります。
  • EarlyTom の対策: 群衆を 2 つのグループに分けます。
    • 「動く」グループ: 変化がある部分(動作)については、グローバルに最も重要な詳細を選択します。
    • 「静止」グループ: 静止している部分については、固定されたスポットライトに気を取られないよう、ローカルの「ウィンドウ」アプローチを使用します。これにより、AI はその固定された場所に偏ることなく、シーンのバランスの取れた視点を得られるようになります。

結果:知性を損なわずに高速化
この編集をプロセスの「早い」段階で行うことで、EarlyTom は 2 つの驚くべき成果を達成します。

  1. 超高速スタート: 最初の回答を得るまでの時間(Time-to-First-Token)を最大2.65 倍短縮します。従来の方法が 900 ミリ秒かかっていた場合、これは約 336 ミリ秒で済みます。
  2. 作業量の削減: 必要な総計算能力を最大**61%**削減します。

結論
この論文は、EarlyTom によって動画 AI が、再学習を必要とせず、かつ動画の正確な理解能力を失うことなく、驚くほど高速かつ効率的になることを主張しています。物語を理解するためにすべてのフレームを見る必要はないことが証明されました。必要なのは、いつ視聴を止めて思考を開始するかを知ることだけです。

要約すると:EarlyTom は、動画が視聴されている最中に編集を行う学習不要のツールであり、動画 AI をより高速で安価に実行可能にしつつ、その回答の賢さを維持します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →