← 最新の論文
🤖 AI

AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding

本論文は、MLLM の自己不確実性をグローバル制御信号として活用し、長動画理解におけるトークン選択と早期終了を可能にするトレーニング不要のフレームワーク「AdaptToken」を提案し、複数のベンチマークで精度向上と推論時間の短縮を実現したことを報告しています。

原著者: Haozhe Qi, Kevin Qu, Mahdi Rad, Rui Wang, Alexander Mathis, Marc Pollefeys

公開日 2026-03-31
📖 1 分で読めます☕ さくっと読める

原著者: Haozhe Qi, Kevin Qu, Mahdi Rad, Rui Wang, Alexander Mathis, Marc Pollefeys

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

長い動画の理解を助ける「AdaptToken」の仕組み

この論文は、AI(マルチモーダル大規模言語モデル)が**「長い動画」**を理解するのを助ける新しい技術「AdaptToken」について紹介しています。

AI が長い動画を見るのは、人間が 3 時間の映画を 1 秒ずつすべて見て内容を理解しようとするようなもので、とても大変です。メモリが足りなくなったり、処理しきれなかったりするのが問題でした。

この「AdaptToken」は、そんな AI のために**「必要な部分だけを選んで、無駄な部分を捨てて、もう十分なら見るのをやめる」**という賢い仕組みを作ったものです。

以下に、日常の例えを使って簡単に説明します。


1. 従来の問題:「全部見ようとして疲弊する」

昔の AI は、長い動画を見せられると、フレーム(映像の断片)をすべて、あるいはランダムに選んで見ようとしていました。

  • 例え話: 100 ページある本の内容を聞かれたとき、AI は「重要なページも、ただの背景描写も、同じように全部読み上げようとして、頭がパンクしてしまう」状態でした。

2. AdaptToken の解決策:3 つのステップ

この新しい技術は、以下の 3 つのステップで AI をサポートします。

ステップ①:グループに分けて「自信」を測る(エントロピーの活用)

長い動画を小さな「グループ(断片)」に分けます。そして、AI にそれぞれのグループを見せながら、「このグループは質問の答えに役立っているか?」を AI 自身に判断させます。

  • 仕組み: AI が「あ、これだ!」と確信を持てるほど、回答の「不安定さ(エントロピー)」が低くなります。逆に、何もないと AI は「えっと…」と曖昧な答えになります。
  • 例え話: 探偵が事件現場を調べる際、**「手がかりがありそうな部屋(確信度が高い)」「ただの廊下(確信度が低い)」を区別します。AdaptToken は、AI が「この部屋は重要だ!」と確信した瞬間を、「手がかりが見つかった!」**という信号として使います。

ステップ②:重要度に応じて「予算」を配分

動画全体で使える「見る回数(トークン数)」には限りがあります。AdaptToken は、**「手がかりが見つかりやすいグループには多くの人(トークン)を派遣し、そうでないグループには少ない人しか行かせない」**という配分を行います。

  • 例え話: 捜査チームの人数が限られているとき、**「犯人が隠れそうな家には 10 人派遣し、ただの公園には 1 人だけ」**というように、リソースを賢く配分します。これにより、重要な情報が漏れなくなります。

ステップ③:「もう十分」を見つけて即座に終了(Early Stopping)

これが最大の特徴です。もし、いくつかのグループを見て「もう答えがはっきりした!」と AI が確信したら、残りの動画を見るのをやめてしまいます。

  • 例え話: 映画のサスペンス部分を見て「犯人は A だ!」と 100% 確信できたら、映画の残り 1 時間を見ずに「終了!」と宣言するようなものです。これにより、処理時間が半分以下に短縮されます。

3. さらに「重複」を避ける

同じような映像が連続して入っている場合、AI は同じ情報を何度も見てしまいます。AdaptToken は、**「似すぎている映像は一つにまとめる」**という作業も行うため、より多様な情報だけを AI に渡すことができます。


この技術のすごいところ(成果)

  • どんな AI でも使える: 小さな AI でも巨大な AI でも、この仕組みを組み合わせるだけで性能が向上します。
  • 超長編動画に強い: 1 時間、2 時間、あるいは 1 万フレームもの超長編動画でも、精度が落ちずに理解できます。
  • 速くて正確: 「AdaptToken-Lite」というバージョンを使えば、処理時間が約半分になりつつ、精度はほとんど変わらないという驚異的な結果を出しています。

まとめ

AdaptToken は、AI に**「全部を無理に見るのではなく、重要な部分に集中し、答えが出たらすぐに止まる」**という、人間のような「直感」と「効率性」を与えた技術です。これにより、AI は長い動画でも、疲れることなく、正確に内容を理解できるようになりました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →