← 最新の論文
💬 NLP

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

本論文は、トークン選択を関連性、重要性、および多様性に基づくトップKKの検索問題として再定義することで、オムニモーダルLLMにおける時間単位のオーディオ・ビデオ理解を強化する、検索に着想を得たトークン圧縮フレームワークであるAVOCを提案しており、これにより、1時間を超えるコンテキストにおける堅牢性を維持しながら、長尺のベンチマークにおいて最先端の性能を達成している。

原著者: Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

公開日 2026-06-24
📖 1 分で読めます☕ さくっと読める

原著者: Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

膨大な映画や、数時間に及ぶ会議の録画ビデオがある巨大なライブラリを想像してみてください。あなたは、その中の特定の動画について、「あの特定のセリフの後に、何人の人が地下室に入りましたか?」といった具体的な質問を、非常に賢いAIアシスタントに投げかけたいと考えています。

問題は、AIの「脳」(メモリウィンドウ)が小さすぎて、ビデオ全体を一度に保持できないことです。もしビデオ全体を流し込もうとすれば、AIは処理しきれずパンクしてしまいます。単にランダムにフレームを選んでサイズを縮小しようとすれば、重要な瞬間を見逃してしまうかもしれません。一方で、あらゆる詳細をすべて保持しようとすれば、容量が足りなくなってしまいます。

AVOC:スマートな司書

この論文の著者たちは、AVOCと呼ばれる新しいシステムを作り出しました。AVOCを、1時間の映画をAI用のわずか10ページの「カンニングペーパー(要約)」にまとめる、非常にスキルの高い司書だと考えてください。ただし、そこには非常に明確な目的があります。それは、「そのカンニングペラには、あなたの質問に答えるために必要な情報だけが含まれていなければならない」というものです。

AVOCがどのように機能するかを、検索エンジンが最適な結果を見つける方法から借りた3つのシンプルなルールを使って説明します。

1. Relevance(関連性):「質問と一致しているか?」

例えば、あなたが「誰が地下室に入りましたか?」と尋ねたとします。

  • 従来の方法: 司書は、たとえ派手な色使いだったり音が大きかったりしたとしても、キッチンや外の天気に関するページを見せてくるかもしれません。
  • AVOCの方法: AVOCはまず、あなたの質問を読み取ります。ビデオとオーディオをスキャンし、「よし、地下室について話している部分を探さなければ」と判断します。そして、質問に直接関連するビデオ内の特定の瞬間と、オーディオ内の特定の言葉を強調表示します。これは**Text-Guided Scoring(テキスト誘導型スコアリング)**と呼ばれます。

2. Importance(重要性):「質問がなくても、それは面白いか?」

時には、あなたの質問が曖昧であったり、答えがビデオの中で明示的に語られていない「映像」に依存していたりすることもあります。

  • 例え話: 人混みの中から特定の人を探している場面を想像してください。その人の名前を知らなくても、その人が「明るい赤色の帽子」を被っていたり(ユニークな視覚的特徴)、あるいは「踊っている唯一の人」であったり(ユニークな音声的特徴)すれば、見つけ出すことができるはずです。
  • AVOCの方法: AVOCは、ある瞬間がそれ自体として「重要」かどうかをチェックします。ビデオとオーディオがどのように相互作用しているかを確認します。もし人物の顔(ビデオ)が特定の音(オーディオ)と一致していれば、たとえ質問の中でそのことに触れていなくても、その瞬間には高い「重要度」スコアが与えられます。これにより、AIが見落としがちな隠れた手がかりを見逃さないようにしています。

3. Diversity(多様性):「同じものを二度も見せないで!」

これが最も難しい部分です。あるキャラクターが部屋に入り、部屋を出て、また部屋に戻ってくるシーンがあるとします。愚かなシステムは、これら3つの瞬間すべてが似ているために、すべてを選んでしまうかもしれません。これはスペースの無駄遣いです。

  • 例え話: 旅行のためにスーツケースをパッキングしている場面を想像してください。全く同じ赤い靴下を3足も入れる必要はありません。異なるニーズに対応するために、赤い靴下1足、青い靴下1足、緑の靴下1足をパッキングする必要があります。
  • AVOCの方法: AVOCは、**Temporal-Aware Diversity(時間的意識を持つ多様性)**と呼ばれる特別なルールを使用します。「もし、誰かが部屋に入る瞬間をすでに選んだのであれば、その直後の、全く同じ動作をしている次の1秒間は選ばない」と判断します。しかし、もし同じことが映画の1時間後に起きたとしたら、AVOCはそれを「異なるイベント」として選定します。これにより、内容は新鮮なまま、重複することなくタイムライン全体をカバーすることができます。

結果:超スマートな要約

これら3つのルールを組み合わせることで、AVOCは膨大な1時間のビデオとオーディオのストリームを、非常に効率的な小さな「トークン」シーケンスへと圧縮します。退屈な部分、繰り返される部分、あるいは無関係な部分を切り捨て、情報の「黄金の塊(ゴールデン・ナゲット)」だけを残すのです。

どのような結果が得られたのか?

  • 他よりも優れている: 長いビデオ(最大90分)を用いたテストにおいて、AVOCは他のトップモデルよりもはるかに正確に質問に回答しました。平均して、2番目に優れたモデルに対して約5ポイント高いスコアを叩き出しました。
  • 「干し草の山の中の針」を見つけ出す: 彼らは、AIが1時間のビデオの中に隠された特定の秘密の数字を見つけられるかどうかをテストしました。AVOCは、ビデオが1時間に及ぶ場合でもほぼ完璧に見つけ出すことができましたが、他のモデルはビデオが長くなるにつれて失敗し始めました。
  • 高速である: この複雑なソートを行っているにもかかわらず、AVOCはAIの処理速度をほとんど低下させません。実際、不要なデータを大量に切り捨てるため、AIは以前よりもビデオを速く処理できるようになります。

要するに、AVOCはAIに「より優れた読書術」を教えているのです。それは、500ページの本のすべての単語を読むのではなく、質問に完璧に答えるために、スキミング(流し読み)をし、重要な部分をハイライトし、無駄な部分を無視することを学ぶのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →