← 最新の論文
🤖 AI

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocusは、オムニモーダル大規模言語モデルのための学習不要かつクエリ誘導型のトークン圧縮手法であり、音声およびビデオトークンの重要性を独立して推定することでモダリティ対称的な圧縮を実現し、それによってクロスモーダルな整合性を維持しながら推論コストを削減し、精度と効率性のトレードオフにおいて既存のベースラインを凌駕するものである。

原著者: Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

公開日 2026-07-07
📖 1 分で読めます☕ さくっと読める

原著者: Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたには、動画を視聴しながら同時に音声も聞くことができる、超スマートなロボット助手(オムニモーダル大規模言語モデル)がいます。このロボットは非常に有能ですが、一つ問題があります。長い動画と音を見せると、そのロボットはトランスクリプトの全単語を読み、動画の全フレームをすべて確認しようとしてしまうのです。それは、あるシーンで空が何色だったかという単純な質問に答えるために、百科事典を一冊丸ごと読み込もうとするようなものです。このため、ロボットの動作は遅くなり、実行コストが高くなり、情報過多で圧倒されてしまいます。

この論文は、このロボットを再学習させることなく、より速く、より賢くするための新しい手法であるOmniFocusを紹介しています。以下に、その仕組みを簡単な比喩を用いて説明します。

問題点: 「アンバランスな」ガイド

これまで、研究者たちは動画や音声の「退屈な」部分を無視させることで、これらのロボットを高速化しようと試みてきました。しかし、それらは通常、何が重要かを判断するために一つの感覚のみを使用していました。

  • 欠陥: あなたが料理番組を見ていると想像してください。もし、シェフの声だけを頼りに動画のどの部分が重要かを判断すると、「鍋が沸騰している」といった重要な視覚的ステップを見逃してしまうかもしれません(シェフがまだそのことに触れていない場合)。逆に、映像だけを見ていると、食べ物が焦げていることを知らせる「ジュージューという音」のような微かな音を見逃してしまうかもしれません。
  • 結果: ロボットは音声に関する質問には上手になりますが、視覚に関する質問には苦手になります。つまり、ガイドとして使用している感覚に対して「偏り(バイアス)」が生じてしまうのです。

解決策: OmniFocus(「クエリ・ディテクティブ(問いの探偵)」)

OmniFocusは、あなたの特定の質問(「クエリ」)を聞いてから、何を残すべきかを判断する探偵のように振る舞うことで、この問題を解決します。

  1. まず質問を聞く:
    当て推量で重要な部分を決めるのではなく、OmniFocusはまずあなたの質問を確認します。「スピーカーは予算について何と言いましたか?」と聞かれれば、探偵は音声に集中すべきだと理解します。「車の色は何色でしたか?」と聞かれれば、映像に集中すべきだと理解します。

  2. 二つの別々のチーム(モダリティ・バランス):
    この手法は、動画と音声を二つの別々のチームとして扱います。そして、チーム・ビデオに「この動画のどの部分が質問に一致しますか?」と問いかけ、チーム・オーディオに「この音声のどの部分が質問に一致しますか?」と問いかけます。

    • 比喩: 旅行の荷造りをしている場面を想像してください。代わりに、「衣類」の引き出し(動画)や「靴」の引き室(音声)から中身をすべて放り込むのではなく、あなたの旅程(質問)を確認します。ハイキングに必要な特定の靴と、雨天用の特定のジャケットを選んでパッキングします。引き出しの中身すべてを詰め込むのではなく、その旅に必要とされるものだけを詰めるのです。
  3. 「デュアル・スコア」による選択:
    探偵がどの時間の塊(チャンク)が重要かを把握したら、二つのルールに従って残すべき特定の「トークン(データの断片)」を選び出します。

    • ルールA(握手): 動画と音声が一致または合致する部分を残します(例:ドアが閉まる音と、ドアが閉まる視覚的な動きが一致する場合)。
    • ルールB(目立ちやすさ): たとえ相手の感覚に一致する信号がなくても、そのカテゴリー内で独特であったり、あるいは大きな音であったりする部分(例:音声における非常に独特な音、あるいは映像における明るいフラッシュなど)を残します。

結果: より速く、より賢く

研究者たちは、これらをQwen2.5-Omniファミリーのモデル(「ロボット」)でテストしました。

  • 効率性: 質問に一致しない「退屈な」部分を切り捨てることで、ロボットは1.38倍速く動作し、メモリ使用量も抑えられます。
  • 正確性: データの75%を捨てて(わずか25%だけを残して)いるにもかかわらず、ロボットは従来の手法よりも優れた回答を出すことができました。動画と音声の両方から最も重要な手がかりを保持していたため、「常識」を失わなかったのです。

まとめ

OmniFocusは、ロボットの前に置かれたスマートなフィルターのようなものです。一つの感覚に基づいて盲目的にデータを削除するのではなく、あなたの質問を聞き、動画と音声の両方を個別にチェックし、両方から最も関連性の高い「手がかり」だけを残します。これにより、ロボットはより速く、より安価に動作し、無関係なノイズに惑わされることがなくなるため、驚くほど正確になります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →