← 最新の論文
💻 computer science

OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance

OmniDrop は、テキストクエリと時間的多様性スコアを活用してデコーダ層内で冗長な音声視覚トークンを段階的に除去し、既存のベースラインを性能面で凌駕しながらレイテンシとメモリ使用量を大幅に削減する、オムニモーダル大規模言語モデル向けのトレーニング不要な層別トークンプルーニングフレームワークである。

原著者: Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

公開日 2026-05-15
📖 1 分で読めます☕ さくっと読める

原著者: Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

超スマートなロボットアシスタント(「Omni-LLM」)が、同時に動画と音声を視聴できると想像してください。あなたはそのロボットに、「背景で歌っているのは誰ですか?」や「車の色は何色ですか?」といった質問を投げかけます。

問題は、高品質な動画と音声は膨大なデータの流れのようであることです。動画 1 分間だけで、ロボットは 1 万個以上の小さな情報断片(「トークン」と呼ばれる)を処理しなければなりません。これらすべてを一度に考えようとするのは、消防ホースから水を飲もうとするようなもので、遅く、多くのエネルギーを消費し、ロボットを鈍くしてしまいます。

これを解決するため、科学者たちは通常、ロボットが思考を開始する前に、動画や音声の「退屈な」部分を捨てようとします。彼らは、音と映像が同時に発生すれば、それらは関連しているに違いないと仮定します。

この論文の大きなアイデア:「OmniDrop」
この論文の著者たちは、「待てよ、その仮定は間違っている」と言います。音と映像が同時に発生するからといって、それがあなたの特定の質問にとって重要であるとは限りません。

すぐに何かを捨てる代わりに、彼らはOmniDropという新しいシステムを構築しました。いくつかの単純な比喩を用いて、その仕組みを説明します。

1. 「スロー・スタート」戦略(層別プルーニング)

ロボットの脳を多階建てのビルだと想像してください。

  • 従来の方法: あなたは入り口(入力)に立ち、誰が誰に似ているかという基準に基づいて、すぐに 50% の人々(データ)を蹴り出します。これはリスクが高く、実際に答えを知っている人物を蹴り出してしまう可能性があります。
  • OmniDrop の方法: あなたは全員をビルの中に入れます。最初の数階(初期層)では、全員が交流し、互いに話します。これにより、音声と映像が混ざり合い、シーンを一緒に理解することができます。
  • ひねり: 集団が上の階(深い層)へと移動するにつれて、ロボットは「ああ、この質問に答えるには、これら 特定の人物と話すだけでよいのだ」と気づき始めます。そして、重要でない人々に去るように、最初は優しく、次第に激しく頼み始めます。これにより、ロボットが何を探しているかを知る前に「全体像」を失うことがなくなります。

2. 「質問を懐中電灯のように」する(クエリガイダンス)

ロボットは誰を保持すればよいのかをどうやって知るのでしょうか?

  • 従来の方法: 音声と映像を見て、どれが互いに一致するかを推測しようとします。
  • OmniDrop の方法: あなたのテキスト質問に基づいて懐中電灯を照らします。
    • 「あの音は何?」と尋ねれば、懐中電灯は音声トークンを照らし、映像トークンを暗くします。
    • 「シャツの色は何色?」と尋ねれば、懐中電灯は映像トークンを照らします。
    • ロボットは懐中電灯が照らすトークンを保持し、暗闇にあるトークンを捨てます。これにより、プルーニングは賢くなり、あなたのタスクに特化したものになります。

3. 「中間をスキップするな」ルール(時間的多様性)

危険があります:ロボットが懐中電灯に当たったトークンだけを保持すれば、他のすべてを忘れ、物語に「隙間」が生じる可能性があります。

  • 対策: OmniDrop は時間的多様性というルールを追加します。特定の瞬間が最も重要でなくても、主要な出来事から時間的に離れていれば、ロボットはそれを残すために少しの「ボーナス点」を与えます。
  • 比喩: 本を読むと想像してください。もし主人公が話す文だけを保持すれば、舞台設定を見逃してしまいます。OmniDrop は、「主人公のセリフを保持しつつ、物語が壊れたように感じられないよう、静かな部分のいくつかの文も保持する」と言います。

結果
著者たちは、この手法を Qwen2.5-Omni(人気のあるモデル)で、さまざまな動画と音声のテストを用いて検証しました。

  • 速度: ロボットの思考を40% 高速化しました(待ち時間の減少)。
  • メモリ: 14.7% 少ないメモリを使用しました。
  • 賢さ: 驚くべきことに、何を捨てるかを賢く判断した結果、ランダムなデータ断片を捨てる他の方法と比較して、ロボットは実際には質問への回答がより上手になりました(テストで最大 3.58 ポイント向上)。

まとめ:
OmniDrop は、映画のスマートな編集者のようなものです。見る前に映画を半分に切るのではなく、全体を見させ、あなたの特定の質問にとってどのシーンが重要かを正確に判断し、見ている最中に残りを切り取ることで、プロットを失うことなく素早く答えを得られるようにします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →