← 最新の論文
💻 computer science

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

OmniPackは、LLM前の構造的冗長性の除去と相互作用後の意味論的精緻化を組み合わせることで、複数のベンチマークにおいて優れた性能と効率のトレードオフを実現しつつ、計算コストを大幅に削減し、オムニモーダル大規模言語モデルの効率性を高める学習不要のフレームワークである。

原著者: Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

公開日 2026-08-05
📖 1 分で読めます☕ さくっと読める

原著者: Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超スマートなロボットに世界を理解させる方法を教えようとしているところだと想像してください。単に本を読ませるのではなく、映画を見せながら同時にサウンドトラックを流すのです。これが「オムニモーダル(Omni-modal)」AIの刺激的な世界です。そこでは、コンピュータは視覚、聴覚、そして読解を同時に学習します。しかし、ここに落とし穴があります。映画やサウンドトラックは膨大な量です。わずか1秒のビデオやオーディオでも、数千もの「トークン」と呼ばれる小さなデジタルの「レンガ」に分解されます。もし映画全体をロボットに食べさせようとすれば、ロボットは、まるで1分間で図書館全体の蔵書を読もうとする学生のように、圧倒されてしまいます。処理には永遠に時間がかかり、電気代も莫大になり、情報のあまりの多さに混乱してしまうこともよくあります。科学者たちは、ロボットが読み始める前に「退屈な」レンガを捨ててしまうことで、この問題を解決しようとしてきました。重要なものだけを残そうとしたのです。しかし、従来の捨て方の方法は少し不器用でした。隣り合うものと見た目が違うというだけで重要な手がかりを捨ててしまったり、ロボットが実際に物語を理解する前に、何が重要かを予測しようとしたりしたのです。

そこで登場するのが、これら全ての感覚を持つロボットが、正気を保ったままより速く機能できるように設計された、賢い新戦略「OmniPack」です。OmniPackを、混沌とした映画の脚本に対する2段階の編集プロセスだと考えてください。まず、ロボットが脚本を読み始める前に、OmniPackは厳格な編集者として生の映像をスキャンします。単に静かな部分を削除するだけではありません。「大きな音」がする瞬間(突然の衝突や明るいフラッシュなど)を探し出し、さらに、時間の経過とともに遠くで起きている静かで重要な背景描写を見逃さないようにします。似たようなレンガをグループ化して余分なスペースを取らないようにし、物語の構造を維持したまま「ハイライト集」を作り上げます。

しかし、本当の魔法は第2ステップで起こります。一度ロボットが脚本を読み始め、自分自身に語りかけ始めた後、OmniPackが再び介入します。今度は、ロボットの「問い」に耳を傾けます。もしロボットが「車の色は何色だった?」と尋ねていたら、OmniPackは、たとえその音が小さかったり、車が小さかったりしても、車や色に関連するトークンを保持するように動きます。ロボット自身の好奇心を利用して情報を洗練させ、最も有用な詳細を統合していくのです。その結果、ロボットが行うべき作業量は劇的に減少します。特定のモデルである「Qwen2.5-Omni-7B」において、OmniPackは、元の知能の98.0%を維持しながら、必要な作業量をわずか16.7%にまで縮小することに成功しました。限界まで押し込み、作業量をわずか6.8%にまで減らした場合でも、ロボットは本来知っているべきことの92.9%を記憶していました。それは、巨大な百科事典をたった一冊のパンフレットに縮小するようなものですが、そのパンフレットには、必要な答えがすべて含まれているのです。

研究者たちは、従来のメソッドが失敗することが多かった理由を、情報を圧縮するのが早すぎたか、あるいは単純すぎたためであると指摘しました。単に「音の大きさ」や「類似性」に基づいてトークンを捨てようとすると、散らばった重要な手がかりを見逃してしまうことがよくあります。また、ロボットが二つの感覚を混ぜ合わせる機会を与える前に、オーディオを使ってビデオを圧縮しようとしたり(あるいはその逆)、試みたりすることはうまくいかないことも示しました。代わりに、OmniPackは「ステージ特化型」のアプローチを提案しています。まず、特定のメディア(ビデオまたはオーディオ)に基づいて構造的なクリーンアップを行い、次に、ロボットがそれらを混ぜ合わせた後に、特定のタスクや質問を用いて最終的なスマートな圧縮を行うのです。

5つの異なるチャレンジセットを用いたテストにおいて、OmniPackは比較対象としたあらゆる手法を一貫して打ち破りました。短いクリップであっても長いビデオであっても、この新メソッドは常にスピードと知能の最高のバランスを提供しました。著者らは、これら二つのステージ(まず構造的なクリーンアップを行い、次に質問に応じたスマートな洗練を行うこと)を調整することで、モデルを一から再学習させることなく、強力なAIモデルをより効率的にできると考えています。これは、超スマートなロボットを、情報が洪水のように押し寄せている時でも鋭敏なまま、より速く、より安価に動かすための方法なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →