← 最新の論文
💻 computer science

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasonerは、希薄な証拠の高精度な検査のために「ズームイン」ツールを呼び出すタイミングを動的に決定する機能によって、オムニモーダルLLMが長い音声・ビデオストリームに対して効率的に推論することを可能にするツール使用ポストトレーニングフレームワークであり、時間的一貫性のための新しいTimeAnchorメカニズムと、スケーラブルな学習のためのTemporal Augmented Data Engineによって支えられています。

原著者: Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

終わりのない図書館でミステリーを解こうとしている場面を想像してみてください。その図書館には何千冊もの本が詰まっていますが、あなたが必要としている手がかりは極めて微細なものです。例えば、4,002ページのどこかに囁かれたたった一言や、12,500ページの余白に隠された特定の図形のようなものです。もし、すべてのページを同じ速度で読もうとすれば、脳は疲弊してしまいますし、全体を急いで読み飛ばそうとすれば、小さな詳細を見逃してしまうかもしれません。これは、コンピュータが長いビデオや音声を理解しようとする際に直面する全く同じ問題です。彼らは「オムニモーダル(全感覚的)」なモデルであり、目で見たり耳で聞いたりすることができますが、ビデオが1時間の長さになると、最も重要な手がかりは、一瞬の音や、ほんの短い視覚的な動作である可能性があります。コンピュータがその1時間をすべて高精細に処理しようとすれば、メモリが足りなくなります。逆に、すべてを素早く流してしまえば、手がかりを見逃してしまいます。科学者たちは、コンピュータがいかに優れた探偵になれるかを教えようとしてきました。つまり、物語全体を素早く読み飛ばし、怪しい部分を見つけ出し、そして必要な場合にのみ、そこを詳しく見るために速度を落とす方法です。

ここで、OmniReasonerという新しい「思考」フレームワークが登場します。これは、AI探偵たちに特別なツールである**「ズームイン・ボタン」の使い方を教えるものです。1時間のビデオ全体を一度に見つめ続ける代わりに、OmniReasonerはまず、タイムライン全体を素早く、低画質で「ちらりと見る」ことから始めます。これは、本の概要を掴むためにページをパラパラとめくるようなものです。もしそこに答えがあると思えば、そのまま答えを出します。しかし、もし特定のフレーズを話しているキャラクターや、金魚鉢の中に魚が現れた瞬間のように、特定の場面に手がかりが隠れていると感じたら、AIは一時停止し、「ズームイン」**を要求します。AIは、その数秒間だけの高精細で高速なクリップをリクエストします。そして、その「ズームされた」証拠を、元の素早い「ちら見」と照らし合わせて、パズルを解くのです。

ここでの魔法のトリックは、AIが「どこを」ズームすべきかを知る方法にあります。以前は、コンピュータは「フレーム(コマ)」を数える(ページ数を数えるようなもの)ことで苦労していました。なぜなら、ビデオの速度を上げたり下げたりすると、ページ番号が変わってしまうからです。OmniReasonerは、TimeAnchorと呼ばれる巧妙なシステムを使用しています。これは、ページ番号ではなく、時計の時間に基づいたGPS座標(例:「2分49秒を見る」)のようなものです。これにより、AIが低画質の早送り版を見ているときでも、クリスタルクリアなズームアップ版を見ているときでも、「2分49秒」は常に全く同じ瞬間を指し示します。これにより、AIは全体像とクローズアップの間で切り替えるときに迷子になることがありません。

このスキルをAIに教えるために、研究者たちは単に人間にすべてのビデオにラベルを貼らせることはしませんでした。それでは時間がかかりすぎるからです。代わりに、彼らはTemporal Augmented Data Engineを構築しました。これは、短いクリップを取り、それらを繋ぎ合わせて長い映画を作り、その新しい継ぎ目に密かに「手がかり」を隠すビデオエディターのようなものです。AIは、その隠された手がかりを見つけるように訓練されます。時には、映画全体から推測するように指示され、時にはズームツールを使うことを強制されます。試行錯誤(強化学習)のプロセスを通じて、AIは、ズームツールを使うことがより高いスコアにつながる一方で、それが本当に必要な場合にのみ使用すべきであることを学習していきます。

結果は、このアプローチが機能することを示しています。さまざまなビデオや音声の課題でテストされた際、OmniReasonerは、特に手がかりが稀な非常に長いビデオにおいて、答えを見つける能力が大幅に向上しました。AIは単に回答が賢くなっただけでなく、効率的になることも学びました。つまり、自分の「脳の力」を、本当に重要な瞬間にだけ使うようになったのです。この論文は、AIにすべてを等しく見させるのではなく、「いつ、より近くを見るべきか」を判断することを教えることで、以前は解くのが困難だった長い音響・映像ストリームにおける複雑なミステリーを解決できることを示唆しています。これは、AIが単にビデオを「見る」だけでなく、いつ立ち止まって注意を払うべきかを正確に理解し、ビデオについて「考える」ことへの一歩なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →