✨ 要約🔬 技術概要
終わりのない図書館でミステリーを解こうとしている場面を想像してみてください。その図書館には何千冊もの本が詰まっていますが、あなたが必要としている手がかりは極めて微細なものです。例えば、4,002ページのどこかに囁かれたたった一言や、12,500ページの余白に隠された特定の図形のようなものです。もし、すべてのページを同じ速度で読もうとすれば、脳は疲弊してしまいますし、全体を急いで読み飛ばそうとすれば、小さな詳細を見逃してしまうかもしれません。これは、コンピュータが長いビデオや音声を理解しようとする際に直面する全く同じ問題です。彼らは「オムニモーダル(全感覚的)」なモデルであり、目で見たり耳で聞いたりすることができますが、ビデオが1時間の長さになると、最も重要な手がかりは、一瞬の音や、ほんの短い視覚的な動作である可能性があります。コンピュータがその1時間をすべて高精細に処理しようとすれば、メモリが足りなくなります。逆に、すべてを素早く流してしまえば、手がかりを見逃してしまいます。科学者たちは、コンピュータがいかに優れた探偵になれるかを教えようとしてきました。つまり、物語全体を素早く読み飛ばし、怪しい部分を見つけ出し、そして必要な場合にのみ、そこを詳しく見るために速度を落とす方法です。
ここで、OmniReasoner という新しい「思考」フレームワークが登場します。これは、AI探偵たちに特別なツールである**「ズームイン・ボタン」の使い方を教えるものです。1時間のビデオ全体を一度に見つめ続ける代わりに、OmniReasonerはまず、タイムライン全体を素早く、低画質で「ちらりと見る」ことから始めます。これは、本の概要を掴むためにページをパラパラとめくるようなものです。もしそこに答えがあると思えば、そのまま答えを出します。しかし、もし特定のフレーズを話しているキャラクターや、金魚鉢の中に魚が現れた瞬間のように、特定の場面に手がかりが隠れていると感じたら、AIは一時停止し、 「ズームイン」**を要求します。AIは、その数秒間だけの高精細で高速なクリップをリクエストします。そして、その「ズームされた」証拠を、元の素早い「ちら見」と照らし合わせて、パズルを解くのです。
ここでの魔法のトリックは、AIが「どこを」ズームすべきかを知る方法にあります。以前は、コンピュータは「フレーム(コマ)」を数える(ページ数を数えるようなもの)ことで苦労していました。なぜなら、ビデオの速度を上げたり下げたりすると、ページ番号が変わってしまうからです。OmniReasonerは、TimeAnchor と呼ばれる巧妙なシステムを使用しています。これは、ページ番号ではなく、時計の時間に基づいたGPS座標(例:「2分49秒を見る」)のようなものです。これにより、AIが低画質の早送り版を見ているときでも、クリスタルクリアなズームアップ版を見ているときでも、「2分49秒」は常に全く同じ瞬間を指し示します。これにより、AIは全体像とクローズアップの間で切り替えるときに迷子になることがありません。
このスキルをAIに教えるために、研究者たちは単に人間にすべてのビデオにラベルを貼らせることはしませんでした。それでは時間がかかりすぎるからです。代わりに、彼らはTemporal Augmented Data Engine を構築しました。これは、短いクリップを取り、それらを繋ぎ合わせて長い映画を作り、その新しい継ぎ目に密かに「手がかり」を隠すビデオエディターのようなものです。AIは、その隠された手がかりを見つけるように訓練されます。時には、映画全体から推測するように指示され、時にはズームツールを使うことを強制されます。試行錯誤(強化学習)のプロセスを通じて、AIは、ズームツールを使うことがより高いスコアにつながる一方で、それが本当に必要な場合にのみ使用すべきであることを学習していきます。
結果は、このアプローチが機能することを示しています。さまざまなビデオや音声の課題でテストされた際、OmniReasonerは、特に手がかりが稀な非常に長いビデオにおいて、答えを見つける能力が大幅に向上しました。AIは単に回答が賢くなっただけでなく、効率的になることも学びました。つまり、自分の「脳の力」を、本当に重要な瞬間にだけ使うようになったのです。この論文は、AIにすべてを等しく見させるのではなく、「いつ、より近くを見るべきか」を判断することを教えることで、以前は解くのが困難だった長い音響・映像ストリームにおける複雑なミステリーを解決できることを示唆しています。これは、AIが単にビデオを「見る」だけでなく、いつ立ち止まって注意を払うべきかを正確に理解し、ビデオについて「考える」ことへの一歩なのです。
技術要約: OmniReasoner
問題提起
長時間の音声・ビデオ推論は、オムニモーダル大規模言語モデル(LLM)にとって根本的な課題を提示しています。なぜなら、質問に答えるために必要な決定的な証拠は、しばしば希薄であり、時間軸に沿って分散しており、かつクロスモーダル(視覚的および聴覚的な手がかりの両方に関与)であるためです。コンテキストウィンドウの制約やトークンコストのため、すべてのフレームとオーディオセグメントを高忠実度で保持することは計算量的に不可能です。逆に、長いストリームをコンテキストに収めるために一様にダウンサンプリングすると、正確な推論に必要な微細な証拠が失われてしまいます。既存のアプローチは、固定された前処理に依存するか、視覚的な手がかりのみを使用して関連セグメントを検索するか、あるいは証拠の選択後に推論を最適化することに終始しており、「いつ」「どこで」長時間の音声・ビデオストリームに対して高忠実度な計算を割り当てるかという核心的な決定に対処できていません。
手法
著者らは、オムニモーダルLLMに「長時間の音声・ビデオを用いて思考する」ことを教えるための、ツール使用ポストトレーニングフレームワークであるOmniReasoner を導入します。これは、ズームイン・ツールを呼び出すべきかどうかを適応的に決定するように設計されています。
1. 推論ワークフロー
OmniReasonerは、2段階のプロセスで動作します。
グローバル・プレビュー (Global Preview): モデルはまず、フル音声・ビデオストリームの低コストで疎なグローバル・プレビュー(低フレームレートのビデオとフルオーディオ)を消費します。
ツール決定 (Tool Decision): このプレビューとユーザーの質問に基づき、ポリシーは2つのアクションのいずれかを選択します。
直接回答 (Direct Answer): グローバルの証拠が十分である場合、モデルは即座に回答します。
ズームイン (Zoom-in): より多くの証拠が必要な場合、モデルは時間間隔 [ s , e ] [s, e] [ s , e ] を指定して、ズームイン・ツールを呼び出します。
ローカル検査 (Local Inspection): システムは、要求された間隔に対応する高忠実度のローカルクリップを取得します。モデルはその後、グローバルなコンテキストと詳細なローカルの証拠の両方を用いて包括的な推論を行い、最終的な回答を生成します。
2. TimeAnchor
重要な技術的貢献は、異なるサンプリング粒度間での時間的グラウンディング(接地)の問題を解決するTimeAnchor です。
課題: 標準的なフレームインデックスやチャンクIDは、特定のサンプリングレートに依存しています。疎なグローバル・プレビューにおいて有効なフレームインデックスは、密なローカルクリップにおける同じ物理的な瞬間とは一致しません。
解決策: TimeAnchorは、インターリーブされた音声・ビデオ・トークンストリームのあらゆる2秒ごとのチャンクに対して、プレーンテキストの絶対時刻マーカー(例:<32 seconds>)を付与します。これにより、時間的引数(例:「32〜38秒を検査せよ」)が、モデルが疎なグローバルストリームを見ているのか、あるいは密なローカルクリップを見ているのかに関わらず、壁時計時間(ウォールクロックタイム)に基づいた整合性を保ち、ラウンドトリップ可能なものになります。引数はフレームインデックスではなく、実時間に基づいています。
3. 時間拡張データエンジン (Temporal Augmented Data Engine)
高価な手動による間隔アノテーションなしでモデルを訓練するために、著者らはツール使用の軌跡を合成する時間拡張データエンジン を構築しました。
タスク構築: 複数の独立したクリップを繋ぎ合わせるマルチセグメント構成 (Multi-segment Composition) や、ウィンドウ内の音声、ビデオ、またはその両方を置き換える異常挿入 (Anomaly Insertion) を通じて、長形式の推論タスクを作成します。この編集プロセスにより、証拠の間隔のグランドトゥルース(正解)が本質的に提供されます。
軌跡合成: 「MediaSandbox」を使用して、エンジンは推論環境をシミュレートします。以下の2種類の軌跡を生成します。
ツール使用軌跡: モデルはグローバルビューを観察し、ズーム間隔を要求し、ローカルクリップを受け取り、回答します。
直接回答軌跡: モデルはグローバルビューから直接回答します。
訓練レジメン: フレームワークは、これらの合成された軌跡に対して教師あり微調整 (SFT) を用いてツール使用プロトコルを確立し、続いてグループ相対方策最適化 (GRPO) 強化学習を採用します。RL(強化学習)の報酬は、回答の正確さとフォーマットの遵守に基づき、ツールを呼び出すことが最終的な回答を改善する場合にのみ呼び出すようポリシーを最適化します。
主な貢献
OmniReasonerフレームワーク: SFTとRLを通じて、オムニモーダルモデルが長時間の音声・ビデオ推論のための適応的なツール使用(ズームイン)を学習できるようにするポストトレーニング・アプローチ。
TimeAnchor: 絶対時刻マーカーを使用することで、忠実度の境界(疎なサンプリング vs 密なサンプリング)を越えて時間的引数の妥当性を維持するメカニズム。
時間拡張データエンジン: ビデオ編集を通じて既知の証拠間隔を持つツール使用の軌跡を合成し、手動によるスパンアノテーションを不要にするスケーラブルなデータ生成パイプライン。
実験結果
実験は、OmniVideoBench 、LVOmniBench 、Daily-Omni 、WorldSense 、VideoMME 、および VideoHolmes を含む、オムニモーダルおよびビデオ推論のベンチマークで実施されました。
性能向上: OmniReasoner(Qwen2.5-Omni-7Bベース)は、ベースラインモデルを大幅に上回りました。顕著な改善は以下の通りです。
OmniVideoBench: +5.5 ポイント (29.3 → \to → 34.8)。
LVOmniBench: +3.4 ポイント (32.0 → \to → 35.4)。
VideoHolmes: +15.6 ポイント (24.4 → \to → 40.0)。これは、ベースラインの固定された32フレーム制限と比較して、ズームインを通じてより多くのフレームを取得できる能力によるものです。
持続時間への感度: パフォーマンスの差はビデオの長さとともに拡大しました。OmniVideoBenchにおいて、性能向上幅は0〜5分のビデオでの+3.2ポイントから、10〜30分のビデオでは+9.9ポイントへと増加しており、長時間の疎な証拠に対する適応的なズームインの有効性を証明しています。
アブレーション研究:
自作の時間データを削除すると大幅な低下が見られ、構築された証拠間隔の必要性が確認されました。
音声入力またはツールによって返されたクリップを削除すると性能が低下し、クロスモーダルな証拠と能動的なローカル取得への依存が検証されました。
TimeAnchor のアブレーションでは、訓練レシピ単体でもグラウンディングは改善されるものの、TimeAnchorがさらなる大幅な利得(例:Charades-STA mIoUで+6.1ポイント)を提供することが示され、粒度間の時間的引数の整合における役割が証明されました。
SFTによるウォームアップなしのRL単独訓練は失敗し、ツール使用フォーマットを確立するための教師ありコールドスタートの必要性が浮き彫りになりました。
意義
本論文は、長時間の音声・ビデオ推論には、一様な知覚から適応的な証拠取得 への転換が必要であると主張しています。OmniReasonerは、オムニモーダルモデルが、固定されたコンテキストを受動的に処理するのではなく、「いつ」見て「どこで」再び聴くべきかを決定するエージェントとして機能するように訓練できることを示しています。TimeAnchorとスケーラブルなデータエンジンを導入することで、本研究は、マルチフィデリティ(多重忠実度)ストリームにおける時間的グラウンディングの具体的な技術的ハードルに対処し、大量の手動アノテーションを必要とせずに、長時間の音声・ビデオタスクにおける推論精度を向上させるための実用的なポストトレーニングのレシピを提供しています。著者らは、現在の2ステップのツール範囲の制限や、オムニモーダル設定におけるマルチターン・エージェント相互作用のためのより成熟したRLインフラストラクチャの必要性についても言及しています。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×