VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models
本論文は、凍結された視覚言語モデルの周囲で、長尺ビデオ理解のための実行可能なコンテキスト構築プログラムを最適化する再帰的自己改善フレームワークであるVideoHarness-RSIを導入しており、ハーネス自体の洗練のみで大幅な性能向上をもたらし、ベンチマーク間で効果的に転移することを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約: VideoHarness-RSI
問題提起
長尺ビデオの理解は、基礎となるモデルが強力であっても、Vision-Language Models (VLMs) にとって依然として大きな課題となっています。核心的なボトルネックは、必ずしもモデルの推論能力にあるのではなく、むしろ**コンテキスト構築(context construction)**にあります。すなわち、数千もの無関係なフレームを含むビデオから、限られた一連の視覚的観察をどのように選択し、整理するかという点です。
既存のアプローチは、圧縮、検索、メモリ、あるいはエージェントによる証拠獲得を通じてこれに対処しています。しかし、これらのシステムは通常、複数のコンポーネントを同時に変更します(例:モデル、検索メカニズム、および推論ワークフローを同時に変更するなど)。これにより、「VLMとそのインターフェースを完全に固定したまま、コンテキストを構築する実行可能なプログラムのみを改善することで、どの程度の性能向上が達成できるのか?」という特定の問いを切り分けることが困難になります。
手法: VideoHarness-RSI
本論文では、凍結されたVLMの周囲で、最適な実行可能コンテキスト構築プログラム(ハーネス)を再帰的に探索するための制御されたフレームワークであるVideoHarness-RSI(Recursive Harness Self-Improvement)を導入します。
コアフレームワーク
本システムは、ハーネスを、ビデオと質問のペア を有界なマルチモーダル・コンテキスト にマッピングするプログラム として扱います。この は、その後、凍結されたVLM に入力され、回答 を生成します。
最適化の目的は、固定されたコンテキスト制約 の下で、実行可能なプログラムの空間 において開発精度を最大化することです。
ハーネスの分解
著者らは、あらゆるハーネスを以下の3つの機能的ステージに分析的に分解していますが、これらは個別に最適化される目的関数ではなく、プログラム変異のためのパスとして定義されています。
- 記述 (Write - ): ビデオの、アドレス指定可能な表現(例:ストリーム、キャプションリスト、または埋め込みインデックス)を構築する。
- 読解 (Read - ): 質問 に基づいて証拠を検索する。
- 梱包 (Pack - ): 有界なコンテキストをVLM向けに順序付け、フォーマットする。
再帰的探索プロトコル
探索は、ハーネスの変異を提案、実行、評価する外部ループを介して動作します。
- 提案者 (Proposer): LLMベースの提案者(Claude Opus 4.6)が、現在の最良プログラムのフロンティア()および履歴のコード、スコア、実行トレースのアーカイブ()に基づき、候補となるハーネスコードを生成します。
- 評価 (Evaluation): 候補は「スモークテスト」を受け、開発セット()上でエンドツーエンドで評価されます。
- 選択 (Selection): 更新ルールは厳格です。候補 が現在のフロンティアの精度を厳密に上回る場合のみ、次世代のフロンティア に昇格します。
- 制約 (Constraints): VLM(Qwen3-VL-8B-Instruct)、そのデコーディング設定、および評価指標は、探索を通じて固定されています。探索はモデルのパラメータには触れません。
実験設定
- データセット: LVBench(フィルタリング後、1,232組のQAペア)。探索および開発用に350問を使用し、882問をホールドアウト評価用に確保。
- ベースライン: 指定された一様サンプリング、文献に触発された手作りのハーネス(例:AKS、WorldMMスタイル、Homerスタイル)、および一様サンプリング下での独自のVLMと比較。
- コスト指標: 入力側のコンテキストコストは、質問あたりの視覚トークンと補助テキストトークンの合計として測定されます(オフラインのインデックス作成コストは除外)。
主な結果
1. 探索による性能向上
再帰的探索は、弱および強の両方のベースラインに対して一貫して性能を向上させました。
- 一様サンプリングからの向上: ランダムな一様サンプリングのベースライン(精度36.3%)から開始し、探索によってEMBEDNAVIGATE-HYBRIDを発見しました。これはホールドアウトセットにおいて**45.4%**を達成しました。
- 強力な手作りベースラインからの向上: 強力な手作りのベースライン(AKS、46.5%)から開始し、探索によってTIMESTAMPED-AKSを発見しました。これはホールドアウト精度を**50.3%**に向上させました。
- クロスベンチマーク転移: LVBenchで選択されたハーネスは、さらなる探索や適応なしに、そのままVideo-MMEおよびMLVUに適用されました。これらは両方のベンチマークにおいて一様サンプリングを上回りました(例:Video-MMEでは61.5% vs 59.9%)。これは、発見されたポリシーが転移可能であることを示唆しています。
2. 改善のメカニズム
発見されたハーネスの分析により、明確な戦略が明らかになりました。
- ナビゲーション vs 検索: 探索の結果、時間的ナビゲーション(キャプションを使用して関連する時間領域へのサンプリングを集中させる)と視覚的類似性検索(CLIP埋め込みを使用する)を組み合わせることが、どちらか一方を用いるよりも優れた結果をもたらすことが判明しました。
- 証拠の可視性: ハイブリッド・ハーネスは、注釈付きの証拠区間をより多く露出させる(「可視」フレームを増やす)だけでなく、証拠が見落とされていたケースにおける性能も向上させました。これは、コンテキストの構成と密度が重要であることを示唆しています。
- 質問タイプへの感度: ナビゲーション戦略は時間的および推論的な質問に特に効果的であり、一方で視覚的検索はエンティティや主要情報の質問に役立ちました。
3. コストと精度のトレードオフ
探索により、精度と入力トークンコストの間のパレート境界が明らかになりました。
- EMBEDNAVIGATE-HYBRIDは高い精度を実現しましたが、追加のナビゲーション・パスによる大幅なテキストオーバーヘッドが発生しました。
- TIMESTAMPED-AKSは、より小さな入力フットプリントで最高の精度を達成し、探索が手作りのベースラインが見逃す可能性のある効率的な構成を見つけ出せることを実証しました。
意義と主張
本論文は、自動化されたハーネス設計を研究するための制御されたベースラインとしてVideoHarness-RSIを位置付けています。主な貢献と主張は以下の通りです。
- 変数の分離: コンテキストの実行可能な構築が、独立した最適化レイヤーであることを確立しました。モデルを再学習したりインターフェースを変更したりすることなく、モデルが見るものを管理するプログラムである「ハーネス」を最適化することで、大幅な利得が得られることを示しています。
- 再現性: 著者らは、候補となるコード、親子関係、実行トレース、およびスコアの監査可能なアーカイブを提供しており、将来のハーネス探索研究のための再現可能なベースラインを提供しています。
- 転移可能性: 発見されたハーネスが、再探索なしに他のベンチマークに転移できるという結果は、探索が特定のデータセットの癖に過学習したポリシーではなく、汎用的なコンテキスト構築ポリシーを発見していることを示しています。
- 限界: 著者らは、探索のフロンティアが初期の改善後に停滞することが多いこと、および「厳格な」点推定による選択が統計的に汎化を保証するものではないことを謙虚に述べていますが、ホールドアウトセットでの実証結果がそのアプローチを支持しています。また、コスト指標は入力トークン量に関するものであり、エンドツーエンドのレイテンシや金銭的コストを反映したものではない(オフラインのインデックス作成コストは変動するため)ことも明確にしています。
要約すると、本論文は、長尺ビデオの理解において、凍結されたVLMを取り巻く「システム」は、再帰的かつ自動化されたプログラム探索を通じて改善可能な、極めて重要な最適化コンポーネントであると主張しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。