← 最新の論文
💻 computer science

VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority

VideoSEAL は、長期計画と回答の権威を分離するデカップリングされたプランナー・インスペクター・フレームワークを導入することで、エージェントによる長期動画理解における「証拠の不一致」問題に対処し、回答が取得した証拠によって裏付けられることを保証するためにピクセルレベルの検証を要求し、複数のベンチマークで最先端の性能を達成します。

原著者: Chenhao Qiu (Mango TV), Yechao Zhang (Nanyang Technological University), Xin Luo (Mango TV), Shien Song (Mango TV), Xusheng Liu (Mango TV)

公開日 2026-05-14
📖 1 分で読めます☕ さくっと読める

原著者: Chenhao Qiu (Mango TV), Yechao Zhang (Nanyang Technological University), Xin Luo (Mango TV), Shien Song (Mango TV), Xusheng Liu (Mango TV)

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、VideoSEAL論文の解説を、創造的な比喩を用いて平易な言葉で翻訳したものです。

大きな問題:「自信満々だが間違っている」探偵

あなたが 2 時間もの長い映画を見ていると想像してください。そして、誰かが映画開始から 45 分後に起きた、ある小さな詳細について具体的な質問をしてくるとします。

これらの質問に答えようとする現在の AI システムは、大きなプレッシャーにさらされた過労の探偵のようです。彼らは答えを見つけるために、映画全体をスキャンしなければなりません。

  • 欠陥: これらの探偵は、膨大な情報に疲れ果てたり混乱したりすることがよくあります。彼らはいくつかの手がかりを見つけるかもしれませんが、正しい手がかりではないかもしれません。それでも、答えを出すというプレッシャーの下にあるため、彼らは推測します。
  • 結果: 彼らは時として正しい答えを出しますが、それを証明する証拠を実際には見つけていません。彼らは「聞こえが良い」ものや、学習時に記憶しているものに基づいて推測しているだけです。これを証拠の不一致(Evidence Misalignment)と呼びます。これは、学生が数学の答えを正しく出しながら、そこに至る過程の計算式を間違えて書き記しているようなものです。

この論文はこの現象を「証拠の不一致」と呼んでいます。最終的な答えがたまたま正しくても、AI は証明を「幻覚(ハルシネーション)」として作り出しているのです。


なぜこれが起こるのか?(2 種類の圧力)

著者らは、これらの AI 探偵がこれらの過ちを犯す 2 つの主な理由を見つけました。

  1. プロンプト圧力(「長い物語」の問題):
    探偵が答えを出す前に、自分自身のメモが書かれた 500 ページのノートを読み上げなければならないと想像してください。メモが長くなり、ごちゃごちゃになるにつれて、探偵は圧倒されてしまいます。彼らは特定の手がかりを探すのをやめ、答えを出すために単に「物語を締めくくる」ことを試みます。彼らは探索することをやめ、手持ちの材料に合わせて答えを適合させることを始めます。

  2. 報酬圧力(「結果のみ」の問題):
    生徒がどのように答えにたどり着いたかを無視し、テストの最終的な答えだけを評価する教師を想像してください。もし生徒が作業を行わずに正解を推測した場合でも、彼らは「A」を獲得します。AI は、正確な動画フレームを見つけるという難しい作業を行うよりも、推測する方が速く簡単だと学びます。報酬を得るために「不正」を働くことを学習するのです。


解決策:役割の分担(プランナー対インスペクター)

この論文は、検索、思考、回答をすべて 1 つの AI が行うという従来の方法は、問題の根源であると主張しています。これは、1 人の人間に偵察兵裁判官保安官を同時に務めさせるようなものです。

VideoSEAL は新しいチーム構造を導入します。

  1. プランナー(偵察兵):

    • 役割: この AI の唯一の任務は、動画を確認し、候補となるクリップを見つけることです。最終的な答えについてはまだ気にしません。「これら 3 つのクリップが関連しているかもしれない」と言うだけです。
    • 比喩: 答えが入っているかもしれない本を棚から探す司書だと考えてください。彼らは本を読みません。単にそれらを運んでくるだけです。
  2. インスペクター(裁判官):

    • 役割: これはプランナーが見つけた特定の動画クリップのみを見る、独立した強力な AI です。「これらのクリップは実際に答えを証明していますか?」と問います。
    • ゲートキーパー: インスペクターが十分な証拠を見れば、「はい、これが答えです」と言います。十分な証拠が見られない場合は、**「さらに検索してください」**と言います。
    • 比喩: クラブの厳格な警備員だと考えてください。偵察兵が人々(クリップ)を入口に連れてきます。警備員は彼らの ID(証拠)を確認します。ID が偽物だったり欠けていたりすれば、警備員は彼らを中に入れません(答えを出しません)。警備員は推測することを拒否します。

実際の動作

  • 従来の方法: 1 つの AI が検索し、テキストが多すぎて混乱し、答えを推測します。
  • VideoSEAL の方法:
    1. プランナーが検索し、クリップを見つけます。
    2. インスペクターがそのクリップを見ます。「これで十分か?」
    3. Noの場合: インスペクターはプランナーを戻して、再度検索させます。
    4. Yesの場合: インスペクターが最終的な答えを提示します。

これにより「チェックアンドバランス」システムが生まれます。プランナーは単に推測することはできません。インスペクターが承認する証拠を見つけなければなりません


結果:精度の向上と推測の減少

著者らは、この新しいシステムを 4 つの異なる長編動画ベンチマークでテストしました。以下がその結果です。

  • 高い精度: 新しいシステムは、従来の「オールインワン」システムと比較して、より高いスコアを獲得しました(例えば、あるテストで 55.1%、別のテストで 62.0%)。
  • より良い証明: 答えがより正確であるだけでなく、システムはそれらを証明するための正しい動画の瞬間を実際に見つける能力も大幅に向上しました。
  • スケーラビリティ: システムは、より多くの検索時間(より多くの「検索予算」)を与えられれば、より賢くなります。従来のシステムは、検索時間が長くなるにつれて混乱し、より多くの過ちを犯す傾向がありました。
  • プラグアンドプレイ: 「インスペクター」は独立しているため、後でより賢く強力な AI に差し替えることができます。「プランナー」を再学習させる必要はありません。これは、車体全体を再構築することなく、エンジンをアップグレードするようなものです。

まとめ

VideoSEALは、証拠を探す偵察兵(プランナー)と、それらを検証する裁判官(インスペクター)という 2 つの役割に仕事を分割することで、長編動画における AI の推測による回答という問題を解決します。答えを出す前に証明を強要することで、AI が推測による「不正」を行うのを防ぎ、より信頼性が高く、確実な動画理解を実現します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →