← 最新の論文
💻 computer science

MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation

MARQUIS は、クエリ拡張、構造化証拠抽出、制御された記事生成を通じて複雑なクエリ処理や複数動画の合成における限界に対処し、MAGMaR2026 共有タスクで最先端のパフォーマンスを達成する、3 段階のパイプラインであり、動画検索拡張生成を大幅に強化する。

原著者: Debashish Chakraborty, Dengjia Zhang, Jialiang Jin, Hanting Liu, Katherine Guerrerio, Hanxiang Qin, Tyler Skow, Alexander Martin, Reno Kriz, Benjamin Van Durme

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Debashish Chakraborty, Dengjia Zhang, Jialiang Jin, Hanting Liu, Katherine Guerrerio, Hanxiang Qin, Tyler Skow, Alexander Martin, Reno Kriz, Benjamin Van Durme

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大な嵐や政治選挙のような複雑な出来事について詳細なニュース記事を書くよう命じられたジャーナリストだと想像してください。しかし、現場に特派員は一人もいません。代わりに、数百台の異なるカメラによって記録された、その出来事の10 万本もの異なる動画クリップを収蔵する図書館を持っています。あなたの仕事は、適切なクリップを見つけ、それらで実際に何が起きたかを特定し、各事実を証明した動画が正確にどれであるかを引用して、一貫性のある物語を執筆することです。

これがMARQUISシステムが取り組む課題です。この論文は、現在の AI ツールはこの特定の作業が苦手だと主張しています。質問が複雑な場合、適切な動画を見つけられないか、一度にあまりにも多くの動画を読み込もうとして圧倒され、幻覚(事実無根の作り話)を起こしてしまいます。

MARQUIS は、3 段階のニュースルームの組立ラインのように動作することでこの問題を解決し、巨大な作業を小さく管理可能なステップに分解します。

ステージ 1: 探偵の捜索(検索)

問題点: 「2025 年の選挙結果についてすべて教えてくれ」と AI に尋ねると、標準的な検索エンジンが混乱する可能性があります。それは、その長い質問全体を単一の「検索コード(埋め込み)」に変換しようとし、ニュアンスを見逃してしまうことが多いのです。それは、藁の山全体を一度に説明することで、その中にある特定の針を見つけようとするようなものです。

MARQUIS の解決策:
MARQUIS は、大きな事件を小さな手がかりに分解する探偵のように、一度に大きな検索を行うのではなく、以下のように動作します。

  1. 分解: 大きな質問を 20 以上もの小さく具体的な質問に分解します(例:「リベラル党は何議席を獲得したか?」「有権者投票率はどれくらいか?」「どの地区が政党交代したか?」)。
  2. 並列検索: 動画ライブラリを、それら一つひとつの小さな質問に対して個別に検索します。
  3. 融合: 小さな質問ごとに発見された動画のリストをすべて集め、1 つのマスターリストに統合します。
  4. 再ランク付け: 最後に、専門の「動画審査員」が上位候補を確認し、最も関連性の高いものが最上位に来るように順序を再付けします。

結果: この方法は、藁の山全体がどこにあるか推測するのではなく、特定の針を見つけるために拡大鏡を使用するようなものです。これにより、システムが適切な動画を見つける能力は、スコア0.195 から 0.759へと大幅に向上しました(劇的な飛躍)。

ステージ 2: 事実確認者(情報抽出)

問題点: 動画が手に入っても、動画ファイル全体をライターに与えるだけでは不十分です。ライターには具体的な事実が必要です。また、動画は厄介な場合があります。時には人が嘘をついて何かを言ったり、カメラアングルが誤解を招いたりすることもあるからです。

MARQUIS の解決策:
MARQUIS は単に動画を「読む」のではなく、特定の「主張」を抽出し、それを較正します。

  1. 3 種類のメモ:
    • 一般メモ: 「赤いコートを着た女性が話している。」(後で役立つ可能性がある事実)。
    • ターゲット主張: 「この動画では 50 人の救出が示されている。」(質問に直接答える事実)。
    • Q&A: システムが動画に具体的な質問をし、回答を得ます。
  2. 較正(嘘発見器): これが重要なステップです。ライターが主張を見る前に、「較正器」モデルがその主張と元の動画を並べて確認します。「この動画は本当にこの文を証明しているか?」と問いかけます。確率スコア(0 から 1)を割り当てます。動画が主張を裏付けていなければ、それはフィルタリングされて除外されます。

比喩: これは、記者が書いたすべての文を読み、それを元の映像に戻って検証する事実確認チームのようです。映像が一致しなければ、その文はゴミ箱に捨てられます。

ステージ 3: ライター(記事生成)

問題点: 良い事実があっても、滑らかな記事を書くのは困難です。ライターに 500 の無関係な箇条書きを与えると、散漫なリストを書いてしまうかもしれません。2 時間の動画の書き起こしを与えると、細部に埋もれて主要な点を忘れ去ってしまうかもしれません。

MARQUIS の解決策:
システムは記事を書く 3 つの方法を提供しますが、最も優れているのは構造化されたアプローチを使用するものです。

  1. クラスタリング: 検証済みの事実をテーマ別にグループ化します(例:「犠牲者数」、「救助活動」、「政府の対応」)。
  2. 要約: 各テーマについて、引用付きの短い文を作成します。
  3. 磨き上げ: これらの文を繋ぎ合わせて、滑らかで読みやすいニュース記事にし、すべての事実に引用(例:[動画 #45, 0:12-0:15])が含まれていることを確認します。

「再帰的」オプション(MARQUIS-RLM):
論文はまた、特別な「マネージャー」AI(再帰的言語モデルに基づく)も紹介しています。これは単に一度書くのではなく、永続的なノートを持ったプロジェクトマネージャーのように動作します。

  • 手元にある事実を確認します。
  • 「北部地区の犠牲者数が抜けている」と気づきます。
  • ステージ 1 と 2 に戻り、その不足情報を具体的に要求し、それをノートに追加して矛盾がないか確認します。
  • ノートが完全に揃い、矛盾がなくなってから、最終記事を書きます。

結論

この論文は、問題を分解することによって—より賢く検索し、事実を厳格に検証し、執筆プロセスを整理することで—MARQUIS は現在の手法よりもはるかに優れた結果を生み出すと主張しています。

  • 検索: 適切な動画を以前よりもはるかに多く見つけました。
  • 生成: 一貫性があり、出典が明確であるため、人間による評価が高く(ベースラインの 3.09 に対し 3.83/5)、記事が生成されました。
  • 信頼性: このシステムは「グラウンディング(根拠に基づくこと)」を設計思想としており、動画証拠に裏付けられていない事実を書くことを拒否し、他の AI システムで一般的な「幻覚」を回避します。

要するに、MARQUIS は、単一の圧倒されたライターではなく、高度に組織化された多段階のニュースルームのように動作することで、10 万本もの混沌とした動画の山を、信頼性が高く出典が明確なニュース記事へと変換します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →