← 最新の論文
💬 NLP

Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

本論文は、LLM を活用してクエリを特定のツール呼び出しに分解し、ブール演算子を通じてその結果を統合する新しいキーフレーム検索手法「ToolMerge」を導入し、新たに提案された Molmo-2 Moments ベンチマークにおいて競争力のある性能を実証する。

原著者: Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

公開日 2026-05-25
📖 1 分で読めます☕ さくっと読める

原著者: Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

4 時間の長さの映画があると想像してください。そして、誰かがそれについて非常に具体的な質問をしてくるとします。例えば、「黄色いジャケットを着た男が川を渡る直前に何をしていましたか?」といった具合です。

もし、この質問に答えるために映画を最初から最後まで視聴しようとしたら、永遠にかかってしまいます。もし、いくつかのランダムなフレーム(写真アルバムをめくるようなもの)だけを拾い出そうとしたなら、正確な瞬間を見逃してしまう可能性が高いでしょう。これがこの論文が取り組む問題です:映画全体を見ることなく、答えを秘めた長い動画の正確な数秒をどのように見つけ出すか?

著者たちはToolMergeと呼ばれる新しいシステムを提案しています。これは、簡単なアナロジーを通じて説明される仕組みです。

1. 旧来の方法の問題点

以前のシステムはこの問題を 2 つの方法で解決しようとしましたが、どちらも欠点がありました。

  • 「万能型」アプローチ: 彼らは質問全体を 1 つの巨大な検索語句として扱いました。これは、図書館員に「黄色いジャケットを着て川を渡る男がいるページを探してください」と頼むようなものです。図書館員は川が描かれたページ、あるいは男が描かれたページを見つけるかもしれませんが、必ずしも正しい組み合わせを見つけるとは限りません。
  • 「硬直したチェックリスト」アプローチ: 彼らは質問を固定されたオブジェクトのリストに分解しようとしました(例:「男を探す」、「ジャケットを探す」、「川を探す」)。しかし、現実は厄介です。時には行動を探す必要があり、時にはオブジェクトを探す必要があり、時には特定の色を探す必要があります。硬直したチェックリストでは、そのニュアンスを見逃してしまいます。

2. 解決策:ToolMerge(賢い探偵)

ToolMerge は、事件を解決するために異なるツールを使いこなすことを知っている賢い探偵のように機能します。答えを 1 回の大きな飛躍で見つけ出そうとする代わりに、探偵は仕事を分解します。

ステップ 1:プランナー(頭脳)
まず、「プランナー」(AI 頭脳)が質問を読みます。文全体を検索するのではなく、質問をより小さく具体的なタスクに分解します。

  • アナロジー: 質問が「黄色いジャケットを着た男は何をしましたか?」である場合、プランナーは単に「黄色いジャケット!」と虚空に向かって叫ぶわけではありません。「よし、3 つのことが必要だ。1. 川があるシーンを見つける。2. 黄色い服を着た男を見つける。3. 水を渡る人を見つける」と言います。

ステップ 2:ツール(専門家)
プランナーはこれらの小さなタスクを、異なる「専門家」ツールに送信します。

  • ツール A (SigLIP): これはシーン専門家です。全体像を見て、一般的な雰囲気(例:「川」、「峡谷」)を見つけます。
  • ツール B (T-REN): これはオブジェクト専門家です。ズームインして具体的なもの(例:「男」、「黄色いジャケット」)を見つけます。
  • ツール C (OCR): これはテキストリーダーです。動画内の看板や画面に書かれている言葉を読み取ります。

ステップ 3:マージ(審判)
さて、各ツールは、自分の特定のタスクとの一致度に基づいて、動画のすべてのフレームに順位付けを行いました。「マージ」ステップは、これらの順位付けを組み合わせます。

  • 「AND」ルール: 質問が「川」と「男」の両方を必要とする場合、システムは両方のツールが高得点を与えたフレームを探します。これはベン図のようであり、答えは円が重なる真ん中に存在しなければなりません。
  • 「OR」ルール: 質問が「川を渡ったか、それとも橋を渡ったか?」と尋ねる場合、システムはどちらかの条件を満たすフレームを探します。

最後に、システムはこれらすべての組み合わされたルールに基づいて最も高得点だったトップ 3 から 8 フレームを選び出し、実際の答えを出すための最終的な「回答者」AI に引き渡します。

3. 新しいテスト:Molmo-2 Moments (M2M)

彼らのシステムが機能することを証明するために、著者たちは既存のテストが不公平であると気づきました。古いテストには、推測や動画のランダムな部分を見るだけで答えられるような質問が含まれていました。

彼らは**Molmo-2 Moments (M2M)**と呼ばれる新しいテストを構築しました。

  • アナロジー: 映画の特定の 10 秒のクリップのみに基づいてテストを作成する教師を想像してください。その教師は、その 10 秒で何が起きたかを正確に知っています。もし学生が正しく答えられれば、彼らは必ずその特定の 10 秒を見ていたことになります。映画の残りの部分から推測することはできなかったはずです。
  • これにより、システムが正解を出した場合、実際に正しいフレームを見つけ出したことが保証されます。

4. 結果

ToolMerge をテストしたところ、以下の結果が得られました。

  • 複数のオブジェクトや動作を含む複雑な質問において、以前の手法よりも正しいフレームを見つける能力が優れていました。
  • キャプション検索において特に優れたパフォーマンスを発揮しました。シーンに関する長く詳細な説明(キャプション)をシステムに与えると、ToolMerge は古い手法と比較して、その説明に一致する正確な動画クリップを見つける能力がはるかに優れていました。
  • また、特定の報酬システム(GRPO)を使用してプランナーを少し「訓練」すると、どのツールを使用すべきかをさらに良く理解できるようになることも示されました。

まとめ

ToolMergeは、長い動画の質問に対する答えを一度に推測しようとするシステムではありません。代わりに、それはプロジェクトマネージャーのように機能します。質問を小さく具体的なタスクに分解し、それらのタスクを異なる専門ツールに送り、その後、結果を組み合わせることで、真実を秘めた動画の正確な数秒を見つけ出します。彼らは、答えが特定の瞬間にロックされている、より厳格な新しいテストを作成することで、それが機能することを証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →