← 最新の論文
💻 computer science

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling

LongVT は、ネイティブなツール呼び出しを活用してグローバルからローカルへの「マルチモーダル・ツール思考連鎖」プロセスを実行し、新たにキュレーションされた大規模データセット(VideoSIAH)と既存のベースラインを大幅に上回る 3 段階のトレーニング戦略によって支えられた、長動画推論を強化するエンドツーエンドのエージェントフレームワークです。

原著者: Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan Li, Lidong Bing

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan Li, Lidong Bing

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、LongVT論文の説明を、日常的な言葉と創造的な比喩を用いて翻訳したものです。

大きな問題:「干し草の山の中の針」動画

2 時間の映画を与えられ、非常に具体的な質問をされたと想像してください。「43 分目の時点で、主人公が靴を結んでいたとき、履いていた靴下の色は何色でしたか?」

もし要約を読んだり、いくつかのランダムなスクリーンショットをちらりと見ただけで答えようとしたら、おそらく間違ってしまうでしょう。これが現在の AI モデルが長い動画で直面する問題です。特定の瞬間をじっくりと見ることなく、動画全体を一度に覚えようとするため、実際には見ていない詳細を捏造する「幻覚(ハルシネーション)」を起こしがちなのです。

解決策:LongVT(「探偵」AI)

著者たちは、新しいシステムLongVTを開発しました。動画全体を記憶しようとする代わりに、LongVT は探偵人間の研究者のように振る舞います。

それがどのように機能するか、簡単な比喩を使って説明します。

1. 「粗いスキャン」(図書館での検索)

巨大な図書館で特定の本を探していると想像してください。すべての本のすべてのページを読むわけではありません。まず、通路を歩きながら背表紙をちらりと見て、本があるかもしれない概ねのセクションを見つけます。

  • 論文では: LongVT はまず動画の「グローバルなスキミング」を行います。動画全体に散らばった数枚のフレームを見て、何が起こっているかの大まかなイメージを得ます。

2. 「ツール呼び出し」(虫眼鏡)

探偵が「靴を結んだのは台所のシーンだったに違いない」と考えたら、単に推測するだけではありません。虫眼鏡を取り出し、その特定の台所のシーンにのみズームインして詳しく調べます。

  • 論文では: これが「ネイティブなツール呼び出し」です。LongVT には crop_video という組み込みツールがあります。答えが 40 分から 45 分の間にあると考えたら、実際にその 5 分のチャンクを動画から切り取り、高詳細で再検討します。

3. 「自己修正」(「待てよ、もう一度確認しよう」という瞬間)

時には、探偵が間違った場所をズームインしてしまうこともあります。靴を結んだのは台所だと思っていたのに、実はリビングだったかもしれません。

  • 論文では: 論文は、LongVT が「おっと、間違った時間ウィンドウを見てしまった。そこには靴がない」と気づくことができることを示しています。そして「もう一度試そう」と言って、ツールを 2 回目に呼び出し、異なる時間(例えば 41 分ではなく 43 分)を見ます。これはiMCoTT(Interleaved Multimodal Chain-of-Tool-Thought:交互マルチモーダル・ツール思考連鎖)と呼ばれます。

訓練:AI が考える方法を学んだ過程

AI に「探偵になれ」と言うだけで機能するわけではありません。著者たちは、3 段階の訓練プロセスを通じてそれを教えました。

  1. コールドスタート(教室): まず、VideoSIAHと呼ばれる彼らが作成した巨大なデータセットを使って、AI に基礎を教えました。このデータセットには「干し草の山の中の針」のような質問が満載です。彼らは AI に、時間を推測し、動画を確認し、自己修正する方法の例を示しました。これは、学生を放り出す前に図書館のカタログの使い方を教えるようなものです。
  2. 強化学習(練習アリーナ): 次に、AI に自分で練習させました。正しい時間を推測し、正解を得るたびに「報酬」を与えました。間違えたり幻覚を起こしたりした場合は報酬を与えませんでした。これにより、より正確になることを学びました。
  3. 洗練(マスタークラス): 最後に、練習アリーナでの AI の最良の試行を取り出し、それらを新しいレッスンとして再び教えました。これによりスキルが定着し、より速く、より信頼性のあるものになりました。

結果:新しい種類の「思考」

この論文は、このアプローチが AI が長い動画を扱う方法を変えると主張しています。

  • 従来の方法: AI は動画を「記憶」しようと試み、圧倒されるため、しばしば事実を捏造(ハルシネーション)します。
  • LongVT の方法: AI は自分が知らないことを認め、証拠を見つけに行き(動画を切り取って)、証拠を確認し、その後に答えます。

結論:
LongVT は、記憶から答えを「推測」しようとするのをやめた AI です。代わりに、答えを探す方法を学びます。長い動画を干し草の山のように扱い、道具を使って針を見つけ、話す前に作業を再確認します。これにより、精度が大幅に向上し、見たことについて嘘をつく可能性が低くなります。

論文はまた、これだけの余分な「検索」を行っているにもかかわらず、AI は実際には他のモデルよりも速いと指摘しています。それは、見ていないことについて長い嘘の物語を書く時間を無駄にしないからです。ただ真実を見つけ、答えるだけです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →