← 最新の論文
💻 computer science

VidNum-1.4K: A Comprehensive Benchmark for Video-based Numerical Reasoning

本論文は、現実世界のビデオコンテキストにおける複雑で多段階の数値的推論を実行する際の現在の視覚言語モデルの重大な限界を厳密に評価し、露呈させるために、3段階の階層構造で構成された1,379組のビデオ・質問ペアを特徴とする包括的な人間によるアノテーション済みベンチマーク、VidNum-1.4Kを導入するものである。

原著者: Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He

公開日 2026-07-20
📖 1 分で読めます☕ さくっと読める

原著者: Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは映画を観ているところだと想像してください。しかし、ただストーリーを楽しんでいるのではなく、物や出来事の数を数えたり、数量の差を計算したり、シーンが切り替わった後に群衆の人数が増えたのか減ったのかを判断する能力を試されています。これが**視覚言語モデル(VLM)**の世界です。これらのモデルを、画像や動画を「見て」、テキストを「読む」ことで、私たちと同じように世界を理解しようとする、超スマートなデジタル探偵だと考えてください。しばらくの間、これらのAI探偵は、「犬が走っています」と言うような、目に見えるものを描写することには非常に長くなってきました。しかし、科学者たちは疑問を抱いています。これらのAIは、本当にストーリーや時間の経過、そして物事がどのように変化するかという論理を「理解」しているのでしょうか?それとも、トレーニングデータから暗記したパターンに基づいて単に推測しているだけなのでしょうか?この問いは重要です。なぜなら、もしAIが物理的な世界を真に理解できないのであれば(例えば、カメラの角度が変わっても、リンゴ2個に3個を足せば5個になるということを理解できないのであれば)、複雑なタスクにおいてAIを信頼することはできないからです。

ここで、VidNum-1.4Kと呼ばれる新しい挑戦が登場します。これは、AI探偵がビデオにおける数値的推論ができるかどうかをテストするために特別に設計された、厳格な「最終試験」です。研究者のShaoyang Cui氏とそのチームは、AIに単に「見る」だけでなく、「数え、比較し、計算させる」ことを強いる、1,379個のビデオクリップと質問からなる膨大なコレクションを構築しました。彼らは、ビデオゲームのボス戦のように、難易度を3つのレベルに整理しました。レベル1は「イージーモード」で、AIは「この部屋には緑色のドアがいくつありますか?」といった単純なものを数えるだけです。レベル2では難易度が上がり、「黒い犬は無視して、茶色の犬は何匹いますか?」のように、カメラが異なる角度に切り替わっても特定の種類のものを数えることが求められます。レベル3は「ハードコアモード」で、マルチステップの論理を必要とします。例えば、サッカーの試合の最初のショットでプレイヤーを数え、次に特定の制約条件下での2番目のショットで再び数え、その後、これら2つの孤立したイベント間の論理的な比較や計算を行って答えを導き出すといった具合です。

この試験の結果は、少し衝撃的なものでした。強力なクローズドソースの「Gemini-1.5-pro」を含む最も高度なAIモデルでさえ、ステップバイステップで思考することを許可した場合でも、正解率は約**60%**にとどまりました。AI界のコミュニティ構築ツールであるオープンソースモデルは、さらに苦戦し、**25%から45%**のスコアしか出せませんでした。論文は、これらのモデルが、物事の挙動を理解する安定した「内部世界モデル」を構築しているのではなく、以前に聞いたことのある一般的なフレーズに基づいて推測するといった「ショートカット(近道)」に依然として依存していることを示唆しています。例えば、ビデオが新しいシーンに切り替わると、モデルはしばしばカウントを見失ったり、同じオブジェクトを二重に数えたりします。これは、彼らが動画の開始時の犬と終了時の犬が同じものであるということを真に把握していないことを示しています。

興味深いことに、研究者たちは、AIに「声に出して考える」(Chain-of-Thoughtと呼ばれる手法)よう指示することが、最も難しい論理パズルを解く助けにはなるものの、それによって、それまで正解していた簡単なカウントタスクでミスを犯してしまうことがあることを発見しました。これは、これらのモデルが高レベルの数学には長けてきている一方で、ビデオ内の動く物体を追跡する基本的な能力は依然として不安定であることを示唆しています。研究は、単にAIモデルを大きくすること(パラメータを増やすこと)は、複雑な論理には役立つものの、異なるビデオシーン間で物体を追跡することへの困難を魔法のように解決するわけではない、と結論づけています。VidNum-1.4Kは、厳しい、正直な鏡として機能しています。私たちのAI探偵たちが賢くなっている一方で、ダイナミックに変化する世界を真に理解できるようになるまでには、まだ長い道のりがあることを示しているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →