← 最新の論文
🤖 AI

VGI-Bench: Probing Visual Intelligence in Video Generation Models

本論文は、ビデオ生成モデルの視覚的推論能力を厳格に評価するために設計された、27のタスクと810のインスタンスからなる包括的なベンチマークであるVGI-Benchを紹介し、Seedance 2.0のような最先端のシステムでさえわずか51.0%の精度しか達成できず、生成プロセスにおける信頼性の高い自己修正に苦慮していることを明らかにしている。

原著者: Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie
公開日 2026-08-27
📖 1 分で読めます☕ さくっと読める

原著者: Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

世界をただ観察するだけでなく、世界がどのように変化するかを想像できるコンピュータを想像してみてください。長年、人工知能は、マットの上に座っている猫や、通りに停まっている車といった、静止した画像を認識するように訓練されてきました。より最近では、これらのシステムは動画を生成することも学習しており、驚くほどリアルに見える動く映像を作り出せるようになっています。科学者たちは今、これらの動画生成AIが単に動きを模倣している以上の、より深いことを行っているのではないかと考えています。彼らは、マシンが物理世界のルール(重力、因果関係、そして物体がどのように相互作用するか)を理解し始めており、結果を示す前に一連の出来事を「思考」できるのではないかと問うているのです。この問いは、動画制作AIが真に推論できるのか、それとも単に妥当な結末がどのようなものかを推測しているに過ぎないのかを測定しようとする、新たな取り組みの中核に位置しています。

研究チームは、この問いに答えるために、「VGI-Bench」と呼ばれる新しいテスト場を構築しました。AIに単純な線で描かれた抽象的なパズルを解かせる代わりに、日常的なシーンのリアルな写真を与え、特定の論理的なルールに従って動画を生成するよう求めました。タスクは困難ですが実行可能なものとして設計されており、マシンにステップ・バイ・ステップでプロセスをシミュレートすることを要求しました。例えば、迷路の入り口にあるおもちゃの車の写真を見せ、壁にぶつからずに出口まで走る動画を生成させるようなものです。別のタスクでは、平らに展開された段ボール箱を見せ、それが3D形状へと折り畳まれていく様子をアニメーション化するよう求めます。研究者たちは単に最終的な画像を見るだけでなく、マシンがすべての瞬間においてルールに従っているかを検証するために、動画全体を精査しました。物体が壁を通り抜けたり、車がテレポートしたり、アイテムが消えたり再び現れたりしていないかなどをチェックしたのです。

現在利用可能な最も高度な動画生成モデルをテストしたところ、その結果は期待と限界が入り混じったものでした。最も優れた性能を示した「Seedance 2.0」というモデルでさえ、これらの厳格な条件下では、タスクの約半分しか正しく解くことができませんでした。AIは多くの場合、大まかな概念を捉えることはできましたが、一貫したストーリーを維持することには頻繁に失敗しました。多くの動画において物理法則が崩壊していました。例えば、傾いたノートパソコンの上に置かれたカップが転がり落ちなかったり、車が固い壁を直進して突き抜けたりといった現象です。また、マシンはルールに従うことにも苦労し、必要なステップを飛ばしたり、動画の途中で物体のアイデンティティを変えてしまったりすることもありました。最終的な結果が正しく見えたとしても、そこに至るまでの経路には不可能な動きが多く含まれており、モデルは最終的な状態を予測することには長けているものの、そこに至るまでの過程をシミュレートすることには乏しいことが示唆されました。

研究者たちは、なぜこれらの失敗が起こるのかを理解するために、さらに深く掘り下げました。彼らは、入力画像のスタイルが大きく影響することを発見しました。AIにリアルな写真を与えたときの方が、単純な線画を与えたときよりも高いパフォーマンスを示したことから、モデルは現実世界の画像に基づいて訓練されており、視覚的なスタイルが変わると苦戦することが分かります。また、彼らはAIが動画を作成する際、ステップ・バイ・ステップでどのように「考えて」いるのかについても調査しました。その結果、モデルは生成の過程で自らの間違いを修正しないことが判明しました。もしAIが動画生成の初期段階でエラーを起こすと、その誤った考えを修正するのではなく、その誤った考えを洗練させてしまう傾向があるのです。マシンは早い段階で仮説を固定してしまい、たとえその仮説が物理法則やタスクのルールに反していたとしても、それを磨き上げてしまうのです。

この研究は、動画生成モデルが視覚的コンテンツを作成するための強力なツールになりつつある一方で、人間が世界をナビゲートする際に用いるような、信頼できるステップ・バイ・ステップの推論能力をまだ備えていないことを示唆しています。それらは外見や単純な動きをシミュレートすることはできますが、時間が経過するにつれて物事が実際にどのように機能するかという、深く一貫した理解は欠いています。この新しいベンチマークは、現在のシステムが真の視覚的推論器には程遠いことを示す、このギャップを測定するための明確な方法を提供しています。モデルがどこで失敗するのか(物体を追跡すること、ルールに従うこと、あるいはエラーを修正することなど)を明らかにすることで、この研究は、未来を真に想像できる次世代の人工知能を構築するためのロードマップを提示しているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →