世界をただ観察するだけでなく、世界がどのように変化するかを想像できるコンピュータを想像してみてください。長年、人工知能は、マットの上に座っている猫や、通りに停まっている車といった、静止した画像を認識するように訓練されてきました。より最近では、これらのシステムは動画を生成することも学習しており、驚くほどリアルに見える動く映像を作り出せるようになっています。科学者たちは今、これらの動画生成AIが単に動きを模倣している以上の、より深いことを行っているのではないかと考えています。彼らは、マシンが物理世界のルール(重力、因果関係、そして物体がどのように相互作用するか)を理解し始めており、結果を示す前に一連の出来事を「思考」できるのではないかと問うているのです。この問いは、動画制作AIが真に推論できるのか、それとも単に妥当な結末がどのようなものかを推測しているに過ぎないのかを測定しようとする、新たな取り組みの中核に位置しています。
研究チームは、この問いに答えるために、「VGI-Bench」と呼ばれる新しいテスト場を構築しました。AIに単純な線で描かれた抽象的なパズルを解かせる代わりに、日常的なシーンのリアルな写真を与え、特定の論理的なルールに従って動画を生成するよう求めました。タスクは困難ですが実行可能なものとして設計されており、マシンにステップ・バイ・ステップでプロセスをシミュレートすることを要求しました。例えば、迷路の入り口にあるおもちゃの車の写真を見せ、壁にぶつからずに出口まで走る動画を生成させるようなものです。別のタスクでは、平らに展開された段ボール箱を見せ、それが3D形状へと折り畳まれていく様子をアニメーション化するよう求めます。研究者たちは単に最終的な画像を見るだけでなく、マシンがすべての瞬間においてルールに従っているかを検証するために、動画全体を精査しました。物体が壁を通り抜けたり、車がテレポートしたり、アイテムが消えたり再び現れたりしていないかなどをチェックしたのです。
現在利用可能な最も高度な動画生成モデルをテストしたところ、その結果は期待と限界が入り混じったものでした。最も優れた性能を示した「Seedance 2.0」というモデルでさえ、これらの厳格な条件下では、タスクの約半分しか正しく解くことができませんでした。AIは多くの場合、大まかな概念を捉えることはできましたが、一貫したストーリーを維持することには頻繁に失敗しました。多くの動画において物理法則が崩壊していました。例えば、傾いたノートパソコンの上に置かれたカップが転がり落ちなかったり、車が固い壁を直進して突き抜けたりといった現象です。また、マシンはルールに従うことにも苦労し、必要なステップを飛ばしたり、動画の途中で物体のアイデンティティを変えてしまったりすることもありました。最終的な結果が正しく見えたとしても、そこに至るまでの経路には不可能な動きが多く含まれており、モデルは最終的な状態を予測することには長けているものの、そこに至るまでの過程をシミュレートすることには乏しいことが示唆されました。
研究者たちは、なぜこれらの失敗が起こるのかを理解するために、さらに深く掘り下げました。彼らは、入力画像のスタイルが大きく影響することを発見しました。AIにリアルな写真を与えたときの方が、単純な線画を与えたときよりも高いパフォーマンスを示したことから、モデルは現実世界の画像に基づいて訓練されており、視覚的なスタイルが変わると苦戦することが分かります。また、彼らはAIが動画を作成する際、ステップ・バイ・ステップでどのように「考えて」いるのかについても調査しました。その結果、モデルは生成の過程で自らの間違いを修正しないことが判明しました。もしAIが動画生成の初期段階でエラーを起こすと、その誤った考えを修正するのではなく、その誤った考えを洗練させてしまう傾向があるのです。マシンは早い段階で仮説を固定してしまい、たとえその仮説が物理法則やタスクのルールに反していたとしても、それを磨き上げてしまうのです。
この研究は、動画生成モデルが視覚的コンテンツを作成するための強力なツールになりつつある一方で、人間が世界をナビゲートする際に用いるような、信頼できるステップ・バイ・ステップの推論能力をまだ備えていないことを示唆しています。それらは外見や単純な動きをシミュレートすることはできますが、時間が経過するにつれて物事が実際にどのように機能するかという、深く一貫した理解は欠いています。この新しいベンチマークは、現在のシステムが真の視覚的推論器には程遠いことを示す、このギャップを測定するための明確な方法を提供しています。モデルがどこで失敗するのか(物体を追跡すること、ルールに従うこと、あるいはエラーを修正することなど)を明らかにすることで、この研究は、未来を真に想像できる次世代の人工知能を構築するためのロードマップを提示しているのです。
技術要約: VGI-Bench: ビデオ生成モデルにおける視覚的知能の探査
1. 問題提起
近年の研究は、ビデオ生成モデルが単なる受動的な視覚シミュレーターから、生成されたフレームシーケンスを通じてゼロショット推論が可能な潜在的な「視覚的推論器」へと進化していることを示唆しています。しかし、既存のベンチマークには以下の3つの決定的なギャップが存在するため、この能力を評価することは依然として困難です。
- 分布の不一致(Distribution Mismatch): 多くのベンチマークは抽象的な図形や線画の入力を利用しており、これらは現代のビデオモデルが持つ自然画像の事前知識(priors)から逸脱しています。その結果、モデルの失敗は推論能力の限界ではなく、視覚ドメインの不一致を反映したものになってしまいます。
- プロセスへの感度の欠如(Lack of Process Sensitivity): 既存の視覚的推論タスクの多くは、モデルが入力から直接回答することを許容していたり、最終状態のみに焦лоうとしたりするため、モデルが妥当な中間軌道や進化するプロセスをシミュレートできるかどうかをテストできていません。
- 制御されていない難易度(Uncontrolled Difficulty): 現在のベンチマークには、極めて容易に解決できるタスクや、現在のモデルの実現可能な範囲を大きく超えたタスク(例:非視覚的な専門知識を必要とする、あるいは実用的なビデオの長さを超えるもの)が含まれており、診断的な評価を困難にしています。
2. メソドロジー: VGI-Bench
これらのギャップに対処するため、著者らは、ビデオ生成モデルの現在の能力境界における視覚的知能を評価するために設計された、27のタスクと810のインスタンスを含むベンチマークである VGI-Bench を導入します。
2.1 分類とタスク設計
本ベンチマークは、2レベルの分類を採用しています。
- タスクドメイン(相互排他的):
- 視覚的組織化 (Visual Organization): 視覚的属性に基づいてオブジェクトを配置、グループ化、または選択する。
- 物理的操作 (Physical Manipulation): 妥当な物理的相互作用を必要とするオブジェクトレベルのアクション(移動、積み重ね、道具の使用)。
- 構造化パズル (Structured Puzzles): 初期状態から目標状態へ変換するために、明示的な制約を必要とするルールに基づいたパズル。
- 時空間ダイナミクス (Spatiotemporal Dynamics): 状態の進化、順序、および時間的依存関係に関する推論。
- スキルタグ(非排他的): タスクには、空間 (Spatial)、時間 (Temporal)、計画 (Planning)、属性接地 (Attribute Grounding)、物理 (Physics)、トポロジー (Topology)、アフォーダンス (Affordance) といったタグが付与されています。
2.2 データ構築と品質管理
- 入力: モデルの事前知識と整合させるため、抽象的な線画を避け、フォトリアルなスタイルの入力(ウェブ画像またはGPT-Image-2のような画像モデルによって生成されたもの)を使用しています。
- プロセスへの感度: 成功は、単なる最終状態だけでなく、妥当な中間軌道とルールを維持した進化に依存します。
- 難易度の較正: 生成前の段階で、最先端(SOTA)モデルを用いてタスクのテストを行います。タスクは、少なくとも一つのモデルで解決可能であり、かつ少なくとも一つのモデルでは失敗する場合にのみ採用されます。これにより、困難でありながらも実現可能なレベルであることを保証しています。
- 評価指標:
- 完遂度 (Completeness - Comp.): 目標への進捗を評価するグローバルな指標(完了、部分的、失敗)。
- ルーブリック・スコア (Rubric Score - Rub.): ルールや制約の微細なチェックリストに対して、プロセスの妥当性を測定するローカルな指標。過渡的な違反を検出するために、適応的な粗から密へのフレームサンプリング戦略(4fpsから8fps)とスライディング・フォーカス・ウィンドウを使用します。
- 最終スコア: 完遂度とルーブリック・スコアの積であり、目標の失敗またはルールの違反のいずれかによってペナルティが課されます。
2.3 評価セットアップ
本ベンチマークは、幅広い商用モデル(例:Seedance 2.0, Sora 2, Veo 3.1)およびオープンソースモデル(例:Wan 2.7, HunyuanVideo 1.5)を評価します。自動VLMベースの判定器(Gemini-3-Flash)が使用され、その信頼性は人間によるアノテーションによって検証されています。また、静的なゴール状態の推論と、手続き的なビデオ生成を比較するために、タスクのサブセットが画像生成モデルにも適応されています。
3. 主な結果
- 全体的なパフォーマンス: 現在のモデルは創発的な推論能力を示していますが、信頼できる汎用的な視覚的知能には遠い状態です。最強のモデルである Seedance 2.0 でさえ、評価基準の下ではわずか 51.0% の精度しか達成していません。
- ドメインおよびスキル分析:
- 構造化パズル (Structured Puzzles) は最も困難なドメインであり、多段階のルール遵守と状態追跡における失敗を露呈させています。
- トポロジー (Topology) と 時間 (Temporal) のスキルは最も弱い次元であり、連結性の保持や多段階の状態追跡における困難さを示しています。
- 商用モデルは一貫してオープンソースモデルよりも優れた性能を示していますが、いずれのモデルも一貫した多段階の実行を維持することに苦慮しています。
- 失敗モード: 一般的な失敗には以下が含まれます:
- 物理的崩壊 (Physical Collapse): 非現実的な変形や重力の違反(例:傾斜した面を物体が転がり落ちないなど)。
- ルール違反 (Rule Violation): 視覚的に妥当な最終状態に到達しながらも、禁止されたアクションを実行したり、不可欠なステップをスキップしたりすること。
- オブジェクト/状態の不一致 (Object/State Inconsistency): オブジェクトの同一性や位置を時間の経過とともに保持できないこと(例:オブジェクトの消失や複製)。
- 入力への感度: パフォーマンスは入力の視覚的スタイルに強く依存します。オープンソースモデルは、フォトリアルな入力から線画入力に切り替えると大幅な性能低下を示しており、これは他のベンチマークにおける抽象的な入力が、推論の限界と視覚ドメインの不一致を混同している可能性を示唆しています。
- 合成データによるファインチューニングの転移: 大規模な合成抽象データ(VBVR)を用いたファインチューニングは、構造的に重複するタスクのパフォーマンスを向上させますが、重複しないタスクへの効果は限定的です。改善は、訓練分布の構造的なカバレッジによって制限される傾向があります。
- デノイジング・ダイナミクス: 中間デノイジング・ステップの分析により、限定的な自己修正能力が明らかになりました。モデルは推論エラーを修正するのではなく、初期の仮説を洗練させる傾向があります。「自己修正」(誤 → 正)は遷移の1%未満でしか発生せず、モデルは主に初期の(しばしば誤った)仮説を固定し、それを洗練させる傾向があります。
4. 意義と貢献
本論文は、主に3つの貢献を主張しています。
- VGI-Bench: ビデオモデルの現在の能力境界に合わせて設計された診断的ベンチマーク。現実的な入力、プロセスに敏感なタスク、および較正された難易度レベルを備えています。
- 広範な評価: 現代の生成モデル(画像およびビデオの両方)の包括的な評価を行い、彼らの創発的な推論能力を浮き彫りにすると同時に、汎用的な視覚的知能における重大な限界を明らかにしています。
- 多角的な分析: 失敗モード、入力感度、合成ファインチューニングの転移限界、およびデノイジング・軌道の内部ダイナミクスをカバーする、ビデオ推論行動の詳細な診断を提供しています。
著者らは、VGI-Benchが、視覚的な忠実度と真の視覚的推論を区別するための厳格な枠組みを提供し、物理的な一貫性、ルール遵守、自己修正メカニズムといった特定のボトルネックを特定することで、次世代のビデオ生成モデルの開発を刺激することを目的としています。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録