VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
VideoCoCoは、実行可能なBlenderコードをプロセスレベルの思考の連鎖(chain of thought)として活用し、決定論的な時空間ドラフトを生成した後にそれをフォトリアルな出力へと洗練させることで、物理的に一貫したビデオを生成するエージェンティックなデュアルエンジンフレームワークを導入しており、物理的一貫性のベンチマークにおいて既存のベースラインを大幅に上回っています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに「おいしく作って」と囁くだけで、ケーキの作り方を教えようとしている場面を想像してみてください。ロボットは「おいしい」という言葉は理解できるかもしれませんが、レシピがなければ、卵を小麦粉の前に混ぜるべきか、どのくらいの時間焼くべきか、あるいはなぜケーキがレンガのようになってはいけないのかさえ分かりません。これが、現在の人工知能(AI)動画生成の世界における苦闘です。科学者たちは、テキストによる記述を動く映像に変換できるモデルを構築していますが、これらのAI「夢想家」は、しばしば物理法則に苦戦します。ボールが下に落ちる代わりに上に浮いてしまったり、地面に落ちる前にグラスが砕けたりするのは、AIが世界の仕組みを真に理解しているのではなく、出来事のシーケンスを「推測」しているからです。
これを解決するために、研究者たちは、AIに実行する前に「考えさせる」方法、すなわち**思考の連鎖(Chain-of-Thought)**と呼ばれる概念を探求しています。最終的な画像へ直接飛び込むのではなく、AIに中間的な計画を作成することを促すのです。それは、家を建てる前に設計図を描く建築家や、料理をする前にレシピを書くシェフのようなものです。大きな疑問は、「どのような設計図が最適か?」ということです。言葉のリストでしょうか? 粗いスケッチでしょうか? それとももっと精密なものでしょうか? これこそが、AI生成ビデオを単に見た目が美しいだけでなく、現実のルールに従わせることを目的とした論文『VideoCoCo』が解こうとしているパズルなのです。
「Code-as-CoT」の魔法:二つのエンジンのドリームチーム
物理法則を壊さないビデオを作るために、超スマートなディレクターと才能あるアーティストが協力して働く新しいシステム、VideoCoCoをご紹介しましょう。研究者たちは、AIがテキストプロンプトだけでシーンの進化を推測しようとすると、しばしば「ストーリー」を間違えてしまうことに気づきました。そこで、彼らはAIに新しいツールを与えました。それが**実行可能なコード(executable code)**です。
プロセスを次のように考えてみてください:
- ディレクター(コーディング・エージェント): あなたが「熱いフライパンの中でバターが溶ける」といったプロンプトを与えると、ディレクターは単にそのシーンを想像するだけではありません。代わりに、Blenderプログラム(コンピュータへの一連の指示)を書き出します。このコードは、厳格で壊すことのできないレシピのようなものです。これはコンピュータに対して、「ここにバターの塊を置く。熱を入れる。バターを正確に5秒間で柔らかくし、形を崩し、広がるようにせよ」と明示的に指示します。これはコードであるため、書かれた通りに実行されなければなりません。それは推測ではなく、シミュレーションなのです。
- サンドボックス(シミュレーション・エンジン): コンピュータはこのコードを「サンドボックス」と呼ばれる安全で隔離された遊び場で実行します。その結果は、まだ綺麗な映画ではありません。それは**決定論的なドラフト(下書き)**です。低品質な、白い粘土のアニメーションを想像してください。それはプレイ・ドー(粘土)で作られた粗いスケッチのように見えますが、動きに関しては完全に正確です。コードが物理法則に従うよう強制しているため、バターは物理学が定める通りに正確に溶けます。
- アーティスト(生成ビデオ・エンジン): ここで、二つ目のエンジンが登場します。これは、その粗い白い粘土のスケッチを受け取り、その上に色を塗って高精細な映画のように仕上げるアーティストです。アーティストはすでに完璧な「プレイ・ドー」版をコピーとして持っているため、バターがどのように動くべきかを推測する必要はありません。彼らはただ、それを光沢があり、黄金色で、美味しそうに見せることに集中するだけです。
なぜこのアプローチがゲームチェンジャーなのか
この論文は、従来の手法は一度に多くのことをやりすぎようとしていたと主張しています。あるAIモデルはテキストによる計画(例:「バターが溶ける」)を書こうとしましたが、テキストは曖昧です。また別のモデルは、ビデオの次のフレームを推測しようとしましたが、それは前のぼやけた写真を見ながら傑作を描こうとするようなものです。
VideoCoCoはこう言います。「物理学を推測するのはやめなさい。ただシミュレートするのです。」
コードを「思考の連鎖(Chain-of-Thought)」として使用することで、このシステムは動きの「論理」と画像の「美しさ」を分離します。コードは「何がいつ起こるか」を扱い、ビデオ・エディターは「それがどのように見えるか」を扱います。これは、推測ゲームを、最初のステップが100%信頼できる二段階のプロセスへと変えるため、大きな転換となります。
証拠はプリンの中に(そして物理学の中に)
研究者たちは、彼らのシステムを二つの主要な課題、PhyGenBenchとVBench-2.0でテストしました。これらは、AIが重力、熱、物質の挙動といった現実世界のルールに従っているかをテストするための、AI向けの試験のようなものです。
- 結果: VideoCoCo以前、ベースラインとなるAI(OmniWeavingと呼ばれます)は、物理テストにおいて平均0.475を記録していました。「Code-as-CoT」システムを追加した後、スコアは0.558に上昇しました。もう一つのテスト(VBench-2.0)では、スコアは**52.18%から77.88%**へと急上昇しました。
- 「アハー!」の瞬間: 最大の改善が見られたのは、AIが最も失敗しやすい領域、すなわち熱力学(熱や溶解など)と物質力学(物の壊れ方や流れ方)でした。これは、コードによるドラフトが、単にビデオをより美しく見せているだけでなく、AIに物理学の仕組みを実際に教えていたことを証明しています。
この論文が否定していること
VideoCoCoが「何ではないか」を理解しておくことも重要です。論文では、何百万ものビデオから物理学を「学習」するために、単に巨大なAIを訓練すればよいという考えに対して明確に反対しています。彼らは、明示的で実行可能な計画(コード)がなければ、AIは依然として出来事のシーケンスを正しく行うことに苦労することを発見しました。また、単に粗いテキストによる計画やいくつかのキーフレームを持っているだけでは不十分であり、計画はコンピュータが実際に実行してドラフトを作成できる実行可能なコードである必要があることも示しています。
課題と未来
結果は素晴らしいものですが、論文は限界についても正直に述べています。このシステムは、コードを書き、シミュレーションを実行し、それからビデオに色を塗らなければならないため、現在は少し時間がかかります。それは、優れた建築家と画家がいるものの、写真を撮るよりも少し時間がかかるようなものです。また、システムはBlenderシミュレーターの複雑さに制限されるため、渦巻くような混沌とした水のような非常に複雑なものは、現時点では完璧にシミュレートするのが難しい可能性があります。
しかし、著者たちは、この「Code-as-CoT」アプローチがAIの考え方における強力な新しい方法であることを示唆しています。AIが魔法のように世界を理解することを期待するのではなく、まず世界を構築するためのツールを与え、その強固な基礎に基づいて芸術を生み出させるのです。これは、時に美しいものを作り出すための最善の方法は、まず正しく機能するものを作ることである、ということを思い出させてくれます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。