← 最新の論文
💻 computer science

StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization

StateFlowは、生成的なプレビジュアライゼーションのための状態中心のフレームワークであり、シーンの構造、ダイナミクス、およびカメラの軌道を反復的に洗練させることを可能にするために、永続的で編集可能な3Dワールド状態を構築、進化、およびアクセスすることで、ワンショット合成の限界を克服するものである。

原著者: Yuyang Yin, Zixiang Li, Longxuan Deng, Hongkai Li, Shifang Zhao, Junnan Liu, Weirong Huang, Mengyu Wang, Tianxiao Fu, Yikai Wang, Peng-Shuai Wang, Xiaojie Jin, Yao Zhao, Yunchao Wei

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Yuyang Yin, Zixiang Li, Longxuan Deng, Hongkai Li, Shifang Zhao, Junnan Liu, Weirong Huang, Mengyu Wang, Tianxiao Fu, Yikai Wang, Peng-Shuai Wang, Xiaojie Jin, Yao Zhao, Yunchao Wei

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは物語を伝えようとしていると想像してください。ただし、言葉を書く代わりに、粘土や玩具、段ボール箱を使って映画のシーンを組み立てるのです。現実世界の映画制作、ゲームデザイン、建築の世界では、クリエイターは指を鳴らすだけで完成した映画を手に入れるわけではありません。彼らは「プリビジュアライゼーション(事前視覚化)」と呼ばれる、泥臭くも魔法のような中間ステップを経ます。これは、監督やデザイナーが、実際に何百万ドルもの費用を投じて本番制作を行う前に、俳優を動かしたり、照明を変えたり、カメラアングルをテストしたりできるデジタルな砂場のようなものです。長い間、コンピュータは単純な文章から美しい画像や短い動画を作ることは得意でしたが、この「砂場」での作業は苦手としてきました。もしあなたがコンピュータに「ロボットを左に動かして」と頼むと、コンピュータはしばしば、ロボットが以前どこにいたかを忘れ、背景を奇妙にしてしまったりしながら、単にロボットが別の場所にいる新しい絵を描いてしまうだけなのです。それは、指一本を変えたいだけなのに、彫刻を一度溶かして新しい粘土を注ぎ直して編集しようとするようなものです。研究者たちが問い続けてきた大きな疑問は、「どうすればコンピュータに、すべてを記憶する、編集可能な持続的(パーシステント)な『世界』を与えることができるのか? つまり、単にシーンを眺めるだけでなく、クリエイターが実際にその中で遊べるようにするにはどうすればいいのか?」ということです。

そこで、ゲームのルールを変えることでこの問題を解決しようとする新しいシステム、StateFlowが登場しました。StateFlowは、コンピュータに「動画を生成せよ」と一度に混乱を招くような指示を出すのではなく、まず**持続的な3D世界の状態(ワールド・ステート)**を構築するよう求めます。これは、テーブルの上に組み立てられたままの状態のデジタル・レゴセットのようなものです。何かを変えたいとき、全体を溶かし直すのではなく、特定のブロック(オブジェクト)を手に取って、動かしたり、入れ替えたりするだけで、他の部分は元の場所に留まったままなのです。

StateFlowがどのようにこれを行っているのか、3つの楽しいステップに分けて説明します。

1. 世界の構築(状態構築:State Construction)
例えば、月面にSF基地を作りたいとしましょう。単にコンピュータに「月面基地を描いて」と頼むと、正面からのクールな絵は描けるかもしれませんが、建物が宙に浮いていたり、歩いて回った時のレイアウトが意味をなさなかったりするかもしれません。StateFlowは賢明にも、二つの角度から同時にシーンを見ることで解決します。一つはオブジェクトがどのように見えるかを見るための正面図、もう一つはオブジェクトが地面のどこに位置するかを見るための鳥瞰図です。そして、システムは超スマートな審判のように振る舞い、正面図と鳥瞰図が一致しているかを確認します。もし正面図が「ロボットが3体いる」と言っているのに、鳥瞰図には2体分のスペースしかない場合、システムはその矛盾を修正します。これにより、すべてのオブジェクトが現実の場所、形、そしてアイデンティティを持つ、堅実な3D世界が構築され、動かしたり操作したりする準備が整います。

2. 物語の変化(状態進化:State Evolution)
世界が構築されたら、クリエイターは「よし、今度は宇宙船が墜落するぞ!」とか「ベース全体を1980年代風にしよう」といった指示を出せます。従来の動画生成モデルは、キャラクターを見失ったり背景がグリッチを起こしたりしながら、ゼロから新しい動画を幻視(ハルシネーション)しようとします。しかし、StateFlowは世界を「生きたデータベース」として扱います。それは、すべてのオブジェクトとその特性を記した「状態テーブル(ステート・テーブル)」を更新していきます。もし宇宙船が墜落したら、システムは月全体を描き直すのではなく、宇宙船のエントリを「現在はスクラップの山である」と更新し、おそらくその位置も変更します。もしスタイルを変えたいなら、シーン全体の「色」や「素材」のタグを更新するだけです。これにより、世界は起こったすべてのことを記憶するため、物事が変化しても物語の一貫性が保たれます。

3. 映画を見る(状態アクセス:State Access)
最後に、基地の中を飛び回るドローンのようなクールなカメラアングルでシーンを見たいとします。もし単にコンピュータに「カメラを飛ばして」と頼むと、コンピュータは3Dジオメトリを「見て」いないため、壁に衝突したり空を向いたりしてしまうかもしれません。StateFlowは「レンダー・フィードバック」ループを使用します。まずカメラの経路を予測し、次にその経路がどのような見た目になるか、小さなプレビューを素早くレンダリングします。もしカメラが建物に衝突しそうであれば、システムはその衝突をプレビュー内で検知し、カメラを安全な場所へと自動的に押し戻します。この「予測・確認・修正」のサイクルを、カメラの経路が完璧になるまで繰り返すことで、そのショットが3D世界の中で実際に可能なものであることを保証します。

結果が示すこと
著者らは、動画や3Dシーンを生成する他の手法とStateFlowを比較テストしました。その結果、他の手法はオブジェクトが消えたり、形が変わったり、離れていったりする(時空間的不整合)ことがよくありましたが、StateFlowは世界を安定させることができました。テストにおいて、StateFlowはオブジェクトの見た目を時間の経過とともに維持することや、論理的なレイアウトを維持することにおいて高いスコアを記録しました。このシステムは、プリビジュアライゼーションを単なる動画制作ではなく、持続的な3D状態の管理として扱うことで、クリエイターがより多くのコントロールを得られることを示唆しています。クリエイターは、この同じ世界を使って映画の絵コンテを作成したり、映画のショットを計画したり、あるいはインタラクティブなゲームレベルのプロトタイプを作成したりすることができるのです。

このシステムは大きな前進ではありますが、著者はこれがまだ「魔法」ではないことも指摘しています。他のAIモデルに重労働を依存しているため、ビデオゲームのようなリアルタイムで即時的なインタラクションを行うには、まだ十分な速さに達していません。しかし、これは、私たちがAIがアートを作るのをただ眺めるのではなく、AIが構築した世界の中に足を踏み入れ、そこで遊べるようになるという、有望な未来を示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →