← 最新の論文
💻 computer science

ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation

ShotVerseは、VLMベースのプランナーと特化したコントローラーを活用し、新たに精選された高忠実度データセットに支えられた「Plan-then-Control(計画してから制御する)」フレームワークを導入することで、テキストプロンプトからの精密かつ一貫した自動的なシネマティックなマルチショット動画生成を可能にします。

原著者: Songlin Yang, Zhe Wang, Xuyi Yang, Songchun Zhang, Xianghao Kong, Taiyi Wu, Xiaotong Zhao, Ran Zhang, Alan Zhao, Anyi Rao

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Songlin Yang, Zhe Wang, Xuyi Yang, Songchun Zhang, Xianghao Kong, Taiyi Wu, Xiaotong Zhao, Ran Zhang, Alan Zhao, Anyi Rao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

誰もが言葉でシーンを記述するだけで映画監督になれる世界を想像してみてください。長年、人工知能はこれらの記述を動く映像へと変換することを学習し、猫が歩いたり車が走ったりする短いクリップを作り出してきました。この技術は、ビデオ制作という行為をすべての人に身近なものにしました。しかし、単一の連続したクリップを作ることと、一本の映画を作るということの間には、大きな隔たりがあります。実際の映画は、単一の長いショットではありません。それは、それぞれが独自のカメラアングル、動き、タイミングを持つ、さまざまな異なるショットの集合体なのです。映画業界において、カメラがどのように動くかを決定する人物、すなわち撮影監督は、脚本家と同じくらい重要です。彼らは、いつズームインするか、いつ風景をパン(横移動)するか、あるいは、効果的に物語を伝えるために、いつワイドビューからクローズアップへと切り替えるかを選択します。現在のAIは「カメラを左に動かせ」といった単純な指示に従うことはできますが、マルチショットによる複雑で調和のとれたダンスのような動きを理解することは困難です。ショットが変わるごとにカメラの動きの一貫性を保つことに失敗したり、監督の曖昧なアイデアを精密でプロフェッショナルなカメラパスへと翻訳できなかったりすることがよくあります。

香港科技大学とテンセントビデオの研究チームは、この特定の問題を解決するために、「ShotVerse」と呼ばれる新しいシステムを開発しました。彼らの研究は、書かれたストーリーに基づいて、さまざまなカメラショットのシーケンスを計画し実行できる、プロの撮影監督のように振る舞うようAIに教えることに焦点を当てています。AIにテキストのみからカメラの動きを推測させたり、人間がすべてのカメラパスを手動で描かせたりするのではなく、研究者たちは2段階のプロセスを作成しました。まず、「プランナー(計画者)」がストーリーを読み、各ショットでカメラがどのように動くべきかを正確に判断します。次に、「コントローラー(制御器)」がそれらの具体的な計画を用いて、実際のビデオを生成します。彼らの成功の鍵は、単なるソフトウェアではなく、学習に使用したデータにありました。映画を作る方法を学ぶためには、AIが、ストーリー、カメラパス、そして最終的なビデオが完璧に一致している何千もの例を見る必要があることに、彼らは気づいたのです。

この基盤を構築するために、チームは高品質な映画、テレビ番組、ドキュメンタリーから2万個以上のクリップを収集しました。これらのクリップには、複数のカメラカットを含む複雑なシーケンスが含まれていました。研究者たちは、これらのクリップを分析し、各ショットでカメラが辿った正確なパスを抽出する新しい手法を生み出しました。彼らはこれらのパスを単一の統一された座標系に整列させ、一つのショットにおける動きが次のショットとの関係において整合性が取れるようにしました。このプロセスにより、「ShotVerse-Bench」と呼ばれる大規模な新しいデータセットが作成され、これがAIの訓練場となりました。このデータを用いて、彼らは2部構成のシステムを訓練しました。大規模な視覚言語モデルを使用するプランナーは、「都市のスカイラインの劇的な演出」といった記述を読み取り、カメラが辿るべき正確な3Dパスを自動的に生成することを学習します。それはストーリーを個々のショットに分解し、角度、距離、およびそれぞれの動きを決定します。そしてコントローラーは、これらのパスを受け取り、シーンの視覚的な品質と一貫性を維持しながら、計画通りにカメラが動くようにビデオを生成します。

このアプローチの結果は極めて重要です。テストにおいて、このシステムはカメラの指示に従う精度の高いマルチショットビデオを生成することができ、推測や単純なテンプレートに頼っていた従来の手法を大きく上回りました。生成されたビデオは、ショット間のスムーズな遷移や、シーケンス全体を通じた一貫したカメラの挙動を備え、映画的なテンポを明確に理解していました。研究者たちは、カメラの動きの計画とビデオの生成を分離することで、以前は不可能であったレベルの制御が可能になることを発見しました。システムは、被写体を追跡しながら後退する、あるいは空間の感覚を失うことなくワイドショットからクローズアップへと切り替えるといった、複雑なシナリオを巧みに処理できました。また、AIが映画の「文法」を学び、単にカメラをどう動かすかだけでなく、効果的に物語を伝えるためにどう動かすかを理解していることも実証されました。

この研究は、AIとビデオ制作に対する私たちの考え方の転換を意味しています。それは、単にランダムまたは静的な動きを生成することを超えて、人間の映画製作を反映した、より構造化され意図的なアプローチへと移行しています。研究者たちは、適切な種類のデータ、つまりストーリー、カメラ計画、そして視覚的出力がすべて一致しているデータを提供することで、映画的なカメラ制御という複雑なタスクを自動化できることを示しました。現在、このシステムは複数のショットを含む単一のシーンに焦点を当てていますが、この手法の成功は、AIがより長く複雑な物語の作成を支援できる未来を示唆しています。この研究は、適切なツールとデータがあれば、人工知能が映画製作の芸術における真の協力者となり、クリエイターがストーリーそのものに集中できるように、カメラの動きという技術的な詳細を担うことができるということを裏付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →