← 最新の論文
🤖 AI

ViMax: Agentic Video Generation

ViMaxは、協調的なマルチエージェント・コラボレーション、階層的なナラティブ・エンジン、および依存関係を考慮した視覚的一貫性メカニズムを採用することで、長編で物語構造を持つビデオにおいてキャラクターや環境の一貫性を維持することに関する現行手法の限界を克服する、エージェンティックなビデオ生成フレームワークである。

原著者: Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

動画を使って、長くて複雑な物語、例えば短編映画のようなものを作りたいと想像してみてください。現在、ほとんどのAI動画ツールは、才能はあるものの「注意力が散漫な俳優」のようなものです。人が歩いている5秒間の美しいクリップを作ることはできますが、もし同じ人物がさまざまな部屋を通り、友人と話し、顔や服装を変えずに10分間の映画を作るよう頼んだら、AIは混乱してしまいます。キャラクターの目が突然茶色から青に変わったり、シーンの間にキッチンが森に変わってしまったりすることもあります。

ViMaxは、この問題を解決するために設計された新しいシステムです。これは単一の俳優ではなく、専門化されたAIエージェントのチームによって運営される、高度に組織化された映画制作会社だと考えてください。

ViMaxがどのように機能するかを、簡単な比喩を用いて説明します。

1. 「ディレクターズ・ルーム」(階層的な物語計画)

もし、たった一つのAIに映画の脚本全体を一度に書かせようとしたら、そのAIは圧倒されてしまい、最後まで到達する頃には最初の方のことを忘れてしまうでしょう。

  • ViMaxの解決策: ViMaxは、物語をマトリョーシカのように分解します。
    • まず、大きな「イベント」(映画の始まり、中間、終わりなど)のアウトラインを作成します。
    • 次に、それらのイベントを「シーン」に分解します。
    • そして最後に、シーンを個々の「ショット」(カメラアングル)に分解します。
  • 秘訣: AIが細かいディテールに集中している間に全体像を忘れてしまわないように、ViMaxは**デジタルライブラリ(検索拡張生成:RAG)**を使用します。新しいシーンを計画するたびに、AIは元のストーリーをライブラリで「調べ直し」、キャラクターが誰であるか、プロットがどのような内容であるかを自分自身に思い出させます。これにより、最初から最後まで一貫したストーリーが保たれます。

2. 「コンティニュイティ部門」(視覚的一貫性)

実際の映画製作では、シーン1でキャラクターが赤い帽子を被っていたら、シーン10でも赤い帽子を被っていなければなりません。青いソファに座っていたら、そのソファはずっと青いままです。現在のAIツールは、こうした詳細を忘れてしまうことがよくあります。

  • ViMaxの解決策: ViMaxは**依存関係マップ(グラフベースの視覚的依存関係)**を使用します。
    • すべてのショットを繋ぐフローチャートを想像してください。もしショット5がショット2と似ている必要があるなら、システムはそれらをリンクさせます。
    • ショット5を生成するとき、AIは単に推測するのではなく、ショット2の実際の画像をリファレンスとして使用します。これは、キャラクターの顔が全く同じに見えるように、前のスケッチの上になぞって描くアーティストのようなものです。
  • 「カメラ移動」のトリック: 異なる角度から見たときに部屋が同じに見えるように(例:キャラクターを左側から見た後、右側から見る)、ViMaxはまず**トランジション・ビデオ(遷移動画)**を生成します。カメラが一方の角度からもう一方の角度へスムーズに移動する動画を先に作り、その滑らかな動きの中から必要なショットを切り出します。これにより、3D空間(家具、壁など)の一貫性が保証されます。

3. 「品質管理チーム」(VLMベースの選択)

時として、AIは見た目は悪くないものの、手が6本あるといった奇妙なグリッチ(不具合)を含む動画を生成してしまうことがあります。

  • ViMaxの解決策: 全てのショットに対して、ViMaxは単に一つを作るのではなく、複数の候補を作成します(同じポーズで5枚の写真を撮るようなものです)。
  • その後、「判定役」となるAI(視覚言語モデル:VLM)がそれらすべてをチェックし、脚本に最も合致し、最もリアルに見える最高の一枚を選び出します。これにより、最高品質のクリップだけが最終的な映画に組み込まれるようになります。

何を証明したのか?

研究者たちは、キャラクターや設定の一貫性を保ちながら、多くのショット(最大13ショット連続)を含む動画を作成できるかという課題を課した新しいベンチマーク、ViMax-Benchを用いてViMaxをテストしました。

  • 結果: ViMaxは、キャラクターの見た目を維持し、ストーリーを成立させるという点で、既存の手法(Sora、Veoなど)を上回る性能を示しました。
  • トレードオフ: このような計画やチェックを行っているため、より多くの計算能力と時間を要しますが、その結果、より一貫性のある長い動画が得られます。

まとめ

ViMaxは、即興劇のソロパフォーマンス(AIがその場の思いつきで作り、しばしば筋書きを忘れてしまうもの)から、プロの映画クルー(監督、脚本家、コンティニュイティ・マネージャーが協力して、ストーリーが論理的に流れ、俳優がすべてのシーンで同じに見えるようにするもの)へのアップグレードと言えます。

論文で言及されている限界事項:

  • 実際の描画や動画作成を行うために、他の強力なAIモデルに依存しています。
  • 非常に混雑したシーンや、複雑な相互作用(例:二人でハイタッチをするなど)には依然として苦戦する可能性があります。
  • 音声やダイアログ(台詞)の同期はまだ扱えません。
  • このような一貫した動画生成技術を、偽の出来事の作成や人物のなりすましに使用することに関する倫理的な懸念があるため、著者らは安全性のチェックが必要であると示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →