← 最新の論文
💻 computer science

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation

Vorch-IRは、駆動ビデオ、参照画像、およびテキスト指示に共同で条件付けることで、長尺ビデオにおけるオプションの背景編集を伴う柔軟な単一および二人の人物のアイデンティティ置換を可能にし、自動合成パイプラインを通じてデータの不足を克服し、時間的なオーバーラップ推論戦略を介して分単位の生成へと拡張する、LTX2上に構築された統合マルチモーダルフレームワークである。

原著者: Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、現実を操るリモコンを手にしていると想像してみてください。ただし、チャンネルを変えるのではなく、脚本、カメラアングル、ダンスの動きはそのままに、映画の登場人物を入れ替えたいと考えています。これが「ビデオ・アイデンティティ・リプレイスメント(動画における身元置換)」という、人工知能の世界で熱い注目を集めている夢の技術です。長い間、AIはゼロから新しい動画を生成することはできましたが、既存の動画を編集することは、照明や動きを崩すことなく実写映画のキャラクターの顔を変えようとするような、非常に困難な作業でした。初期の試みでは、AIに対して、その人がどこに立っているかを示す詳細なマップや、ポーズを示す骨格図、あるいは顔を覆うためのマスクを手渡す必要がありました。それはまるで、シェフに対して、あらかじめカットされた材料のリストとキッチンの図解を与えて初めて料理を作らせることができる、というようなものでした。これらの手法は硬直的で、使いにくいものでした。現在、研究者たちが問いかけている大きな疑問は、「『左側のダンサーをこの写真の人と入れ替えて』という単純な文章を理解させれば、複雑なマップや骨格を必要とせずに、AIがそれを直感的に実行できるのではないか?」ということです。

ここで、Vorch-IRという、超スマートで魔法のような映画編集者のように振る舞う新しいAIシステムの登場です。これは、スクリプト・スーパーバイザーもスタントコーディネーターも必要としないディレクターのようなものです。あなたはVorch-IRに3つのものを与えます。元の動画(「ドライビング」ビデオ)、新しく挿入したい人々の数枚の写真(「リファレンス」)、そして誰をどこへ配置するかを指示する単純なテキストのメモです。魔法のポイントは、写真がビデオのポーズや位置と一致している必要がないことです。もしビデオの中で人が腕を上げて踊っていて、あなたの写真ではその人が座っていたとしても、Vorch-IRは、その座っている人をどのように踊らせるかを理解します。このモデルは、単独の人物、二人でのダンス、さらには背景の景色を入れ替えることさえも、一つの単一のモデルですべてこなします。

Vorch-IRの開発者は、LTX2と呼ばれる強力なビデオ生成器の上にこのシステムを構築しました。彼らは、AIにビデオ、写真、そしてテキストの指示を同時に見つめるよう学習させました。硬直したマップを使う代わりに、AIは「ビジョン・ランゲージ(視覚と言語)」の脳(画像と言葉の両方を理解するタイプのAI)を使用して、その繋がりを理解します。それは、AIがあなたのメモを読み、写真を見て、「ああ、この人を左側にいる人の代わりにするのだな」と理解し、内部の「セルフアテンション(自己注意機構)」を用いて、新しい顔を動いている体に完璧に融合させるようなプロセスです。

この分野における最大の障壁の一つはデータです。AIに顔の入れ替えを教えるには、何千もの「前後」の動画の例が必要です。これらは現実世界には存在しないため、チームはロボットによるパイプラインを構築しました。彼らは実際のビデオを取り込み、他のAIツールを使用して最初のフレームで顔を入れ替え、その後、モーション誘導型のロボットを使用して、残りのビデオが新しい顔に従うようにしました。そして、AIが誤ってダンサーに3本の腕を与えてしまうような失敗作をフィルタリングすることで、完璧なトレーニングセットを作成しました。これにより、一つのモデルで、一人の入れ替え、二人の入れ替え、さらには背景の変更まで、個別のツールを必要とせずにすべてを行うことが可能になりました。

では、映画一本を作るとなるとどうでしょうか? ほとんどのAIビデオ生成器は、数秒経つと混乱したり、映像がぼやけたりします。Vorch-IRは、「テンポラル・オーバーラッピング・インファレンス(時間的な重なりを持つ推論)」と呼ばれる巧妙なトリックを使用しています。長い壁画を描こうとしている場面を想像してください。小さな正方形を一つずつ描き、乾かしてから次の部分を描く(そうすると色の違いが生じる可能性がある)のではなく、Vorch-IRは重なり合うセクションを同時に描き、それらをシームレスに融合させます。これにより、動画を一つずつクリップごとに生成することなく、キャラクターの顔が漂ったり動きがおかしくなったりすることなく、丸一分間のビデオを生成することができます。

チームは、Vorch-IRを他のトップクラスのAIモデルと比較テストを行いました。直接対決の比較において、Vorch-IRは、新しい人物の顔を写真通りに正確に保つこと(アイデンティティの保持)や、背景の一貫性を保ちつつ滑らかに動かすことにおいて優れていることが示されました。人間によるテストでも、人々は他の手法よりも、特に新しいキャラクターをリアルかつ物理的に妥当に見せるという点において、Vorch-IRの結果を好みました。論文は、一部の古いモデルの方が、非常に特定のシナリオにおける完璧なポーズのマッチングなどの特定の事項においてはわずかに優れている可能性があるものの、Vorch-IRはより柔軟で統一された方法でビデオを編集できることを示唆しており、素晴らしい結果を得るために複雑なマップは必要ないことを証明しました。これは、ビデオの編集が、一文をタイピングするのと同じくらい簡単になる未来への一歩です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →