UniVideo: Unified Understanding, Generation, and Editing for Videos
UniVideoは、ビデオの理解、生成、および編集を単一のマルチモーダル指示パラダイムの下に統合する多才なデュアルストリームフレームワークであり、最先端の性能を達成するとともに、タスクの合成や画像編集データからのゼロショット転移といった新たな能力を可能にします。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、動画を見て何が起きているかを伝え、ゼロから新しい動画を作り出し、さらにあなたの指示を聞くだけで既存の動画を編集できる、超スマートなアシスタントを雇ったと想像してみてください。
これまで、ほとんどのAIアシスタントは「特化型の作業員」のようなものでした。あるものは動画を見ることに長けていますが動画を作ることはできず、別のものは優れたビデオディレクターですが複雑な指示を理解できず、また別のものは熟練のエディターですが、あらゆる仕事に対して専用のツールを必要としていました。
UniVideoは、これらすべての仕事を一つのパッケージでこなす「スイスアーミーナイフ(十徳ナイフ)」のようなアシスタントを雇うようなものです。以下に、簡単な比喩を用いてその仕組みを説明します。
1. 二つの脳によるシステム
論文では、UniVideoが「デュアルストリーム(二系統)」のデザインを採用していることが説明されています。これは、二つの専門化された脳が協力して働いているようなものです。
- 「理解する脳」(MLLM): これは、非常に博識な司書のようなものです。あなたの指示を読み、参照写真を確認し、動画を視聴します。物語、文脈、そして論理を理解します。「晴れたビーチ」がどのようなものか、「探偵の帽子」が何を意味するかを知っています。
- 「創造する脳」(MMDiT): これは、熟練の画家や特殊効果アーティストのようなものです。言葉を読むことは得意ではありませんが、生の素材を取り込み、それらを動く映像へと描き出すことには並外れた才能を持っています。
魔法のつながり: 「理解する脳」があなたのリクエストを読み取り、「創造する脳」に対して詳細な計画をささやきます。すると「創造する脳」が、シャツの質感や車の動きといった細部がリアルで一貫したものになるよう、動画を描き上げます。
2. 何ができるのか?
これら二つの脳が共に訓練されているため、UniVideoは、タスクごとに異なるアプリを用意することなく、非常に幅広いタスクをこなすことができます。
- ディレクター: 「ハワイアンシャツを着てビーチに座っている男性の動画を作って」と言えば、それを生成します。
- エディター: 動画をアップロードして「男性のシャツを緑色に変えて」や「男性をこの写真の人物に入れ替えて」と指示すれば、それを実行します。
- ストーリーテラー: 動画を見せて「ここで何が起きているの?」と尋ねれば、シーンの詳細を説明してくれます。
- 「思考」モード: これは特別な機能です。時には、あなたの指示が乱雑だったり、図解が混ざっていたりすることもあります。例えば、「この写真の上にラフなスケッチを描いて、これを実現させて」といった具合です。「理解する脳」は、あなたの乱雑な描画を理解し、「創造する脳」が従うべき明確な計画へと変換します。
3. 「ゼロショット」のスーパーパワー
論文が主張する最もクールな点の一つは、UniVideoが明示的に教えられていないことでも実行できるという点です。
子供に写真の編集(公園の背景を砂漠に変えるなど)を教えたと想像してください。その後、公園の動画を見せて「背景を砂漠に変えて」と頼んだとします。たとえ「動画の編集方法」を具体的に教えていなくても、その子は「背景を変える」という概念を理解しているため、やり方を編み出すかもしれません。
UniVideoもこれと同じことができます。このモデルは画像の編集について集中的に訓練されていますが、動画の編集(天候を変えたり、物体の素材を変えたりするなど)を求められた際、その知識を転用します。あらゆる種類の編集に対して個別の「動画編集クラス」を受ける必要はなく、画像から学んだことを動画の世界に応用しているのです。
4. 何が違うのか?
従来のモデルは、仕事に合わせて適切な道具を選ばなければならない「道具箱」のようなものでした。動画を編集したいなら特定の「動画エディター」ツールが必要であり、動画を生成したいなら「ジェネレーター」ツールが必要でした。
UniVideoは、ユニバーサルリモコンのようなものです。ボタンを一つ押す(一つの指示を与える)だけで、デバイスはそれが「見る」「作る」「編集する」のどれを行うべきかを判断し、完璧に仕事を遂行します。論文では、この「ユニバーサル(汎用的)」なアプローチが、特に複数のタスクを組み合わせたい場合(キャラクターのスタイルを変えながら動画を編集するなど)において、専用のツールを使うよりも優れていることが示されています。
要約すると: UniVideoは、あなたの願いを理解するためのスマートな「読者」と、それを形にする才能ある「芸術家」を使い、自ら新しいコツを掴みながら、動画を見、作り、編集することができる単一のAIモデルなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。