← 最新の論文
💻 computer science

Bernini: Latent Semantic Planning for Video Diffusion

Bernini は、MLLM ベースのプランナーが ViT 埋め込み空間で意味論的推論を行い、DiT ベースのレンダラーを誘導するという分業体制を活用した統合ビデオ生成・編集フレームワークであり、効率的な個別学習やセグメント対応 3D 回転位置符号化のような新規コンポーネントを通じて最先端のパフォーマンスを達成する。

原著者: Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、Bernini論文の説明を、比喩を用いた日常言語に翻訳したものです。

大きなアイデア:建築家と建設業者

あなたが注文住宅を建てたいと想像してください。あなたには2人の専門家が必要です。

  1. 建築家(MLLM): この人はあなたの漠然としたアイデアを理解し、複雑な設計図を読み解き、どのような家が完成すべきかを考えることに長けています。彼らは推論能力に優れていますが、実際にレンガを積むことには全く不向きです。
  2. 建設業者(拡散モデル): この人は熟練職人です。レンガを積み、壁を塗り、窓を取り付けることを、写真のようなリアルさで完璧にこなせます。しかし、単に「きれいにしてください」と言われただけでは、あなたがコテージを望んでいるのに城を建ててしまうかもしれません。彼らは非常に具体的な指示を必要とします。

Berniniは、この2人の専門家をつなぐシステムです。建築家にレンガを積ませたり、建設業者に複雑な推論をさせたりするのではなく、Berniniは彼らが互いに話すための専門的な言語を提供します。

仕組み:「秘密の設計図」

過去には、これら2種類のAIを組み合わせようとする試みは散漫でした。Berniniは「分業」を導入することでこれを解決します。

  1. 計画フェーズ(建築家):
    あなたがBerniniに「天気を嵐の夜に変えて、犬を幸せにして」といった命令を与えると、MLLMプランナーは直接動画を描こうとしません。代わりに、それは建築家が高レベルの設計図をスケッチするのと同じ役割を果たします。

    • 秘密のソース: この設計図は画像でも文章でもありません。それはシーンの意味を表す数学的なコード(「ViT 埋め込み」と呼ばれる)のセットです。これは、建築家が建設業者に絵や図面ではなく、座標と感情的なトーンの一覧を手渡すようなものです。
  2. レンダリングフェーズ(建設業者):
    DiT レンダラー(建設業者)はこの設計図を受け取ります。また、編集を行っている場合は元の動画も参照して、背景の一貫性を保ちます。設計図をガイドとして使い、フレームごとに実際のピクセルを生成し、写真のようなリアルな動画を完成させます。

なぜこれが優れているのか? 建築家と建設業者は別々に訓練できるからです。建築家は人間の言語を理解する能力を高め続け、建設業者は美しい画像を作る能力を向上させ続けます。彼らが互いに必要なのは、この「秘密の設計図」言語を読み解く方法だけであり、システム全体を最初から再訓練するよりもはるかに容易です。

新しいツール:「ネームタグ」と「思考のステップ」

これを完璧に機能させるために、研究者たちは2つの巧妙な工夫を加えました。

  • 「ネームタグ」システム(SA-3D RoPE):
    想像してみてください。全員が同じ服装をした大勢がいる部屋で、「赤い帽子の人のほうを見て」と叫んだとします。もし赤い帽子を被っている人が3人いたら、それは混乱を招きます。
    動画編集において、AIはしばしば元の動画参照画像、そして新しい動画を同時に扱う必要があります。ある場合、元の動画のピクセルと新しい動画のピクセルが全く同じ位置にあることがあります。
    Berniniはパズルのすべてのピースに**「ネームタグ」**(セグメントインデックス)を付けます。これにより、AIに「この赤い帽子は元の動画に属し、あの赤い帽子は新しい動画に属する」と伝えることができます。これにより、AIが混乱してソースと結果を混同することを防ぎます。

  • 「思考の発声」ステップ(Chain-of-Thought):
    時には、単純な命令だけでは不十分な場合があります。「カートゥーンのように見せて」と言っても、AIは単に色を変えるだけかもしれません。
    Berniniのプランナーは、設計図を描く前に思考を声に出すように訓練されています。タスクを分解するのです。「まず、照明を理解する必要がある。次に、肌の質感を変える必要がある。最後に、動きを調整する必要がある」。この段階的な推論により、AIは複雑なタスク、例えば動画内の火が自然に消えるように天候を変えるような(因果推論)処理をこなせるようになります。

何ができるのか?

論文は、Berniniが動画のための「スイスアーミーナイフ」であることを示しています。以下が可能になります。

  • テキストから動画へ: 説明に基づいてゼロから動画を生成する。
  • 動画から動画への編集: 既存の動画のスタイルを変更したり、オブジェクトを追加・削除したり、天候を変えたりする。
  • 参照ガイド付き編集: 「この動画の人物を、この写真の人物のように見せて」。
  • モーション転送: 「この写真の人物を、この動画の人物のように踊らせて」。

結果:レースの勝利

研究者たちは、Berniniを彼らが作成した新しいベンチマークBernini-Benchにおいて、Kling や Wan などの他のトップクラスの動画 AI モデルと対比してテストしました。

  • スコア: Bernini は「動画編集リーダーボード」で優勝し、一貫性と指示の遵守において競合他社を凌駕しました。
  • 決定的な勝利: 特に動画の一貫性を保つことにおいて優れていました。動画の一部を編集しても、残りの部分は歪んだり不具合を起こしたりしません。要求された部分のみを変更しつつ、元のシーンに忠実な状態を維持します。

まとめ

Berniniは、完璧な指示書を書く天才建築家を雇い、それを熟練した建設業者に渡すようなものです。彼らが専門的な「設計図言語」で話し合い、動画のどの部分がどれであるかを追跡するためのツールを与えられることで、Berniniは美しいだけでなく、複雑で論理的な変化を理解できる賢さを持った動画を生成します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →