← 最新の論文
💻 computer science

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

Omni-Customizer は、音声漏洩などの課題を解決し、最先端のマルチモーダルカスタマイズを実現するために、Omni-Context Fusion、Masked TTS Cross-Attention、Semantic-Anchored Multimodal RoPE といった新規モジュールを導入することで、複数の被写体にわたって一貫した視覚的アイデンティティと声質を維持しつつ、精密な音声・動画の同時生成を可能にするエンドツーエンドのフレームワークです。

原著者: Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

複数の俳優を使って映画のシーンを撮影しようとしている監督だと想像してください。台本はありますが、俳優Aが必ず雇った特定の人物のように見え、その独特の声と全く同じように聞こえることを確認する必要があります。同時に俳優Bも自分自身について同じことを守らなければなりません。カメラが混乱すれば、俳優Aの顔が動きながら俳優Bの声が話されるような事態になり、最悪の場合、シーンノートで描写しただけの台本にないセリフを俳優たちが話し始めてしまうかもしれません。

これがまさにOmni-Customizerが解決する問題です。これは、複数の人物が話し合い、交流するビデオを作成し、それぞれの外見と声を完璧に維持するように設計された新しい AI システムです。

以下に、簡単な比喩を用いてその仕組みを分解して説明します。

1. 問題:「混乱した監督」

従来の AI ツールは、ビデオ作成は得意でも、音声作成は得意でも、複数の人物を同時に扱おうとすると混乱していました。

  • 取り違え: AI が誰が話しているのかを間違える可能性があります。赤いシャツの男性が女性のセリフを話すようなことが起こり得ます。
  • 「幽霊」の声: 時折、AI がシーンの描写を誤って音声化してしまいます。「男性は背が高い」と書けば、AI がそのキャラクターに実際には台本にない「私は背が高い」と言わせてしまうのです。
  • ドリフト: ビデオが進むにつれて、キャラクターの顔や声が徐々に変化し、アイデンティティを失うことがあります。

2. 解決策:「Omni-Customizer」ツールキット

研究者たちは、これらの問題を修正するための 3 つの主要な「ツール」を持つシステムを構築しました。

A. 「スーパーコネクタ」(Omni-Context Fusion)

AI の脳を、テキスト用、画像用、音声用という異なる部署を持つ組織だと考えてください。通常、これらの部署は互いに非常に遅く、間接的にしか会話しません。

  • 解決策: Omni-Customizer は、すべての部署を同じテーブルに座らせて即座に会話させる「スーパーコネクタ」を構築します。人物の描写、写真、音声サンプルを、ビデオ生成が始まる前に一つに緊密に融合させます。これにより、AI は「この顔、この声、そしてこの名前がすべて同じ人物に属している」と理解するようになります。

B. 「ネームタグ」システム(Semantic-Anchored RoPE)

いくつかの顔、いくつかの声、いくつかの言葉というパズルのピースの山があると想像してください。それらを箱に放り込むだけでは、混ざり合ってしまいます。

  • 解決策: システムは「SA-MRoPE」と呼ばれる特別な「ネームタグ」を使用します。これは、台本内の「Subject 1」という単語に、「Face A」と「Voice A」のパズルピースを物理的に直接貼り付けます。パズルのピースに磁気タグを付けて、間違った人物に浮遊して付着することを防いでいるようなものです。これにより、3 人や 4 人がいる混雑したシーンであっても、AI が誰が誰かを混乱することがなくなります。

C. 「サイレンスボタン」(Masked TTS Cross-Attention)

AI が誤ってシーンの描写を話してしまったという問題を思い出してください。

  • 解決策: 研究者たちは「MTP-CA」という「サイレンスボタン」を設置しました。AI に「<S>(開始)と<E>(終了)タグ内の言葉だけを話せ」と指示します。天気やキャラクターの服装などの描写は厳密に無音にされます。AI は音声生成時に説明的なテキストを無視することを強制されるため、舞台指示を誤って声に出して読むことがなくなります。

3. 訓練:「ジムでのトレーニング」

このシステムを教えるために、研究者たちはすべてのデータを一度に投げつけるのではなく、賢いトレーニングスケジュールを使用しました。

  • 「音声のみ」ドリル: 時には、AI はビデオを気にせず、音声のみ(声を聞いて言語を学ぶ)で練習します。これにより、混乱することなく多くの言語を話せるようになります。
  • 「ビデオ・音声」ドリル: 別の時には、ビデオと音声を完璧に一致させる(リップシンク)練習を行います。
  • 「易から難」の階段: まず AI に 1 人が話すことだけを教えました。それをマスターしたら、2 人、そして最終的には複数の人物が同時に話す複雑なシーンへと進みました。この段階的なアプローチにより、AI が圧倒されるのを防ぎました。

4. 結果

テストされたところ、Omni-Customizer は以下のことを証明しました。

  • 長い会話であっても、顔と声を一貫して維持できる。
  • 「幽霊の声」の問題(描写が話されること)を防ぐことができる。
  • これまでのどのオープンソースモデルよりも、複数の人物が関わる複雑なシーンを処理できる。

要約すると: Omni-Customizer は、どの俳優が誰かを決して見失うことのない、非常に組織化された映画クルーのようです。彼らは俳優たちが実際のセリフだけを話すことを保証し、最初の瞬間から最後の瞬間まで、声と顔を一定に保ちます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →