← 最新の論文
💻 computer science

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

Unison は、意味誘導型音声デカップリングと双方向クロスモーダル強制戦略を通じて動き、音声、効果音を明示的に調和させることで、正確な時間的整合性と音響明瞭さを保証し、最先端の人間中心型音声・動画生成を実現する統合フレームワークである。

原著者: Shihao Cheng, Jiaxu Zhang, Quanyue Song, Shansong Liu, Zhizhi Guo, Xiaolei Zhang, Chi Zhang, Xuelong Li, Zhigang Tu

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Shihao Cheng, Jiaxu Zhang, Quanyue Song, Shansong Liu, Zhizhi Guo, Xiaolei Zhang, Chi Zhang, Xuelong Li, Zhigang Tu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが雨の中でギターを弾きながら歌う俳優を演じる映画のシーンを監督していると想像してください。完璧な世界では、歌、ギターのカッティング、そして雨の音がすべて正確なタイミングで起こり、美しく自然な体験として融合します。

しかし、これらのビデオを作成しようとする現在の AI ツールは、しばしば苦労します。俳優の声がギターの音や雨の音をかき消すほど大きくなったり、俳優の唇が歌詞ではなくギターの音符に合わせて動いたりすることがあります。まるで、歌手が楽器の上で叫び、ドラマーがリズムを外して演奏しているバンドのようです。

この論文は、これらの問題を解決するための新しい AI フレームワーク「Unison(ユニソン:共に行動すること)」を紹介します。Unison は、ビデオのすべての要素が完璧に調和して機能するようにする、熟練した「音と映像の指揮者」と考えてください。

以下は、簡単な比喩を用いて、このシステムが 2 つの主要な問題をどのように解決するかを示したものです。

1. 「音量ノブ」の問題(音声対効果音)

問題点: 以前の AI モデルでは、「音声」(俳優の会話や歌唱)はパーティのいじめっ子のようでした。それはすべてのスペースを占有し、「効果音」(雨、風、ギターのストロークなど)を背景に押しやり、ほとんど聞こえないようにしました。その結果、環境が偽物に感じられる、平板で退屈な音声になりました。

Unison の解決策: Unison は、2 つの別々のミキシングボードを持つスマートな「サウンドエンジニア」として機能します。

  • 分離: 音声とギターを 1 つの厄介な山に混ぜようとするのではなく、Unison はそれらを 2 つの別々のトラック上に構築します。
  • 「スマートゲート(SCG)」: 信号機システムを想像してください。シーンが主に俳優の会話に関する場合、システムは自動的にかすかに背景ノイズの音量を下げて、声が明確になるようにします。しかし、シーンがコンサートや嵐の場合、システムは背景音の音量を上げて、かき消されないようにします。
  • 「ハンドシェイク(Bi-ACA)」: 音声トラックとサウンドトラックは絶えず互いに「会話」します。声が偶然ギター音を飲み込んでいないか、その逆もまた同様かを確認します。これにより、最終的な音声は、歌手と雨の両方がはっきりと聞こえる、バランスの取れた豊かなミックスになります。

2. 「リップシンク」の問題(動作対音声)

問題点: しばしば、ビデオと音声のタイミングが合いません。俳優が音が出る瞬間のわずか後に口を開けたり、手が弦を弾く瞬間の少し前に音が聞こえたりすることがあります。ビデオと音声は、一緒にリハーサルをしていない 2 人の異なる人のように感じられます。

Unison の解決策: Unison は、「クロスモーダル・フォーシング」と呼ばれる「トレーニングドリル」を使用します。

  • 比喩: 2 人のダンサーが振り付けを学んでいると想像してください。通常、彼らは正確に同じ速度で全体のダンスを学ぼうとします。一人が転び、もう一人も転び、混乱します。
  • Unison の工夫: Unison は、一方のダンサー(例えば音声)がもう一方(ビデオ)よりもわずかに速く、かつクリアにステップを学ぶことを許可します。その後、「よりクリアな」ダンサーがガイドとなり、「ノイズの多い」ダンサーに次のステップを正確に示します。
  • 結果: より明確な信号がノイズの多い方を導くことで、AI はビデオの動きと音を完璧に同期させることを学びます。時間の経過とともに、俳優の唇は言葉が話される瞬間に正確に動き、ギターのストロークは指が弦に触れる瞬間に正確に鳴ります。

最終結果

これら 2 つの解決策を組み合わせると、Unison はリアルなビデオを作成します。

  • もうかき消されない: 歌手とバックグラウンドの音楽の両方が聞こえます。
  • もう遅延はない: 動作と音が正確な同時刻に起こります。

この論文は、Unison が単に見た目が良いビデオを作るだけでなく、聞こえも良く、同期された感覚を与えることを示しています。これにより、以前の AI モデルよりもはるかに没入感のある体験が生まれます。これを実現するために巨大なコンピュータは必要なく、トラックの分離や学習の導きといった「賢い組織化」が、単なる計算能力と同じくらい重要であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →