UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos
UniSwapは、スワップ・アンド・リコンストラクト(入れ替えと再構成)型の学習パイプラインと効率的なサンプリング技術を活用することで、同期、一貫性、および安定した長尺生成を実現し、トーキングビデオにおける初のストリーミングかつ、オーディオ・ビジュアルを統合したアイデンティティ置換を可能にする新しいフレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
映画を観ていると想像してみてください。しかし、画面上の俳優が突然、全く異なる声で話し始め、見た目も完全に別人に変わったのです。それでも、言っている言葉は全く同じで、唇の動きも完璧にタイミングが合っています。これが、動画における「アイデンティティ・スワップ(身分入れ替え)」の夢です。長い間、コンピュータは、人の顔を変えるが元の声は維持する、あるいは、声を替えるが元の顔は維持するといった、このトリックの片方の部分だけを行うことには長けていました。しかし、両方を同時に行うことは、一輪車に乗りながら二つの異なるボールをジャグリングするようなものでした。その結果、唇が間違った言葉に合わせて動いたり、声がロボットのように聞こえたりと、しばしば同期が崩れてしまいました。本論文は、生成AIの世界を掘り下げ、コンピュータがいかにして、ビデオがカクついたり音声が遅れたりすることなく、人物の外見と声を同時にリアルタイムで入れ替える方法を学習できるかを探求しています。
このプロジェクトの背後にある研究者たちは、映像の視覚的な側面と音声の側面、両方の糸を同時に引くマスター・パペッティア(熟練の手品師)のように振る舞う新しいシステム「UniSwap」を構築しました。顔用と声用の二つの別々のツールを使う代わりに、彼らは、人の顔がどのように動き、声がどのように響くかを一つの繋がった体験として理解する、単一の「脳」を作り上げました。これは、単に言葉を翻訳するだけでなく、話し手のアクセントや表情をも瞬時に捉える、バイリンガルの翻訳者のようなものです。
論文では、このシステムを教えるための巧妙な方法を紹介しています。同じ人物が同じ台詞を喋りながら、見た目も声も二人分として存在する実写映像を見つけることはほぼ不可能であるため、チームは「スワップ・アンド・リコンストラクト(入れ替えと再構築)」というゲームを考案しました。彼らは実際のビデオを取り込み、その人物の顔と声をデジタル的に剥ぎ取って「ゴースト」バージョンを作成し、次に、新しい顔と声をガイドとして使い、元のビデオを再構築するようにAIに指示します。これは、シェフに白紙のキャンバスとレシピを与え、特定の料理を完璧に再現するように求めるようなものです。これら数百万もの「再構築」を用いてトレーニングすることで、AIは、元の動きや背景を維持したまま、アイデンティティを入れ替える方法を学びます。
これが真に特別な理由は、録画された映画のような低速な処理ではなく、ライブストリームのように機能することです。ほとんどのビデオ生成器は、最初のフレームを描き始める前にクリップ全体を視聴しなければならず、それはインタラクティブな使用には遅すぎます。しかし、UniSwapは、コンベアベルトのように小さなブロック単位でビデオを生成するため、強力なコンピューターチップ(NVIDIA H100)上で秒間約13.6フレームを生成できます。これは、即時のリアルタイム対話ができるほどにはまだ達していませんが、大きな飛躍であり、キャラクターの顔や声が時間の経過とともに乖離したり歪んだりすることなく、最大1時間の長さのビデオを生成することを可能にします。著者らは、「Feature-RoPE Decomposition」と呼ばれる特別な「メモリのトリック」を使用することで、AIが数千フレームを生成した後でも元のアイデンティティを記憶し、最初から最後までキャラクターの一貫性を保てることを発見しました。
要するに、UniSwapは、話している動画において、外見と声を両方とも入れ替えることができ、高い同期性と安定性を備えた統一されたシステムが実現可能であることを示唆しています。現在のバージョンは、ライブでのリアルタイム会話には(標準的なビデオ再生速度よりもわずかに遅いため)まだ完全には対応していませんが、単一のモデルが二つのタスクを一緒に行う方が、二つの別々のシステムを繋ぎ合わせるよりも優れた結果をもたらすことを証明しています。その結果、唇の動きは新しい声と完璧に同期し、キャラクターのアイデンティティは長いクリップの中でも安定しており、より自然でインタラクティブなデジタルアバターへの有望な一歩を示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。