← 最新の論文
💻 computer science

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length

本論文は、蒸留された因果的拡散パイプラインとTimestep-forcing Pipeline Parallelismを組み合わせることで、45 FPSを実現しつつ長期間のアイデンティティ漂流を排除し、140億パラメータの音声駆動型アバターの初の実用的なリアルタイムかつ無限長のストリーミング生成を可能にする、アルゴリズムとシステムの共同設計フレームワークであるLive Avatarを導入するものである。

原著者: Yubo Huang, Hailong Guo, Fangtai Wu, Weiqiang Wang, Shifeng Zhang, Shijie Huang, Qijun Gan, Lin Liu, Sirui Zhao, Enhong Chen, Jiaming Liu, Steven Hoi

公開日 2026-08-03
📖 1 分で読めます☕ さくっと読める

原著者: Yubo Huang, Hailong Guo, Fangtai Wu, Weiqiang Wang, Shifeng Zhang, Shijie Huang, Qijun Gan, Lin Liu, Sirui Zhao, Enhong Chen, Jiaming Liu, Steven Hoi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたはロボットに物語を話す方法を教えようとしていると想像してください。あなたは、自分の声と完璧に同期して、話し、唇を動かし、表情を変えるようにしたいと考えています。それも、本物の人間のように見えるように。これが「オーディオ駆動型アバター生成(audio-driven avatar generation)」の世界です。長い間、科学者たちは「拡散モデル(diffusion model)」と呼ばれる一種のAIを用いて、「デジタル俳優」を作り上げてきました。拡散モデルとは、ノイズの混じった静止画というブロックから、少しずつノイズを削り取っていくことで完璧な彫像を現していく彫刻家のようなものだと考えてください。通常、この彫刻家は非常に厳格な順序に従って作業します。つまり、体を作る前に頭を完成させなければならず、これをステップ・バイ・ステップで行う必要があるため、非常に時間がかかります。

大きな問題は、もしこのロボットに1時間の物語を話すよう頼んだ場合、ロボットが混乱してしまう傾向があることです。例えば、キャラクターの顔が5分前はどうだったかを忘れてしまったり、声が全く別人のように聞こえ始めたりすることがあります。これは「ドリフト(漂流)」と呼ばれます。さらに、彫刻家が非常にゆっくりと作業するため、リアルタイムの会話をすることはできません。ロボットがひとつの文章を終える頃には、あなたはすでに自分が何を言ったのか忘れてしまっているでしょう。研究者たちの目標は、あなたとライブで会話できるほど速く、何時間もアイデンティティを維持できるほど賢く、そしてフォトリアルに見えるほど詳細なデジタル俳優を構築することでした。

そこで登場したのが、膨大な数のコンピュータチップのオーケストラを指揮するマスターコンダクターのような新プロジェクト、「Live Avatar」です。中国科学技術大学とアリババのチームによる研究者たちは、140億個のパラメータを持つ巨大なAIモデル(AIの世界では「14B」と呼ばれる非常に巨大なものです)に、精神を失うことなく、リアルタイムで話し、動き、ビデオをストリーミングさせる方法を見つけ出しました。

通常、これほど長いビデオをこれほど速く作成することは矛盾しています。スピードを取るか、品質を取るか、そのどちらかしか選べません。Live Avatarは、AIが「時間」と「記憶」について考える方法を変えることで、この問題を解決しました。過去のあらゆる完璧な細部をすべて記憶しようとする代わりに(それがAIを混乱させ、ドリフトの原因となります)、システムは「ノイズを含んだ」記憶を保存します。これは、曲を思い出す際に、すべての音符を完璧に思い出すのではなく、メロディを大まかにハミングして思い出すようなものです。この「粗い」記憶がフィルターとして機能し、キャラクターの顔を安定させつつ、口の動きを自然にします。

チームはまた、「Timestep-forcing Pipeline Parallelism(タイムステップ強制パイプライン並列化)」と呼ばれる、作業を加速させる巧妙な方法を考案しました。これは、自動車の製造工程における工場のアセンブリラインを想像してください。通常の工場では、一人の作業員が車の製造におけるすべての工程を行うのではなく、チームで分担します。通常のビデオAIでは、すべての作業員が前の作業員の終了を待ってから開始しますが、Live Avatarはルールを変えました。ライン上のすべての作業員(あるいは、GPUとして知られる各コンピュータチップ)に特定の工程が割り当てられます。作業員Aがホイールを磨いている間に、作業員Bはドアを塗装し、作業員Cはエンジンを設置しているというように、すべてが同時に進行します。これにより、遅い逐次的なプロセスが、高速な並列プロセスへと変わります。

その結果は驚くべきものです。5枚の強力なH100グラフィックスカードを備えたセットアップにおいて、Live Avatarは人間の視覚よりも速い毎秒45フレーム(FPS)の速度でビデオを生成できます。あなたが話してから最初のフレームが生成されるまで、わずか1.21秒しかかかりません。最も重要なのは、これを永遠に継続できることです。研究者たちは、アバターに10,000秒以上(これは連続で3時間近くに相当します)話をさせるテストを行いましたが、キャラクターはドリフトせず、グリッチ(不具合)も起きず、アイデンティティを失うこともありませんでした。

これは単なる理論上の勝利ではありません。チームは、他の手法が長時間の動作において失敗することを証明するために、「GenBench」という新しいテスト環境を構築しました。彼らは、他のシステムは数秒間は見栄えが良くても、数分後には劣化したり、色が変わったり、人物の顔を失ったりすることを発見しました。しかし、Live Avatarは一貫性を保ちます。これは、「ノイズを含んだ」記憶戦略とスマートなアセンブリライン・システムを組み合わせることで、リアルタイムで無限の会話が可能なデジタルヒューマンがついに実現できることを示唆しています。

このシステムは非常に高速ですが、著者らは依然として小さな遅延があることも指摘しています。ネットワークの移動時間を含めると、あなたが話してからビデオが表示されるまでの時間は約3秒です。これは多くのインタラクションには十分な速さですが、ミリ秒単位の精度が求められるシームレスな対面式の会話には、まだ不十分かもしれません。しかし、ストリーミング、バーチャルアシスタント、そしてデジタルストーリーテリングにとって、これは大きな飛躍であり、無限のリアルタイム・デジタルアバターの時代がもはや夢ではないことを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →