← 最新の論文
💻 computer science

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

本論文は、Future-Expanding Attention と Human-Centric Preference-Guided DMD を用いた非同期的な双ストリーム拡散により高速・低遅延な性能を実現し、効率性と生成品質の両面で既存モデルを大幅に凌駕する、リアルタイムストリーミング型の音声・映像アバター生成フレームワーク「Hallo-Live」を提案する。

原著者: Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

公開日 2026-04-28
📖 1 分で読めます☕ さくっと読める

原著者: Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

デジタルキャラクター(アバター)を作成し、入力したテキストと完璧に同期して話したり口を動かしたりさせたいと想像してみてください。通常、こうしたキャラクターを作るのは、複雑なケーキを焼こうとするようなものです:時間がかかり、プロセスを急ごうとすると、ケーキはしばしば平らになったり、歪んだりしてしまいます。

この論文は、品質を損なうことなく、これらの話すアバターを作成することをテキストメッセージを送るのと同じくらい速くする新しいシステム「Hallo-Live」を紹介しています。以下に、簡単な比喩を用いてその仕組みを説明します。

1. 問題点:「盲目」の俳優

従来のシステムでは、コンピュータは、話す瞬間が来るまで台本を厳しく見ることを禁じられた俳優のように振る舞っていました。

  • 問題点: 現実の世界では、私たちが話す際、音声が口から出る前に口唇の動きが始まります。私たちは次の音に備えているのです。
  • 旧来の方法: 古いコンピュータモデルは「次の数語」を覗き見ることができなかったため、アバターの口唇は音声に遅れ、ロボット的で同期が取れていないように見えました。
  • 速度の問題: アバターを良く見せるために、コンピュータは通常、動画の1秒ごとに膨大な量の計算を行わなければなりませんでした。これはリアルタイムのチャットには長すぎました。

2. 解決策:「未来を読む」俳優

Hallo-Live は、「Future-Expanding Attention(未来拡張アテンション)」と呼ばれるトリックを用いて、遅延問題を解決します。

  • 比喩: アバターが、現在のセリフを話しながら、台本の「次の」一文を覗き見ることが許された俳優だと想像してください。
  • 仕組み: システムは、動画処理部分の脳に小さな「先読み」ウィンドウを与えます。現在の音声と、次に続く数つの音を認識します。これにより、アバターは次の音に備えて口唇の動きを開始し、人間がそうするように、次の音に先駆けて動き出します。これにより、システムがまだ「リアルタイム」で稼働しているにもかかわらず、リップシンクは自然で即座に感じられるようになります。

3. 速度向上:「蒸留された」学生

システムを瞬時に実行できるほど速くするために、研究者たちは「蒸留(Distillation)」と呼ばれる技術を使用しました。

  • 比喩: 元の高品質なモデルを、完璧な料理を作るのに2時間かかる「巨匠シェフ」と考え、新しいモデルを「見習いシェフ」と考えてください。
  • 問題点: 通常、見習いに巨匠と同じくらい速く料理を教えると、彼らは慌てて失敗します(料理は味が薄かったり、見た目が乱雑になったりします)。
  • 解決策(人間中心の選好): 単に「巨匠を真似ろ」と見習いに言うのではなく、研究者たちは見習いに「味見パネル」を与えました。
    • 単に「巨匠のように見せろ」とは言いませんでした。
    • 「顔がリアルに見えるように(視覚的忠実度)」「声が自然に聞こえるように(音声の自然さ)」「口唇が言葉と一致するように(同期)」と指示しました。
    • 見習いの料理がこれらの特定の人間の選好において高得点を取れば、「報酬」が与えられます。ロボット的だったり同期が取れていなかったりすれば、低い評価となります。
    • これにより、見習いは、人間が最も重視するものを犠牲にすることなく、速く動くことを学びます。

結果:マジックのようなもの

この論文は、強力なコンピュータチップ(NVIDIA H200 GPU)上では、この新しいシステムが以下の成果を達成すると主張しています。

  • 速度: 1秒間に20.38フレームの動画を生成します。これはライブ会話に十分な速さです。
  • 遅延: 開始までに要するのは0.94秒です。1秒未満の待ち時間です。
  • 比較: 以前の「巨匠シェフ」(Ovi モデル)よりも16倍速く99倍遅延が少ないですが、それでも口唇が音声と完璧に同期して動く高品質な動画を生成します。

できること

この論文は、このシステムがさまざまなシナリオでうまく機能することを示しています。

  • リアルな人物: 話す人物のフォトリアリスティックな肖像画を作成する。
  • カートゥーン: 様式化されたアニメーションキャラクターを作成する。
  • グループ: 2人が互いに話すシーンに対応する。
  • 異なる角度: 顔のアップショットや全身ショットに対応する。

要約すれば、Hallo-Live は、デジタル俳優に先読みできる台本と、パフォーマンスを急がせないようにする厳格な味見パネルを与えるようなものです。その結果、生き生きとして即座に反応する話すアバターが生まれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →