← 最新の論文
💻 computer science

StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration

StreamChar は、LLM によるオーケストレーションと共同音声・動画のデノイジングを分離し、進行状況認識型アライメントとシンク・チャンク・メモリを備えた 2 段階の蒸留パイプラインを採用することで、厳格なレイテンシ制約内で高忠実度、同期、安定性を達成する、長時間のキャラクター音声・動画生成のためのリアルタイムストリーミングフレームワークである。

原著者: Linrui Tian, Qi Wang, Bang Zhang

公開日 2026-05-26
📖 1 分で読めます☕ さくっと読める

原著者: Linrui Tian, Qi Wang, Bang Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが、俳優が台本を語り、自然に動き、かつ自分自身にそっくりであるように見せつつ、観客がリアルタイムでそれを見守るライブのインタラクティブな劇を演出していると想像してください。これを数秒間行うのは困難ですが、俳優が台本を忘れたり、顔が崩れたり、吃音が出たりすることなく数分間行うことは悪夢です。

本論文は、テキスト台本からキャラクターが語り、動く長くて連続的なストリームをリアルタイムで生成するという、まさにこの問題を解決するために設計された新しいシステム「StreamChar」を紹介します。

その仕組みを、簡単な概念に分解して以下に示します。

1. 核心的な問題:「綱渡り」

ほとんどの AI 動画生成ツールは、試験を受ける学生のようなものです。考えるのに十分な時間が与えられれば、素晴らしいエッセイ(短い動画クリップ)を書くことができます。しかし、もし彼らに一文ずつで小説全体(長い動画)を書くように求めれば、彼らは次のような傾向を示します。

  • プロットを忘れる: 元の台本から逸脱してしまう。
  • アイデンティティを失う: キャラクターの顔が変形したり変化し始めたりする。
  • つまずく: 音声と動画が同期しなくなる(口元が言葉と一致しない)。
  • 時間がかかりすぎる: 高品質な動画は通常、AI が長い間「考える」ことを必要とし、それが「リアルタイム」というルールを破る。

2. 解決策:二人組のチーム(分離されたオーケストレーション)

一つの巨大な AI 脳にすべてを一度に行わせるのではなく、StreamChar は仕事を「監督」と「俳優」という二つの専門的な役割に分割します。

  • 監督(LLM オーケストレーター): これはテキストに強い AI です。その唯一の役割は、台本と直前の出来事の履歴を読むことです。動画を描くのではなく、物語の次の部分に「何を」話し、「どのように」話す必要があるかを伝えるだけです。これは「フレーム整合」のガイドとして機能し、キャラクターが台本から外れないようにします。
  • 俳優(DiT): これは動画制作 AI です。監督からの指示を受け取り、次の数秒間のキャラクターの口元の動きや体の動きを作るという、即座のタスクに専念します。台本全体を気にする必要がないため、高品質で自然な動きに集中できます。

3. ショーを継続させる:「アンカー」と「ポインター」

監督と俳優がいても、時間が経つにつれてミスが積み重なる可能性があります。StreamChar は、ショーが崩壊するのを防ぐために、二つの巧妙なトリックを使用します。

  • シンク・チャンク(アンカー): 動画の最初の数秒を、海に落とされた重いアンカーだと想像してください。その後に生成される動画の各チャンクは、この元のアンカーに「繋ぎ止め」られます。これにより、動画が長くなるにつれてキャラクターの顔が逸脱したり、外見が変わったりするのを防ぎます。
  • 進捗認識ポインター(指揮者): AI が音声を生成する際、このツールは指揮者のバトンのように機能し、常に確認します。「台本のこの文はちょうど終わったか?」と。これにより、AI は現在のチャンクをどこで止め、次のチャンクをいつ始めるべきかを正確に把握し、テキストと音声を完璧に整合させます。

4. 高速化:「トレーニングキャンプ」(二段階蒸留)

高品質な動画は通常、生成に長い時間がかかります(慎重な画家のようにゆっくりと)。リアルタイム・ストリーミングに十分な速度にするために、チームは二段階のトレーニングプロセスを用いました。

  • 段階 1(スプリント): AI に 50 回ではなく、わずか 4 回のストロークで絵を描くよう教えました。これにより高速化されましたが、結果はやや硬く、反復的でした。
  • 段階 2(リハーサル): AI に、チャンクを次々と生成するショー全体を自分で実行する練習をさせました。もしチャンク 1 でミスがあれば、チャンク 2 でそれを修正する方法を学びました。この「リハーサル」により、AI は品質を失うことなく、長期間にわたって安定し、一貫性を保つ方法を学びました。

5. 結果

テストされたところ、StreamChar は単一の強力なコンピュータチップ(H100 GPU)上で動作し、人間が見られる速度(リアルタイム)で動画を生成できることが証明されました。

  • 台本に忠実: キャラクターはテキストが言うことを正確に言います。
  • キャラクターを維持: 数分間の動画を通じて、顔が変形したり逸脱したりしません。
  • 自然な動き: 口元だけを揺らす他の方法とは異なり、このシステムは上半身と手を自然に動かします。

要約すると: StreamChar は、完璧な脚本監督と才能ある俳優を雇ったようなもので、彼らは十分にリハーサルを繰り返したため、台詞を忘れたり衣装を失ったりすることなく、リアルタイムで数時間にわたる完璧な劇を上演することができます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →