LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time
LiveAnimateは、2段階の学習パイプラインと特化したPose-Retrieval Sink Attentionメカニズムを通じて、一定のレイテンシと高い知覚品質を伴う安定した長時間のストリーミング・ヒューマン・アニメーションを実現する、14BパラメータのDiffusion Transformer上に構築された新しいリアルタイム・数十億規模のビデオ生成システムである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットにダンスを教えようとしているところを想像してみてください。あなたは、ある人物の写真と、一連のダンスの動きを与えます。そして、その人がそのダンスを踊っているビデオを、ロボットが即座に生成することを望んでいます。これが「ポーズ駆動型ヒューマン・アニメーション(pose-driven human animation)」の世界です。長い間、優れたロボットであっても、これは「オフラインモード」でしか行うことができませんでした。それは、複雑なケーキを焼くことに似ています。材料を混ぜ、膨らむのを数時間待ち、焼き上げ、最後に提供するのです。もしダンスの動きを変えたければ、また最初から焼き上げのプロセスをやり直さなければなりません。これは映画制作には素晴らしいですが、ロボットが「今すぐ」反応する必要があるライブストリーミングやビデオゲームにおいては、最悪です。大きな課題は、驚くほど賢く(リアルに見え、一貫性を保つため)、かつ驚くほど速い(ライブストリームに追いつくため)ロボットを、ビデオが数分後に崩壊することなく作成することでした。
そこで、この溝をついに埋めた新しいシステム、LiveAnimateが登場しました。研究者たちは、ブロックごとに、人物の顔や服がストリームの間ずっと全く同じに見えるようにしながら、ビデオをリアルタイムで生成できる「デジタルダンサー」を構築しました。それは、決して疲れることなく、人形がどのような姿であったかを決して忘れることなく、人形の顔が溶けたり服の色が変わったりすることなく、ショーを何時間も続けられるライブ・パペッティア(人形使い)を持っているようなものです。論文によれば、このシステムは強力なコンピュータ上で約20フレーム/秒(リアルタイムの動きとして感じられる速度)で動作し、高品質を少なくとも3分間維持できることを示しています。これは、以前の手法ではリアルタイム実行ができなかったか、あるいは計算に数時間を要した偉業です。
魔法のトリック:仕組み
LiveAnimateがいかにしてこのトリックを成功させているかを理解するために、それが混ぜ合わせている3つの主要な材料を見てみましょう。それは、超スマートな脳、特別なトレーニング手順、そして巧妙なメモリのトリックです。
1. 脳:巨大なビデオ・トランスフォーマー
システムの核心にあるのは、「拡散トランスフォーマー(Diffusion Transformer、またはDiT)」と呼ばれる、140億個のパラメータを持つ巨大なAIモデルです。これを、人間の体がどのように動き、どのように見えるかのあらゆる可能性を収めた巨大な図書館だと想像してください。通常、これらの図書館は「双方向的」であり、シーンを理解するために未来と過去の両方を見ることができます。しかし、ライブストリームの場合、未来を見ることはできず、今起きていることにのみ反応できます。研究者たちは、この巨大な脳を「因果的(causal)」、つまり人間がリアルタイムでダンスを見ている時のように、過去と現在のみを見るように再学習させる必要がありました。
2. トレーニング:2段階の学習
140億個のパラメータを持つ脳に、ただ「ライブで行け」と言っても期待通りには動きません。論文では、準備を整えるための2段階のトレーニングプロセスについて説明しています。
- ステージ1(教師): まず、「参照アンカー付き教師強制学習(Reference-Anchored Teacher-Forcing)」を用いてモデルを教えます。これは、教師が完璧な台本(正解データ)を持ち、生徒(AI)をブロックごとに導いていく様子を想像してください。生徒は、動きを完璧にコピーすることを学びながら、常に参照写真に注意を払い、ダンサーが正しい人物に見えるように学習します。
- ステージ2(スピードラン): ステージ1では、まだリアルタイムには遅すぎます。そこで、ステージ2では「ブロック単位の自己強制蒸留(Block-wise Self-Forcing Distillation)」というテクニックを使用します。これは、生徒を一人にして、教師なしでダンスを練習させ、現在行っている目の前の動きだけを修正していくようなものです。これにより、モデルは一度にすべての履歴をメモリに保持することなく、自身のミスから学ぶことができます。その結果、モデルは通常の50ステップではなく、わずか3ステップで高品質なビデオを生成することを学習し、リアルタイムで実行できるほど速くなります。
3. メモリのトリック:ポーズ・リトリーバル・シンク
ここが最も独創的な部分です。コンピュータに3分間のビデオを記憶するように頼むと、通常はメモリ不足になるか、混乱し始めます。もしダンサーが2分前に取ったポーズを取った場合、通常のシステムは、その時の見た目がどうであったかを忘れてしまい、奇妙なグリッチが発生したり、顔がわずかに変わってしまったりすることがあります。
LiveAnimateは、**Pose-Retrieval Sink Attention (PR-Sink)**と呼ばれる巧妙なメモリシステムでこれを解決しています。AIが、直近の数秒間だけを保持する小さな「付箋」パッド(ローリングウィンドウ)を持っていると想像してください。しかし、それとは別に、以前に見た特定のポーズの「スナップショット」を保存しておく「ポーズ・ライブラリ(メモリ・バンク)」も持っています。
- スタティック・シンク(静的シンク): これは永続的なアンカーです。ビデオの最初のフレームを永遠にメモリにロックし、ダンサーのアイデンティティが漂流しないようにします。
- ダイナミック・シンク(動的シンク): これが魔法です。ダンサーが「ポーズ・ライブラリ」にあるものと一致するポーズをとったとき、システムは即座にその過去の瞬間からの「付箋」を掴み取り、現在のビューに貼り付けます。それはまるで、ダンサーが突然「あ、2分前にこの動きをした、あの時はすごく良く見えていた!」と思い出し、その時の見た目を即座にコピーするようなものです。これは、システムが3分間のビデオ全体を記憶する必要なく、ビデオがどれほど長く続いても一定のメモリ使用量を維持しながら行われます。
結果:高速、安定、そしてリアル
研究者たちは、3分間のダンスシーケンスに対してLiveAnimateをテストしました。その結果は驚くべきものでした。他のシステムが同じクリップを生成するのに2〜5時間かかったり、品質が低下し始めたり(顔がぼやける、服の色が変わる、アイデンティティが変化するなど)した一方で、LiveAnimateは最初の1秒から最後まで品質を一定に保ちました。
- 速度: 2枚の高スペックなNVIDIA H100 GPU上で、約19.63フレーム/秒で動作します。これはライブなインタラクションを感じるのに十分な速さです。
- 一貫性: システムは、3分間を通じて視覚的な品質とアイデンティティの一貫性において、ほぼ完璧なスコアを維持しました。対照的に、他の手法はビデオが長くなるにつれて品質が著しく低下しました。
- 効率性: 巧妙な「ポーズ・ライブラリ」のトリックにより、ビデオが10秒であっても10分であっても、メモリ使用量は一定に保たれます。
現時点での限界
論文では、このシステムが「できないこと」についても慎重に述べています。現在は480×480ピクセルの解像度でビデオを生成しており、これは画面表示には適していますが、ハリウッド映画のような品質ではありません。また、単一人物のシーンに焦点を当てており、複数の人が一緒に踊るシーンや複雑なカメラワークにはまだ対応していません。著者らは、これらの限界をより高い解像度や複雑なシーンへと押し上げることが、次なるステップであると示唆しています。
なぜこれが重要なのか
LiveAnimateは、AIにおける新しい動作点を提示しています。それは、「高品質」と「リアルタイムの速度」のどちらか一方を選ばなければならないわけではない、ということを証明しています。巨大なAIの脳とスマートで限定されたメモリシステムを組み合わせることで、研究者たちは、デジタルヒューマンが誰であるかを決して忘れることなく、即座に踊り、話し、あなたと交流できる、次世代のインタラクティブ・アバター、ライブ仮想コンサート、テレプレゼンス・システムの力を提供するツールを作り上げたのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。