Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars
Avatar-Foreverは、高い視覚的品質のためのフルパラメータ蒸留と、リカバリー指向のロールアウト・トレーニング(Recovery-oriented Rollout Training)を通じて学習された軽量な長期間アダプターを組み合わせたデカップリングされた並列学習フレームワークであり、単一のH100 GPU上で、安定したリアルタイムかつ無限のオーディオ駆動型アバター生成を可能にします。
原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
デジタルな友人が、まるで実在する人間のように見え、動き、話し、そして永遠に存在し続けることができる世界を想像してみてください。これは単なるSF映画の夢ではありません。科学者がコンピュータに動く映像を理解させ、生成させる方法を教える「ビジュアル・コンピューティング」と呼ばれる分野の目標です。これを行うために、研究者たちは、何百万ものビデオで学習させた巨大なデジタル脳である「AIモデル」を使用します。この分野における主要な課題は、「ストリーミング・ビデオ生成」です。これはリレー・レースのようなものだと考えてください。コンピュータは数秒間のビデオを生成し、その結果を次の数秒間の出発点として使い、これを繰り返していきます。問題は、コンピュータが最初の数秒間でわずかなミスを犯すと、そのミスが次々と引き継がれ、ステップを重ねるごとにどんどん大きくなって奇妙なものへと膨れ上がり、最終的にデジタルな人物が溶け始めたり、自分が誰であるかを忘れてしまったりすることです。この論文は、デジタルな人間が、たとえ何時間も休みなく話し続けても、完璧な見た目と自然な振る舞いを維持するための難題に取り組んでいます。
「Avatar-Forever」の開発者たちは、従来のメソッドでこの「リレー・レース」の問題を解決しようとすることは、生徒に対して「速く走ること」と「決して転ばないこと」の両方を、一つの混乱したレッスン計画を使って同時に教えようとするようなものだと気づきました。従来の方法は、ビデオ生成を非常に高速にし(リアルタイム性を感じさせるため)、かつ非常に頑健にする(1分経っても崩れないようにするため)という、2つの非常に異なる目標を一つの学習プロセスに詰め込もうとしていました。著者らは、これら2つの目標は実際には互いに衝突し合うものであると主張しています。スピードに集中しすぎるとビデオがガタつき、エラーの修正に集中しすぎると動作が遅くなってしまうのです。
そこで、Avatar-Foreverは、コンピュータに両方のスキルを同時に学ばせる代わりに、学習を2つの別々の並行クラスに分割しました。デジタルなジムに2つの異なるトラックがある様子を想像してください。最初のトラックである「効率化ブランチ(Efficiency Branch)」では、AIは短距離走の練習をします。AIは、純粋にスピードと短期間での見た目の良さに焦点を当て、わずか数ステップで高品質なビデオを生成することを学びます。2つ目のトラックである「堅牢性ブランチ(Robustness Branch)」では、AIは異なるスキル、つまり「回復」を練習します。ここでは、研究者たちは意図的にAIの出発点を台無しにします。画像をぼかしたり、ノイズを加えたり、顔の一部を隠したりして、それでもなおAIに次の数秒間のビデオを生成させるのです。これは「リカバリー指向ロールアウト学習(Recovery-oriented Rollout Training: RRT)」と呼ばれます。これは、体操選手に、最初のステップでつまずいたとしても、完璧なバク宙ができるように教えるようなものです。AIは、単にミスが起きないことを祈るのではなく、発生しているミスを自ら修正する方法を学ぶのです。
AIが両方のトラックでトレーニングを終えると、研究者たちはこれら2つのスキルを結合させます。彼らは、速いランナーと回復の専門家を取り、一人のスーパーアスリートへと融合させます。この新しいアバターは、リアルタイムでビデオを生成できると同時に、アイデンティティや落ち着きを失うことなく、何時間も話し続けることができるほどタフになります。さらに高速化するために、彼らは「ForeverCache」と呼ばれる巧妙なトリックを導入しました。通常、AIが新しいビデオの塊を生成するたびに、それまでに生成した全履歴を読み直さなければなりません。これは、新しい文章を書くたびに本を一冊丸ごと読み直すようなものです。ForeverCacheはスマートな栞(しおり)のようなもので、安定した部分(背景や人物の顔など)を記憶しておくため、AIはそれらを毎回再計算する必要がありません。AIは今まさに書かれている新しい言葉だけに集中できるのです。
結果は素晴らしいものです。220億個のパラメータを持つ大規模なビデオ基盤モデルに基づいたAvatar-Foreverは、単一の強力なH100グラフィックスカード上で、高解像度(768 × 512 ピクセル)のビデオを27.2フレーム/秒で生成できます。これはリアルタイムの対話が可能な速度です。テストにおいて、このシステムは、顔が溶けたり、声が逸れたり、動きがロボットのようになったりすることなく、11分以上も自然にデジタルアバターを喋らせ続けることに成功しました。他の手法では、時間が経つにつれて「アイデンティティのドリフト(人物が別人に見えてしまう現象)」や、反復的で硬いジェスチャーが見られ始めましたが、Avatar-Foreverはキャラクターの一貫性と流動的な動きを維持しました。また、チームは完全に合成されたデータセットも作成しました。これは、AIを使用してトレーニング用のビデオ自体を生成したことを意味しており、これにより、現実世界のインターネット動画にあるような乱雑さを避け、完璧な品質と整合性を確保しています。
この論文は、この「分割トラック」のアプローチが、従来の絡み合ったメソッドよりも、長く続くデジタルヒューマンを構築するための優れた方法であることを示唆しています。スピードの必要性と安定性の必要性を分離することで、研究者たちは、デジタルな不具合によってイリュージョンが台無しになることなく、デジタルな人々が、私たちが求める限りいつでも話し、教え、あるいは楽しませてくれる未来への実用的な道を見出したのです。現在のシステムは強力なサーバー向けに最適化されており、まだ家庭用コンピュータ向けではありませんが、私たちのデジタルな仲間が、必要な限りずっとそばにいてくれる未来への扉を開いています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。