Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
Cet article présente Live Avatar, un cadre algorithme-système co-conçu qui permet la première génération en streaming, pratique, en temps réel et de longueur infinie d'avatars pilotés par l'audio à 14 milliards de paramètres en combinant un pipeline de diffusion causale distillée avec un parallélisme de pipeline imposé par les pas de temps (Timestep-forcing Pipeline Parallelism) afin d'atteindre 45 FPS tout en éliminant la dérive d'identité sur le long terme.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez d'apprendre à un robot à raconter une histoire. Vous voulez qu'il parle, bouge les lèvres et change ses expressions faciales en parfaite synchronisation avec votre voix, tout en ayant l'air d'un véritable humain. C'est le monde de la génération d'avatars pilotés par l'audio. Pendant longtemps, des scientifiques ont construit des « acteurs numériques » en utilisant un type d'IA appelé modèle de diffusion. Voyez le modèle de diffusion comme un sculpteur qui part d'un bloc de statique bruyante et qui retire lentement le bruit pour révéler une statue parfaite. Habitement, ce sculpteur travaille selon un ordre très strict : il doit terminer la tête avant de pouvoir commencer le corps, et il doit le faire étape par étape, ce qui prend beaucoup de temps.
Le gros problème est que si vous demandez à ce robot de raconter une histoire pendant une heure, il a tendance à s'embrouiller. Il pourrait oublier à quoi ressemblait le visage du personnage il y a cinq minutes, ou sa voix pourrait commencer à ressembler à celle d'une personne totalement différente. C'est ce qu'on appelle la « dérive » (drift). De plus, parce que le sculpteur travaille trop lentement, vous ne pouvez pas avoir une conversation en temps réel avec lui ; le temps qu'il finisse une phrase, vous avez déjà oublié ce que vous avez dit. L'objectif des chercheurs a été de construire un acteur numérique capable de vous parler en direct, suffisamment intelligent pour conserver son identité pendant des heures, et assez détaillé pour être photoréaliste.
Voici entré Live Avatar, un nouveau projet qui agit comme un chef d'orchestre pour un orchestre massif de puces informatiques. Les chercheurs derrière ce travail, dirigés par des équipes de l'Université de science et technologie de Chine et d'Alibaba, ont trouvé le moyen de faire parler, bouger et diffuser de la vidéo en temps réel à un modèle d'IA géant de 14 milliards de paramètres (un modèle « 14B », ce qui est énorme dans le monde de l'IA) sans perdre la tête.
Habituellement, produire une vidéo aussi longue et aussi rapide est une contradiction. On peut avoir la vitesse, ou on peut avoir la qualité, mais pas les deux. Live Avatar résout cela en changeant la façon dont l'IA « pense » le temps et la mémoire. Au lieu d'essayer de se souvenir de chaque détail parfait du passé (ce qui provoque la confusion et la dérive de l'IA), le système stocke une mémoire « bruitée ». Imaginez essayer de se souvenir d'une chanson en fredonnant approximativement la mélodie plutôt qu'en essayant de se rappeler chaque note parfaitement. Cette mémoire « grossière » agit comme un filtre, maintenant le visage du personnage stable tout en laissant la bouche bouger naturellement.
L'équipe a également inventé une méthode ingénieuse pour accélérer les choses appelée Parallélisme de pipeline par imposition de l'étape de temps (Timestep-forcing Pipeline Parallelism). Imaginez une chaîne de montage d'usine où, au lieu d'avoir un seul travailleur effectuant chaque étape de la construction d'une voiture, vous avez une équipe de travailleurs. Dans une IA vidéo normale, chaque travailleur attend que le précédent ait terminé avant de pouvoir commencer. Live Avatar change les règles : chaque travailleur sur la ligne (ou chaque puce informatique, connue sous le nom de GPU) se voit assigner une étape spécifique. Pendant que le Travailleur A polit les roues, le Travailleur B peint la portière et le Travailleur C installe le moteur, tous en même temps. Cela transforme un processus séquentiel lent en un processus parallèle rapide.
Les résultats sont impressionnants. Sur une configuration avec 5 cartes graphiques H100 puissantes, Live Avatar peut générer de la vidéo à 45 images par seconde (FPS), ce qui est plus rapide que la vision humaine. Il ne faut que 1,21 seconde pour commencer à générer la première image après que vous avez parlé. Plus important encore, il peut continuer indéfiniment. Les chercheurs l'ont testé en faisant parler l'avatar pendant plus de 10 000 secondes (soit près de trois heures d'affilée), et le personnage n'a pas dérivé, n'a pas eu de bug et n'a pas perdu son identité.
Ce n'est pas seulement une victoire théorique ; l'équipe a construit un nouveau terrain d'essai appelé GenBench pour prouver que d'autres méthodes échouent lors de longues durées alors que la leur réussit. Ils ont découvert que si d'autres systèmes peuvent paraître corrects pendant quelques secondes, ils commencent à se dégrader, à changer de couleur ou à perdre le visage de la personne après quelques minutes. Live Avatar, cependant, reste constant. Cela suggère qu'en combinant une stratégie de mémoire « bruitée » avec un système de chaîne d'assemblage intelligent, nous pouvons enfin avoir des humains numériques prêts pour des conversations réelles et infinies.
Le document exclut explicitement l'idée qu'il faut entraîner l'IA sur des heures de vidéo pour la faire fonctionner pendant des heures. Au contraire, ils ont montré qu'un entraînement sur de courts clips (environ 3 secondes) est suffisant, à condition d'utiliser leur astuce spéciale de « l'historique bruité ». Ils soutiennent également l'idée inverse de l'ancienne croyance selon laquelle il faut choisir entre un modèle rapide et de faible qualité, ou un modèle lent et de haute qualité. Avec leur méthode, vous pouvez avoir un modèle massif et de haute qualité qui fonctionne en temps réel.
Bien que le système soit incroyablement rapide, les auteurs notent qu'il existe toujours un léger délai. Le temps entre le moment où vous parlez et le moment où la vidéo apparaît à l'écran est d'environ 3 secondes en incluant le temps de trajet réseau. C'est assez rapide pour de nombreuses interactions, mais cela pourrait ne pas être suffisant pour une conversation fluide et en face à face où chaque milliseconde compte. Cependant, pour le streaming, les assistants virtuels et la narration numérique, c'est un bond en avant massif, suggérant que l'ère des avatars numériques en temps réel et infinis n'est plus seulement un rêve.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.