← Derniers articles
💻 computer science

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

Avatar-Forever est un cadre d'entraînement parallèle découplé qui combine la distillation à paramètres complets pour une haute qualité visuelle avec un adaptateur à horizon long et léger entraîné via un entraînement par déploiement orienté vers la récupération, permettant la génération d'avatars pilotés par l'audio, stable, en temps réel et infinie sur un seul GPU H100.

Auteurs originaux : Ruibin Li, Tao Yang, Zhiyuan Ma, Fangzhou Ai, Shilei Wen, Lei Zhang

Publié 2026-08-13
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ruibin Li, Tao Yang, Zhiyuan Ma, Fangzhou Ai, Shilei Wen, Lei Zhang

Article original placé dans le domaine public sous CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où vous pouvez parler à un ami numérique qui ressemble, bouge et parle exactement comme une personne réelle, pour toujours. Ce n'est pas seulement le rêve d'un film de science-fiction ; c'est l'objectif d'un domaine appelé l'informatique visuelle, où les scientifiques apprennent aux ordinateurs à comprendre et à créer des images animées. Pour ce faire, les chercheurs utilisent des modèles d'IA — de gigantesques cerveaux numériques entraînés sur des millions de vidéos — pour apprendre comment les humains ressemblent et se déplacent. Un défi clé dans ce domaine est la génération de vidéo en streaming. Imaginez cela comme une course de relais : l'ordinateur génère quelques secondes de vidéo, puis utilise ce résultat comme point de départ pour les quelques secondes suivantes, et ainsi de suite. Le problème est que, si l'ordinateur commet une minuscule erreur dans les premières secondes, cette erreur est transmise le long de la ligne, grossissant et devenant plus étrange à chaque étape, jusqu'à ce que la personne numérique commence à fondre ou à oublier son identité. Ce document s'attaque au casse-tête consistant à maintenir ces humains numériques parfaits et naturels, même lorsqu'ils parlent pendant des heures sans s'arrêter.

Les chercheurs derrière Avatar-Forever ont réalisé que tenter de résoudre ce problème de « course de relais » avec les anciennes méthodes revenait à essayer d'apprendre à un étudiant à courir vite et à ne jamais trébucher en même temps en utilisant un plan de leçon unique et confus. L'ancienne méthode tentait de faire entrer deux objectifs très différents dans un seul processus d'entraînement : rendre la génération de vidéo ultra-rapide (pour qu'elle semble en temps réel) et la rendre ultra-robuste (pour qu'elle ne s'effondre pas après une minute). Les auteurs soutiennent que ces deux objectifs s'opposent en réalité. Si vous vous concentrez trop sur la vitesse, la vidéo devient instable ; si vous vous concentrez trop sur la correction des erreurs, elle devient trop lente.

Ainsi, au lieu de forcer l'ordinateur à apprendre ces deux compétences à la fois, Avatar-Forever divise l'entraînement en deux classes distinctes et parallèles. Imaginez une salle de sport numérique avec deux pistes différentes. Sur la première piste, la Branche d'Efficacité, l'IA s'entraîne à courir un sprint. Elle apprend à générer une vidéo de haute qualité en seulement quelques étapes, en se concentant purement sur la vitesse et sur un aspect esthétique à court terme. Sur la deuxième piste, la Branche de Robustesse, l'IA pratique une compétence différente : la récupération. Ici, les chercheurs perturbent délibérément le point de départ de l'IA — en floutant l'image, en ajoutant du bruit ou en cachant des parties du visage — et demandent ensuite à l'IA de générer les quelques secondes de vidéo malgré tout. C'est ce qu'on appelle l'Entraînement de Déroulement Orienté vers la Récupération (RRT). C'est comme apprendre à un gymnaste à réussir un salto arrière parfait même s'il trébuche sur la première étape. L'IA apprend à corriger ses propres erreurs au fur et à mesure qu'elles surviennent, plutôt que d'espérer simplement qu'elles ne se produisent pas.

Une fois que l'IA s'est entraînée sur les deux pistes, les chercheurs combinent les deux compétences. Ils prennent le coureur rapide et l'expert en récupération et les fusionnent en un seul super-athlète. Ce nouvel avatar peut générer de la vidéo en temps réel tout en étant assez robuste pour gérer des heures de conversation sans perdre son identité ou son calme. Pour rendre cela encore plus rapide, ils ont introduit une astuce ingénieuse appelée ForeverCache. Normalement, chaque fois que l'IA génère un nouveau bloc de vidéo, elle doit relire tout l'historique de ce qu'elle vient de créer, ce qui revient à relire un livre entier à chaque fois que vous écrivez une nouvelle phrase. ForeverCache est comme un marque-page intelligent ; il se souvient des parties stables de l'histoire (l'arrière-plan, le visage de la personne) afin que l'IA n'ait pas à les recalculer à chaque fois. Elle se concentre uniquement sur les nouveaux mots qui sont écrits en ce moment même.

Les résultats sont impressionnants. Construit sur un modèle de base vidéo massif de 22 milliards de paramètres, Avatar-Forever peut générer des vidéos haute résolution (768 × 512 pixels) à 27,2 images par seconde sur une seule carte graphique H100 puissante. C'est assez rapide pour une interaction en temps réel. Lors des tests, le système a réussi à maintenir un avatar numérique parlant naturellement pendant plus de 11 minutes sans que le visage ne fonde, que la voix ne dérive ou que les mouvements ne deviennent robotiques. Alors que d'autres méthodes commençaient à montrer une « dérive d'identité » (où la personne ressemble à une autre personne) ou des gestes répétitifs et rigides après un certain temps, Avatar-Forever a maintenu la cohérence du personnage et la fluidité du mouvement. L'équipe a également créé un ensemble de données entièrement synthétiques pour entraîner le modèle, ce qui signifie qu'ils ont généré les vidéos d'entraînement eux-mêmes à l'aide de l'IA pour garantir une qualité et un alignement parfaits, évitant ainsi le désordre des vidéos réelles d'Internet.

Le document suggère que cette approche de « pistes séparées » est une meilleure façon de construire des humains numériques durables que les anciennes méthodes entremêlées. En séparant le besoin de vitesse du besoin de stabilité, les chercheurs ont trouvé une voie pratique pour créer des personnes numériques capables de nous parler, de nous enseigner ou de nous divertir indéfiniment, sans les bugs numériques qui gâchent habituellement l'illusion. Bien que le système soit actuellement optimisé pour des serveurs puissants et non encore pour les ordinateurs domestiques, il ouvre la porte à un avenir où nos compagnons numériques peuvent être avec nous aussi longtemps que nous en avons besoin.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →