← Derniers articles
💻 computer science

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

L'article présente Hallo-Live, un cadre de diffusion en temps réel pour la génération conjointe d'avatars audio-vidéo qui atteint des performances rapides et à faible latence grâce à une diffusion asynchrone à double flux avec une attention d'expansion future et un DMD guidé par des préférences centrées sur l'humain, surpassant significativement les modèles existants tant en efficacité qu'en qualité de génération.

Auteurs originaux : Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

Publié 2026-04-28
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous souhaitiez créer un personnage numérique (un avatar) capable de parler et de bouger les lèvres en parfaite synchronisation avec tout ce que vous tapez. Habituellement, créer ces personnages revient à essayer de préparer un gâteau complexe : cela prend beaucoup de temps, et si vous tentez d'accélérer le processus, le gâteau finit souvent plat ou de travers.

L'article présente Hallo-Live, un nouveau système qui permet de créer ces avatars parlants aussi rapidement qu'un message texte, sans altérer la qualité. Voici comment cela fonctionne, en utilisant des analogies simples :

1. Le Problème : L'Acteur « Aveugle »

Dans les systèmes précédents, l'ordinateur agit comme un acteur strictement interdit de regarder le scénario jusqu'au moment exact où il doit parler.

  • Le Problème : Dans la vie réelle, lorsque nous parlons, nos lèvres commencent à bouger avant que le son ne sorte réellement de notre bouche. Nous nous préparons pour le son suivant.
  • L'Ancienne Méthode : Parce que les anciens modèles informatiques ne pouvaient pas « jeter un coup d'œil » aux quelques mots suivants, les lèvres de l'avatar traînaient derrière la voix, paraissant robotiques et désynchronisées.
  • Le Problème de Vitesse : Pour que l'avatar ait une bonne apparence, l'ordinateur devait généralement effectuer une quantité massive de calculs pour chaque seconde de vidéo. Cela prenait trop de temps pour une conversation en temps réel.

2. La Solution : L'Acteur « Lecteur du Futur »

Hallo-Live résout le problème de latence avec une astuce appelée Attention à Expansion du Futur.

  • L'Analogie : Imaginez que l'avatar est un acteur autorisé à jeter un coup d'œil à la prochaine phrase du scénario tout en parlant de la phrase actuelle.
  • Comment cela fonctionne : Le système donne à la partie vidéo du cerveau une petite fenêtre de « vision anticipée ». Il voit l'audio actuel et les quelques sons à venir. Cela permet à l'avatar de commencer à bouger les lèvres en anticipation du son suivant, tout comme un humain le fait. Cela rend la synchronisation labiale naturelle et immédiate, même si le système fonctionne toujours en « temps réel ».

3. L'Accélération : L'Étudiant « Distillé »

Pour rendre le système assez rapide pour fonctionner instantanément, les chercheurs ont utilisé une technique appelée Distillation.

  • L'Analogie : Considérez le modèle d'origine, de haute qualité, comme un Chef Maître qui prend 2 heures pour préparer un repas parfait. Le nouveau modèle est un Chef Élève.
  • Le Problème : Habituellement, lorsque vous apprenez à un élève à cuisiner aussi vite que le maître, il se précipite et fait des erreurs (la nourriture a un goût fade ou a l'air désordonnée).
  • La Solution (Préférence Centrée sur l'Humain) : Au lieu de simplement dire à l'élève de « copier le maître », les chercheurs ont fourni à l'élève un Jury de Dégustation.
    • Ils n'ont pas seulement dit : « Faites en sorte que cela ressemble au maître. »
    • Ils ont dit : « Assurez-vous que le visage semble réel (Fidélité Visuelle) », « Assurez-vous que la voix sonne naturelle (Naturalité de la Parole) » et « Assurez-vous que les lèvres correspondent aux mots (Synchronisation) ».
    • Si la cuisine de l'élève obtient un score élevé sur ces préférences humaines spécifiques, il reçoit une « récompense ». Si cela semble robotique ou désynchronisé, il obtient un score plus bas.
    • Cela apprend à l'élève d'être rapide sans sacrifier les aspects auxquels les humains tiennent le plus.

Les Résultats : Un Tour de Magie

L'article affirme que sur des puces informatiques puissantes (GPU NVIDIA H200), ce nouveau système atteint :

  • Vitesse : Il génère de la vidéo à 20,38 images par seconde. C'est assez rapide pour une conversation en direct.
  • Latence : Il ne faut que 0,94 seconde pour démarrer. C'est moins d'une seconde d'attente.
  • Comparaison : Il est 16 fois plus rapide et 99 fois moins en retard que l'ancien « Chef Maître » (le modèle Ovi), tout en produisant toujours une vidéo de haute qualité où les lèvres bougent parfaitement avec la voix.

Ce Qu'il Peut Faire

L'article montre que ce système fonctionne bien dans divers scénarios :

  • Personnes Réalistes : Création de portraits photoréalistes de personnes parlant.
  • Dessins Animés : Création de personnages stylisés et animés.
  • Groupes : Gestion de scènes avec deux personnes parlant l'une à l'autre.
  • Différents Angles : Fonctionnement pour des gros plans de visages ou des plans d'ensemble du corps.

En bref, Hallo-Live revient à donner à un acteur numérique un scénario sur lequel il peut jeter un coup d'œil anticipé et un ensemble de dégustateurs stricts pour s'assurer qu'il ne précipite pas sa performance, résultant en un avatar parlant qui semble vivant et répond instantanément.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →