← Derniers articles
💻 computer science

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars

InteractiveAvatar est un cadre de génération de vidéo en streaming infini et en temps réel qui exploite la distillation autorégressive, un mécanisme de mémoire visuelle long-court et un module de raisonnement-réaction pour atteindre une cohérence visuelle et des interactions fondées sur l'intention de pointe pour les avatars pilotés par l'audio.

Auteurs originaux : Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

Publié 2026-06-23
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous parlez à un ami numérique lors d'un appel vidéo. Habituellement, ces amis numériques sont un peu comme des marionnettes cassées : ils peuvent bouger les lèvres parfaitement pour correspondre à votre voix, mais si vous leur parlez trop longtemps, leur visage peut commencer à paraître bizarre, ou ils peuvent oublier à quoi ils ressemblaient il y a cinq minutes. De plus, si vous leur demandez de « vérifier l'heure », ils peuvent simplement dire l'heure à voix haute tout en continuant de fixer le vide, incapables de regarder réellement une montre.

Le papier InteractiveAvatar présente une nouvelle façon de construire ces amis numériques pour qu'ils puissent discuter avec vous indéfiniment sans paraître glitchés, et pour qu'ils puissent réellement faire les choses que vous leur demandez de faire.

Voici comment ils ont procédé, expliqué avec des analogies simples :

1. Le Problème : L'« Amnésie » et le « Robot »

Les auteurs affirment que les avatars numériques actuels présentent deux problèmes principaux :

  • Le Visage qui « Dérive » : Si vous laissez la vidéo tourner pendant longtemps, le visage de l'avatar commence lentement à changer. Peut-être que les yeux deviennent plus grands, ou que la couleur des cheveux change. C'est comme un peintre qui continue d'ajouter de nouvelles couches de peinture sans regarder le croquis original ; finalement, l'image ne ressemble plus du tout à la personne avec laquelle vous avez commencé.
  • Le Robot « Aveugle » : Les avatars actuels sont principalement « pilotés par l'audio ». Si vous dites « Regarde la montre », ils entendent le son et bougent la bouche, mais ils ne comprennent pas la signification. Ils ne tournent pas réellement la tête pour regarder une montre parce qu'ils ne « réfléchissent » pas à votre requête.

2. La Solution : Un Cerveau en Deux Parties

Pour corriger cela, l'équipe a construit un système doté de deux outils spéciaux : un Système de Mémoire et un Cerveau Pensant.

Le Système de Mémoire : « Le Carnet de Notes à Court Terme et l'Album Photo à Long Terme »

Pour empêcher le visage de l'avatar de dériver, ils ont créé quelque chose appelé Mémoire Visuelle Long-Court (LSVM).

  • Le Carnet de Notes à Court Terme : Imaginez que l'avatar garde un carnet de notes des dernières secondes de la vidéo. Cela garantit que lorsqu'il bouge la tête, le mouvement est fluide et naturel, et non saccadé.
  • L'Album Photo à Long Terme : C'est la partie ingénieuse. Au lieu d'essayer de se souvenir de chaque image (ce qui serait trop lourd et lent), l'avatar possède un « Album Photo » des moments les plus importants.
    • Comment ça marche : Pendant que la vidéo joue, le système demande constamment : « Est-ce que cette nouvelle image est importante ? » Si l'avatar met un chapeau ou prend une tasse de café, le système prend un « instantané » et le place dans l'album. Si l'avatar est juste assis en train de parler, il peut sauter l'instantané.
    • Le Bénéfice : Cela agit comme une ancre. Même après 10 minutes de discussion, l'avatar peut regarder son « album » pour se rappeler : « Ah oui, je porte un chapeau », ou « J'ai une tasse de café ». Cela permet au personnage de rester cohérent du début à la fin.

Le Cerveau Pensant : « Le Réalisateur et le Régisseur »

Pour que l'avatar comprenne ce que vous voulez, ils ont ajouté un Module de Raisonnement-Réaction (RRM).

  • Le Réalisateur (LLM) : Quand vous parlez, un puissant « Réalisateur » IA vous écoute. Il ne se contente pas d'entendre les mots ; il comprend votre intention. Si vous dites « Vérifie l'heure », le Réalisateur réalise : « Ah, l'utilisateur veut que l'avatar regarde une montre ».
  • Le Cycle d'État (State Cycling) : Le système bascule entre deux modes :
    1. Mode Action : L'avatar est occupé à faire quelque chose (comme regarder une montre ou s'asseoir).
    2. Mode Stable : Une fois l'action terminée, l'avatar adopte une pose calme (comme s'asseoir tranquillement) afin de ne pas bouger inutilement.
  • Le Changement Rapide (Cache-Switching) : Habituellement, lorsqu'une instruction change, l'ordinateur doit tout recalculer, ce qui prend du temps. Ce système utilise une astuce de « Changement Rapide ». Il garde une sauvegarde des calculs pour la scène actuelle. Lorsque l'instruction change (par exemple, de « lève-toi » à « assieds-toi »), il remplace instantanément l'ancienne sauvegarde par la nouvelle, rendant la réaction immédiate et fluide.

3. Le Résultat : Une Conversation Réelle et Infinie

En combinant ces outils avec une méthode d'entraînement spéciale (appelée Distillation, qui consiste à apprendre à un étudiant à résoudre un problème en une étape au lieu de dix), ils ont créé un système qui :

  • Fonctionne en Temps Réel : Vous pouvez parler à l'avatar, et il répond immédiatement, sans longs temps d'attente.
  • Dure Éternellement : Vous pouvez avoir une conversation pendant des heures, et l'avatar aura toujours la même apparence, avec les mêmes vêtements et accessoires.
  • Vous Comprend : Si vous lui demandez d'accomplir une action, il l'accomplit réellement, plutôt que de simplement en parler.

En résumé : InteractiveAvatar est comme si l'on donnait à une marionnette numérique une mémoire à long terme pour qu'elle n'oublie pas son visage, et un cerveau qui comprend vos blagues et vos requêtes, permettant une conversation fluide, infinie et réaliste.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →