← Derniers articles
💻 computer science

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

OmniMate est un cadre unifié qui permet la génération d'avatars audiovisuels en temps réel, de haute qualité, à faible latence et à l'ouverture étendue, en introduisant un Contrôleur de Progression de Génération pour une progression adaptative de la réponse et un Module de Conditionnement Multi-Référence pour assurer la cohérence identitaire cross-modale à long terme.

Auteurs originaux : Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

Publié 2026-07-29
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous parlez à un ami qui vit à l'intérieur d'un écran d'ordinateur. Vous voulez qu'il ne se contente pas de parler, mais qu'il bouge les mains, cligne des yeux et réagisse à votre voix en temps réel, tout comme une vraie personne. C'est le rêve des « avatars interactifs ». Pendant longtemps, créer ces personnages numériques revenait à filmer un film : il fallait planifier chaque réplique et chaque geste avant de pouvoir appuyer sur « lecture ». Mais récemment, des scientifiques ont conçu des « modèles de diffusion », qui sont comme des pinceaux magiques capables de créer instantanément des vidéos et des sons de haute qualité à partir de texte. Cette technologie est devenue si performante qu'elle peut désormais faire parler et bouger un personnage en synchronisation avec l'audio. Cependant, il y a un bémol : ces modèles fonctionnent généralement mieux lorsqu'ils savent exactement quelle sera la durée de la conversation. Si vous tentez d'avoir une discussion libre et fluide où l'ordinateur doit deviner quand s'arrêter de parler et recommencer à écouter, le personnage se retrouve souvent confus, continue de parler trop longtemps ou commence à ressembler à une personne différente après quelques minutes. Ce document traite précisément de ce problème : comment créer un ami numérique capable de discuter avec vous indéfiniment, sans perdre son visage ou sa voix, et sans être en retard sur vos paroles.

Les chercheurs derrière ce projet, une équipe de l'Université de Xi'an Jiaotong et de China Telecom, ont construit un nouveau système appelé OmniMate. Voyez OmniMate comme un marionnettiste numérique super intelligent capable de gérer une conversation sans fin en temps réel. Contra\à l'inverse des systèmes précédents qui pourraient trébucher lorsque la conversation s'allonge ou lorsque l'utilisateur les interrompt, OmniMate est conçu pour être fluide, passant instantanément du mode « parole » au mode « écoute » tout en gardant le personnage identique visuellement et vocalement.

Le secret de la réussite d'OmniMate réside dans deux astuces ingénieuses qu'il utilise pour rester sur le qui-vive. Premièrement, il utilise ce qu'on appelle un Contrôleur de Progression de Génération (GPC). Imaginez que vous lisez un livre d'images, mais que vous ne savez pas combien de pages il reste. Habituellement, vous pourriez continuer à lire au-delà de la fin ou vous arrêter trop tôt. Le GPC est comme un compteur de pages intégré qui indique à l'avatar exactement quelle partie de sa réponse reste à générer. Il fournit au système une « barre de progression » pour chaque minuscule fragment de vidéo et d'audio qu'il crée. Cela permet à l'avatar de savoir précisément quand terminer une phrase et de repasser en douceur à une posture d'« écoute », attendant votre prochaine intervention. Sans cela, l'avatar pourrait continuer à parler après avoir fini, ou se figer de manière maladroite.

La seconde astuce est le Module de Conditionnement Multi-Référence (MRCM). Avez-vous déjà remarqué que si vous regardez une photo d'une personne sous un angle étrange, elle peut paraître un peu différente ? Dans les vidéos longues, les avatars numériques souffrent souvent de « dérive d'identité », où leur visage se transforme lentement en celui d'une autre personne, ou leur voix change de tonalité. OmniMate résout cela en se rappelant constamment qui est le personnage. Au lieu de simplement regarder la toute première image de la vidéo, il conserve une « banque de mémoire » de plusieurs photos de référence et un échantillon de la voix du personnage. Pendant que la vidéo joue, il vérifie constamment ces références, comme un peintre jetant un regard sur un portrait pour s'assurer que le nez et les yeux restent corrects, garantissant que le personnage garde la même apparence et la même voix qu'il parle pendant 10 secondes ou 10 minutes.

L'équipe a testé OmniMate sur un benchmark appelé VerseBench, qui simule de vraies conversations. Les résultats sont impressionnants : le système peut générer de la vidéo et de l'audio à une vitesse de 27,64 images par seconde (FPS), avec un « temps jusqu'à la première image » (le temps qu'il faut pour commencer à montrer la vidéo) de seulement 3,49 secondes. C'est assez rapide pour donner l'impression d'une véritable conversation en direct. Lors des tests, OmniMate a surpassé les autres modèles de pointe pour maintenir la cohérence du visage et de la voix sur de longues périodes. Alors que d'autres systèmes peuvent devenir flous ou changer de voix après une minute, OmniMate est resté stable même lors de tests durant jusqu'à 240 secondes.

Cependant, les auteurs précisent avec prudence que le système n'est pas encore parfait. Si le système devine mal la durée d'une réponse, l'avatar peut couper un mot ou se répéter. De plus, si le personnage doit faire quelque chose qui change radicalement son apparence, comme un changement de costume majeur, le système pourrait avoir du mal à maintenir la cohérence de l'identité. Mais dans l'ensemble, OmniMate suggère une avancée majeure : un moyen d'avoir des amis numériques capables de discuter avec nous en temps réel, de se souvenir de qui ils sont et de réagir à nous sans les bugs gênants du passé. Il transforme les vidéos statiques et pré-planifiées d'aujourd'hui en conversations dynamiques et vivantes pour demain.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →