← Derniers articles
💻 computer science

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer est un cadre de post-entraînement qui permet le streaming audio-vidéo de texte long en temps réel en combinant un générateur causal entraîné avec des stratégies de forçage mixtes, la distillation DMD pour la stabilité à long horizon, et un modèle de langage externe pour la planification de la parole afin d'obtenir une génération d'avatar rapide, synchronisée et cohérente.

Auteurs originaux : Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

Publié 2026-08-07
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot à raconter une histoire. Vous voulez qu'il parle, qu'il bouge les lèvres et qu'il change ses expressions faciales en même temps, tout comme une vraie personne. Pendant longtemps, les meilleurs robots ne pouvaient faire cela que pour de très courtes séquences, comme une salutation de 5 secondes. Ils fonctionnaient comme un réalisateur regardant l'intégralité du script avant de filmer une scène, anticipant ce qui allait se passer ensuite. Mais dans le monde réel, nous n'avons pas le temps d'attendre que toute l'histoire soit écrite avant de commencer à parler. Nous avons besoin que le robot parle maintenant, en se basant uniquement sur ce qu'il a dit jusqu'à présent, tout en gardant son visage et sa voix parfaitement synchronisés. C'est le défi du « streaming en temps réel ». Le problème est que si un robot commet une minuscule erreur dans la première seconde, cette erreur peut s'accumuler avec le temps, rendant le visage du robot étrange ou faisant dériver sa voix hors sujet à la fin de la conversation. Les scientifiques ont essayé de trouver comment faire pour que ces avatars numériques parlent pendant des minutes entières sans perdre la tête ou son rythme.

Entrez en scène Vorch-Streamer, un nouveau système qui agit comme un conteur super organisé en temps réel. Au lieu d'essayer de mémoriser tout le script avant de parler, Vorch-Streamer utilise une stratégie astucieuse en deux parties pour faire durer le spectacle pendant plus de deux minutes sans s'arrêter. Voyez cela comme un groupe de musique jouant une longue séance d'improvisation. Habituellement, si un musicien joue une fausse note, le reste de la chanson peut devenir désordonné. Mais Vorch-Streamer possède un mode « répétition » spécial. D'abord, il s'entraîne à jouer de courts segments tout en étant doucement corrigé par un professeur (un modèle pré-entraîné qui sait le faire parfaitement). Ensuite, il s'entraîne à jouer toute la chanson du début à la fin, mais cette fois, il écoute ses propres erreurs précédentes et apprend à les corriger à la volée, tout en un « chef d'orchestre » (un planificateur IA) lui indiquant exactement quels mots dire ensuite.

Le résultat est un avatar numérique capable de générer de la vidéo et de l'audio simultanément à 27,12 images par seconde (FPS). Pour mettre cela en perspective, une vidéo standard se joue à 24 FPS, ce qui signifie que ce robot est en fait plus rapide que le temps réel ! Il peut garder un visage qui ressemble toujours à la même personne, ses lèvres bougeant en parfaite synchronisation avec ses paroles, et sa voix claire et précise pendant près de deux minutes consécutives. Les chercheurs ont découvert que sans une étape spécifique de « planification » pour décider de ce qu'il faut dire ensuite, le robot se perdrait et commencerait à dire des charabia ou à se répéter. En ajoutant ce planificateur, le système résout avec succès l'énigme de la manière de maintenir une conversation fluide sans avoir besoin de voir l'avenir. Cela prouve que vous pouvez prendre un robot puissant et lent qui connaît toute l'histoire et le transformer en un performeur rapide et vivant qui en sait juste assez pour faire durer le spectacle, seconde après seconde.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →