Vidu S1: A Real-Time Interactive Video Generation Model
Vidu S1 est un modèle de génération de vidéo interactive en temps réel qui permet aux utilisateurs de contrôler des personnages numériques via des commandes vocales pour produire des vidéos de longueur infinie et de haute qualité en 540p jusqu'à 42 FPS sur des GPU grand public sans dégradation visuelle.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous regardez un film où les personnages ne peuvent pas vous entendre, peu importe à quel point vous hurlez devant l'écran. Vous ne pouvez pas leur dire de faire un signe de la main, de paraître surpris ou de changer de scène ; vous devez simplement vous asseoir et attendre que le réalisateur finisse tout le montage avant de voir le résultat. C'est ainsi que fonctionne la plupart de la génération de vidéo par IA aujourd'hui : vous tapez une requête, attendez longtemps, et obtenez un clip terminé. Mais et si vous pouviez parler au personnage pendant qu'il est en train d'être créé ? Et si vous pouviez dire : « Hé, fais un pouce levé ! » et qu'il le faisait instantanément, en plein milieu de la conversation ? C'est le rêve de la génération de vidéo interactive en temps réel. C'est un domaine qui tente de combler le fossé entre les films statiques et pré-établis et la nature fluide et instantanée d'une conversation en direct. Pour ce faire, les scientifiques construisent des modèles qui ne se contentent pas de « peindre » une image entière d'un coup, mais qui « diffusent » plutôt la vidéo image par image, réagissant à votre voix au fur et à mesure, un peu comme un acteur humain improvisant une scène en fonction des consignes immédiates du metteur en scène.
Entrez dans Vidu S1, un nouveau modèle qui agit comme un acteur numérique super rapide et super réactif qui ne rate jamais une note. Les chercheurs derrière ce projet voulaient résoudre le problème de la génération vidéo « hors ligne », où vous devez attendre des minutes ou même des heures pour un résultat. Au lieu de cela, ils ont construit un système qui vous permet de contrôler un personnage numérique avec votre voix en temps réel. Voyez cela comme un personnage de jeu vidéo qui ne se contente pas de suivre un script pré-écrit, mais qui écoute vos commandes vocales et réagit instantanément, que vous lui demandiez de faire un signe de la main, de s'asseoir ou de former un cœur avec ses mains. Le plus cool, c'est que cela ne fonctionne pas seulement pour quelques secondes ; l'article suggère que Vidu S1 peut maintenir cela pendant un temps « infini » sans que le visage du personnage ne devienne flou ou que ses mouvements ne deviennent bizarres et saccadés, un problème qui survient généralement lorsque l'IA essaie de créer de longues vidéos.
L'équipe derrière Vidu S1 n'a pas seulement construit le cerveau ; elle a également construit un moteur super efficace pour le faire fonctionner rapidement. Ils ont utilisé des astuces spéciales (qu'ils appellent « TurboDiffusion » et « TurboServe ») pour compresser la génération de vidéo sur des cartes graphiques ordinaires que l'on pourrait trouver dans une configuration de gamer. Le résultat ? Le modèle peut recracher de la vidéo en résolution 540p à une vitesse de 42 FPS (images par seconde). Pour mettre cela en perspective, une vidéo standard se joue à 30 FPS, donc c'est en fait plus rapide que le temps réel, ce qui signifie que l'IA peut suivre une conversation en direct sans décalage. Les chercheurs ont testé cela en demandant aux utilisateurs de télécharger des photos d'eux-mêmes, de personnages d'anime ou même d'animaux de compagnie, puis de donner des instructions vocales. Le modèle a généré avec succès des vidéos où les personnages suivaient les commandes, comme lever une jambe ou faire un pouce levé, tout en gardant leur visage exactement comme sur la photo téléchargée.
L'un des plus grands obstacles que l'article aborde est le problème de la « dérive ». Imaginez que vous essayez de dessiner le portrait d'une personne, mais chaque fois que vous ajoutez un nouveau détail, l'image entière commence lentement à se déformer et à se tordre jusqu'à ce que la personne ressemble à un monstre. De nombreux modèles de vidéo par IA souffrent de cela lorsqu'ils tentent de créer de longues vidéos ; plus la vidéo est longue, plus le visage du personnage ou l'arrière-plan se déforme. Vidu S1 utilise un système de mémoire ingénieux appelé « TwinCache » pour empêcher cela. C'est comme avoir un bibliothécaire qui garde un « croquis sommaire » des dernières secondes pour garder le mouvement fluide, tout en gardant une « version finale polie » pour s'assurer que le visage du personnage reste net et reconnaissable. Cela permet à la vidéo de continuer à défiler indéfiniment sans que le personnage ne s'effondre.
L'article souligne également que bien que d'autres modèles existent, la plupart sont soit trop lents pour être interactifs, soit ne peuvent pas comprendre directement les commandes vocales, soit s'effondrent après une courte période. Vidu S1 est conçu spécifiquement pour être l'opposé : il prend votre voix comme une commande directe, génère la vidéo instantanément et la maintient stable aussi longtemps que vous voulez parler. Dans leurs tests, le modèle a été comparé à d'autres systèmes de pointe, et il arrive en tête en termes de capacité à suivre les instructions et de naturel des mouvements. Les chercheurs affirment qu'avec cette technologie, nous nous rapprochons d'un avenir où vous pourrez avoir une conversation en direct et personnalisée avec un personnage numérique qui ressemble et bouge comme une vraie personne, le tout généré à la volée directement sur votre ordinateur.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.