UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos
UniSwap est un nouveau cadre qui permet le premier remplacement d'identité audio-visuel en streaming dans les vidéos de type « talking head » en utilisant un transformateur de diffusion unique avec un pipeline d'entraînement de type « swap-and-reconstruct » et des techniques d'échantillonnage efficaces pour parvenir à une génération de longue durée synchronisée, cohérente et stable.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous regardiez un film, mais que l'acteur à l'écran commence soudainement à parler avec une voix différente et à ressembler à une personne complètement différente, tout en prononçant exactement les mêmes mots et en bougeant les lèvres en parfaite synchronisation. C'est le rêve de l'« échange d'identité » dans les vidéos parlantes. Pendant longtemps, les ordinateurs ont été très doués pour réaliser une seule partie de ce tour de magie : soit changer le visage d'une personne tout en gardant sa voix originale, soit changer une voix tout en gardant le visage original. Mais essayer de faire les deux en même temps a été comme essayer de jongler avec deux balles différentes tout en faisant du monocycle ; les résultats étaient souvent désynchronisés, avec des lèvres bougeant sur les mauvais mots ou des voix sonnant de manière robotique. Ce document plonge dans le monde de l'IA générative, en examinant spécifiquement comment nous pouvons apprendre aux ordinateurs à échanger simultanément l'apparence et la voix d'une personne, en temps réel, sans que la vidéo ne saccade ou que l'audio ne soit en retard.
Les chercheurs derrière ce projet, UniSwap, ont construit un nouveau système qui agit comme un maître marionnettiste, tirant les ficelles des côtés visuels et sonores d'une vidéo au moment exact. Au lieu d'utiliser deux outils distincts — l'un pour le visage et l'autre pour la voix — ils ont créé un « cerveau » unique qui comprend comment le visage d'une personne bouge et comment sa voix résonne comme une expérience connectée. Imaginez cela comme un traducteur bilingue qui ne se contente pas de traduire les mots, mais qui capture aussi instantanément l'accent et les expressions faciales de l'orateur.
Le document présente une méthode ingénieuse pour enseigner ce système. Puisqu'il est presque impossible de trouver des vidéos réelles de la même personne prononçant les mêmes répliques tout en ayant l'apparence et la voix de deux personnes différentes, l'équipe a inventé un jeu de « remplacement et reconstruction ». Ils prennent une vidéo réelle, retirent numériquement le visage et la voix de la personne pour créer une version « fantôme », puis demandent à l'IA de reconstruire la vidéo originale en utilisant un nouveau visage et une nouvelle voix comme guides. C'est comme donner à un chef un canevas vierge et une recette, puis lui demander de recréer parfaitement un plat spécifique. En s'entraînant sur des millions de ces « reconstructions », l'IA apprend à échanger les identités tout en préservant les mouvements originaux et l'arrière-plan.
Ce qui rend cela vraiment spécial, c'est que cela fonctionne comme un flux en direct plutôt que comme un film préenregistré et lent. La plupart des générateurs de vidéo doivent regarder l'intégralité du clip avant de pouvoir commencer à dessiner la première image, ce qui est trop lent pour une utilisation interactive. UniSwap, cependant, génère la vidéo par petits blocs, comme un tapis roulant, ce qui lui permet de produire environ 13,6 images par seconde sur une puce informatique puissante (une NVIDIA H100). Bien que cela ne soit pas encore assez rapide pour une interaction en temps réel instantanée, c'est un bond en avant massif, permettant au système de générer des vidéos longues — jusqu'à une heure de long — sans que le visage ou la voix du personnage ne se décalent ou ne se déforment au fil du temps. Les auteurs ont découvert qu'en utilisant une astuce de mémoire spéciale appelée « Feature-RoPE Decomposition », l'IA peut se souvenir de l'identité originale même après avoir généré des milliers d'images, garantissant que le personnage reste cohérent du premier au dernier second.
En résumé, UniSwap suggère que nous pouvons enfin avoir un système unifié qui échange à la fois l'apparence et la voix dans les vidéos parlantes avec une haute synchronisation et une grande stabilité. Bien que la version actuelle ne soit pas tout à fait assez rapide pour une conversation en temps réel (elle est légèrement plus lente que la vitesse d'une lecture vidéo standard), elle prouve qu'un seul modèle peut gérer ces deux tâches ensemble plus efficacement qu'en essayant d'assembler deux systèmes séparés. Les résultats montrent que les mouvements des lèvres restent parfaitement synchronisés avec la nouvelle voix et que l'identité du personnage reste stable, même dans des clips longs, offrant une étape prometteuse vers des avatars numériques plus naturels et interactifs.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.