← Derniers articles
💬 NLP

From Tokens to Faces: Investigating Discrete Speech Representations for 3D Facial Animation

Cet article évalue quatre familles de représentations de parole discrètes pour l'animation faciale 3D, démontrant que l'encodage des classes phonétiques permet des prédictions précises et permettant l'introduction d'un pipeline de Text-to-Speech Audio Visuel (AVTTS) qui utilise des représentations discrètes partagées pour décoder simultanément la parole et le mouvement facial 3D.

Auteurs originaux : Pedro Correa, Olivier Perrotin, Samir Sadok, Paula Costa, Thomas Hueber

Publié 2026-06-12
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Pedro Correa, Olivier Perrotin, Samir Sadok, Paula Costa, Thomas Hueber

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot comment parler et bouger son visage en même temps. Vous avez la voix du robot, mais comment dire à son visage quoi faire ? Devez-vous lui donner un script détaillé de chaque mouvement musculaire ? Devez-vous lui donner un fichier audio brut ? Ou devez-vous lui donner un ensemble d'instructions codées simples ?

Cet article, intitulé « From Tokens to Faces », est essentiellement un test de dégustation. Les chercheurs voulaient découvrir quel type de « code d'instruction » fonctionne le mieux pour rendre un visage animé en 3D naturel lorsqu'il parle.

Les quatre types de « codes d'instruction »

Les chercheurs ont testé quatre manières différentes de traduire la parole humaine en données (appelées « représentations ») qu'un ordinateur peut comprendre :

  1. Le code « Sémantique » (HuBERT) : Considérez cela comme un traducteur qui comprend le sens de la phrase. Il sait ce que les mots disent et le contexte environnant. Il est excellent pour comprendre l'« idée » du discours.
  2. Le code « Acoustique » (WavTokenizer) : C'est comme un compresseur audio à haute vitesse. Il se concentre uniquement sur les ondes sonores et leur ressenti, ignorant le sens ou les lettres spécifiques. Il est très efficace pour recréer le son, mais il ne « connaît » pas vraiment les mots.
  3. Le code « Hybride » (SpeechTokenizer) : C'est un mélange des deux. Il essaie de comprendre à la fois le sens des mots et la texture du son en même temps.
  4. Le code « Basé sur des étiquettes » (CosyVoice2) : C'est comme un professeur strict utilisant une liste de contrôle. Il décompose la parole en étiquettes discrètes spécifiques (comme des lettres ou des sons particuliers) et se concentre sur la structure de la langue plutôt que sur le son fluide.

L'expérience : Le décodeur de visage

Les chercheurs ont pris ces quatre codes différents et les ont injectés dans deux « pilotes de visage » (décodeurs) différents :

  • Le GRU : Un pilote étape par étape qui regarde un cadre du visage à la fois.
  • Le Transformer : Un pilote qui regarde la phrase entière d'un coup, comme lire un paragraphe pour en comprendre le flux.

Ils ont ensuite mesuré la capacité des visages animés à correspondre aux visages humains réels en utilisant trois méthodes :

  • Mathématiques : Mesurer la distance entre les lèvres du robot et les lèvres de l'humain.
  • Fluidité : Vérifier si le visage était saccadé ou s'il bougeait de manière fluide.
  • Le test de « l'œil humain » : Ils ont fait regarder les vidéos à de vraies personnes et ont demandé de noter leur réalisme, de la même manière qu'un test de dégustation à l'aveugle.

Ce qu'ils ont découvert

Voici les résultats surprenants, expliqués simplement :

  • Le sens compte : Le code « Sémantique » (le traducteur) et le code « Basé sur des étiquettes » (la liste de contrôle) ont été les vainqueurs. Ils ont produit les visages les plus réalistes. Il s'avère que pour qu'un visage bouge naturellement, il doit savoir ce qui est dit (les classes phonétiques), et pas seulement comment les ondes sonores vibrent.
  • Trop de son est un mal : Le code « Acoustique » (le son pur) et le code « Hybride » (son + sens) ont mal performé. Il semble que si l'ordinateur est trop concentré sur les détails bruts du son, il s'embrouille sur la façon de bouger les lèvres. Le « bruit » du son a réellement fait obstacle à l'animation faciale.
  • Le meilleur pilote : Le pilote « Transformer » (celui qui regarde la phrase entière) a bien mieux fonctionné avec les codes discrets que le pilote étape par étape.
  • La surprise du « Basé sur des étiquettes » : Le code « Basé sur des étiquettes », qui a été conçu à l'origine pour la synthèse vocale (text-to-speech), a presque aussi bien fonctionné que le code « Sémantique » complexe. C'est un événement majeur car c'est plus simple et plus structuré.

La grande idée : La machine « Tout-en-un »

La partie la plus excitante de l'article est une nouvelle idée qu'ils appellent AVTTS (Audio Visual Text-to-Speech).

Habituellement, pour créer une tête parlante, vous devez passer par deux étapes :

  1. Transformer le texte en audio.
  2. Transformer cet audio en un visage en mouvement.

Les chercheurs ont montré que, puisque le code « Basé sur des étiquettes » est si bon pour représenter la parole, vous pouvez l'utiliser comme un langage partagé. Vous pouvez injecter du texte dans le système, et il peut recracher à la fois l'audio et le visage en mouvement, parfaitement synchronisés, sans avoir besoin d'une étape intermédiaire. C'est comme un chef d'orchestre qui peut diriger à la fois l'orchestre (la voix) et les danseurs (le visage) à partir d'une seule partition de musique.

L'essentiel à retenir

Pour qu'un visage de robot paraisse réel, vous n'avez pas besoin de lui fournir chaque minuscule détail de l'onde sonore. Vous avez besoin de lui fournir une compréhension claire et structurée des sons et des lettres prononcés. Si vous donnez à l'ordinateur une « carte » claire de la parole (comme une liste de contrôle des sons), il peut comprendre comment bouger les lèvres parfaitement, même s'il ne possède pas le fichier audio brut pour commencer.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →