CETalk: Continuous Valence-Arousal Control for Audio-Driven 3D Talking Head Generation
Cet article présente CETalk, un cadre de génération de têtes parlantes 3D piloté par l'audio qui exploite des représentations continues de Valence-Arousal et une architecture de modélisation temporelle multi-échelle pour parvenir à un contrôle émotionnel précis et une synchronisation labiale exacte, tout en surmontant les limites des catégories d'émotions discrètes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de l'évolution rapide des médias numériques, la capacité de créer des humains virtuels réalistes est passée du domaine de la science-fiction à celui de l'application pratique. Ces avatars numériques sont de plus en plus utilisés comme assistants virtuels, dans la communication en réalité virtuelle et pour le divertissement interactif. Un défi central dans ce domaine consiste à faire en sorte que ces personnages parlent avec leur visage, et pas seulement avec leur bouche. Si les premiers systèmes pouvaient réussir à faire correspondre les mouvements des lèvres aux paroles prononcées, ils avaient souvent du mal à transmettre les émotions subtiles et changeantes qui rendent la conversation humaine réelle. Les approches traditionnelles traitaient les émotions comme des cases distinctes et séparées, telles que « joyeux », « triste » ou « en colère ». Cette méthode fonctionnait pour les traits généraux, mais échouait à capturer la nature fluide et continue du sentiment humain, où un sourire peut s'effacer lentement pour laisser place à un regard d'inquiétude, ou bien où l'excitation peut couver tranquillement avant d'éclater. De plus, le rythme de la parole et le rythme de l'émotion sont fondamentalement différents ; la bouche doit bouger rapidement pour correspondre aux sons rapides des mots, tandis que les expressions émotionnelles évoluent souvent plus lentement sur l'ensemble du visage.
Des chercheurs de l'Université de technologie de Hefei ont développé un nouveau système appelé CETalk pour résoudre ces problèmes spécifiques. Au lieu de forcer les émotions dans des catégories rigides, ce système utilise une carte bidimensionnelle continue pour décrire les sentiments, suivant à quel point un sentiment est positif ou négatif et à quel point il est actif ou passif. Cette approche permet à l'ordinateur de générer des animations faciales qui changent de manière fluide, reflétant le flux et le reflux naturel de la conversation humaine. L'équipe a construit un nouvel ensemble de données étendu pour entraîner leur système, reconstruisant les mouvements faciaux en 3D à partir d'enregistrements vidéo existants et estimant automatiquement ces valeurs émotionnelles continues pour chaque image. Ces données ont fourni la base nécessaire pour apprendre à l'ordinateur à distinguer les mouvements rapides et précis requis pour la parole et les changements plus lents et plus larges qui transmettent l'humeur.
Le cœur du nouveau système réside dans sa gestion du temps. Les chercheurs ont réalisé que la parole et l'émotion opèrent à des vitesses différentes, tout comme un batteur qui maintient un rythme rapide et régulier tandis qu'un chanteur tient une note longue et lente. Pour gérer cela, le système divise le traitement en deux voies parallèles. Une voie se concentre sur les détails à haute vitesse de la bouche et de la mâchoire, garantissant que chaque syllabe est parfaitement synchronisée avec l'audio. L'autre voie se concentre sur les mouvements plus lents et plus larges du visage qui expriment l'émotion, comme un sourcil froncé ou un écarquillement des yeux. Ces deux flux d'informations sont ensuite réunis par un système d'intégration intelligent qui décide, moment par moment, du poids à accorder aux mouvements de la parole par rapport à l'expression émotionnelle. Cela permet à l'animation finale d'être à la fois précise dans sa synchronisation labiale et riche dans sa profondeur émotionnelle.
Pour tester leur travail, l'équipe a comparé leur système à plusieurs méthodes existantes en utilisant trois ensembles différents de données vidéo. Les résultats ont montré que leur approche produisait des mouvements de lèvres nettement plus précis et des expressions faciales plus réalistes que les meilleures méthodes précédentes. Lors des tests sur l'ensemble de données MEAD, leur système a réduit les erreurs de mouvement des lèvres à environ 7,48 millimètres et les erreurs de mouvement facial global à environ 9,91 millimètres, surpassant toutes les autres technologies testées sur ce benchmark spécifique. Au-delà de la simple précision, le système a démontré une capacité supérieure à suivre des instructions émotionnelles continues. Lorsqu'on lui a demandé de générer un visage passant progressivement d'un état négatif à un état positif, le système a suivi la trajectoire avec une grande précision, correspondant à la trajectoire émotionnelle prévue bien mieux que ses concurrents.
Les chercheurs ont également démontré que le système permet un contrôle précis de l'intensité d'une émotion. En ajustant les valeurs d'entrée, ils pouvaient rendre l'expression d'un personnage subtilement plus intense ou plus atténuée sans rompre la synchronisation avec la voix. Ce niveau de contrôle est crucial pour créer des humains numériques qui semblent véritablement vivants, capables des changements émotionnels nuancés et continus qui définissent l'interaction humaine réelle. En s'éloignant des catégories discrètes et en embrassant la nature continue de l'affect humain, ce travail offre une étape significative pour que la communication virtuelle ressemble moins à l'observation d'une machine et plus à une connexion avec une personne.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.