← Nieuwste papers
🤖 AI

CETalk: Continuous Valence-Arousal Control for Audio-Driven 3D Talking Head Generation

Dit artikel introduceert CETalk, een audio-gestuurd framework voor het genereren van 3D pratende hoofden dat gebruikmaakt van continue Valence-Arousal-representaties en een multi-schaal temporele modelleringsarchitectuur om fijnmazige emotionele controle en nauwkeurige lip-synchronisatie te bereiken, terwijl de beperkingen van discrete emotie-categorieën worden overwonnen.

Oorspronkelijke auteurs: Peng Jia, Li Dai, Zhen Xiao, Xueliang Liu, Jia Li

Gepubliceerd 2026-08-18
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Peng Jia, Li Dai, Zhen Xiao, Xueliang Liu, Jia Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de snel evoluerende wereld van digitale media is het vermogen om levensechte virtuele mensen te creëren verschoven van het domein van sciencefiction naar praktische toepassing. Deze digitale avatars worden steeds vaker gebruikt als virtuele assistenten, in virtuele realiteit-communicatie en voor interactief entertainment. Een centrale uitdaging in dit veld is het laten spreken van deze personages met hun gezicht, en niet alleen met hun mond. Hoewel vroege systemen er succesvol in slaagden om lipbewegingen af te stemmen op gesproken woorden, hadden ze vaak moeite met het overbrengen van de subtiele, verschuivende emoties die menselijke conversatie echt laten voelen. Traditionele benaderingen behandelden emoties als afzonderlijke, strikt gescheiden categorieën, zoals "blij", "verdrietig" of "boos". Deze methode werkte voor de grove lijnen, maar slaagde er niet in de vloeiende, continue aard van menselijke gevoelens te vangen, waarbij een glimlach langzaam kan vervagen naar een blik van bezorgdheid of waar opwinding zich rustig kan opbouwen voordat het tot uitbarsting komt. Bovendien zijn de timing van spraak en de timing van emotie fundamenteel verschillend; de mond moet snel bewegen om overeen te komen met de snelle klanken van woorden, terwijl emotionele expressies zich vaak langzamer over het hele gezicht ontwikkelen.

Onderzoekers aan de Hefei University of Technology hebben een nieuw systeem ontwikkeld genaamd CETalk om deze specifieke problemen op te lossen. In plaats van emoties in rigide categorieën te dwingen, gebruikt dit systeem een continue tweedimensionale kaart om gevoelens te beschrijven, waarbij wordt bijgehouden hoe positief of negatief een gevoel is en hoe actief of passief het aanvoelt. Deze aanpak stelt de computer in staat om gezichtsanimaties te genereren die soepel verschuiven, wat de natuurlijke eb en vloed van een menselijk gesprek weerspiegelt. Het team heeft een grote nieuwe dataset gebouwd om hun systeem te trainen, waarbij 3D-gezichtsbewegingen werden gereconstrueerd uit bestaande video-opnames en deze continue emotionele waarden automatisch werden geschat voor elk afzonderlijk frame. Deze data vormde het noodzakelijke fundament om de computer te leren het onderscheid te maken tussen de snelle, precieze bewegingen die nodig zijn voor spraak en de langzamere, brede veranderingen die stemming overbrengen.

De kern van het nieuwe systeem ligt in de manier waarop het met tijd omgaat. De onderzoekers realiseerden zich dat spraak en emotie op verschillende snelheden opereren, vergelijkbaar met hoe een drummer een gestage, snelle beat aanhoudt terwijl een zanger een lange, langzame noot vasthoudt. Om dit te beheren, splitst het systeem de verwerking op in twee parallelle paden. Eén pad richt zich op de snelle details van de mond en de kaak, om ervoor te zorgen dat elke lettergreep perfect gesynchroniseerd is met de audio. Het andere pad richt zich op de langzamere, bredere bewegingen van het gezicht die emotie uitdrukken, zoals een gefronste wenkbrauw of het verwijden van de ogen. Deze twee informatiestromen worden vervolgens samengebracht door een slim integratiesysteem dat moment per moment beslist hoeveel gewicht er aan de spraakbewegingen versus de emotionele expressie moet worden gegeven. Dit zorgt ervoor dat de uiteindelijke animatie zowel accuraat is in de lipsynchronisatie als rijk aan emotionele diepgang.

Om hun werk te testen, vergeleken het team hun systeem met verschillende bestaande methoden met behulp van drie verschillende sets videodata. De resultaten toonden aan dat hun aanpak aanzienlijk nauwkeurigere lipbewegingen en meer realistische gezichtsuitdrukkingen produceerde dan de voorheen beste methoden. In tests op de MEAD-dataset verminderde hun systeem de fouten in lipbewegingen tot ongeveer 7,48 millimeter en de algehele fouten in gezichtsbewegingen tot ongeveer 9,91 millimeter, waarmee zij alle andere geteste technologieën op die specifieke benchmark overtroffen. Naast alleen nauwkeurigheid demonstreerde het systeem een superieur vermogen om continue emotionele instructies te volgen. Wanneer gevraagd werd om een gezicht te genereren dat geleidelijk verschoof van een negatieve staat naar een positieve staat, volgde het systeem het traject met hoge precisie en kwam het de beoogde emotionele curve veel beter overeen dan de concurrenten.

De onderzoekers hebben ook aangetoond dat het systeem zorgt voor fijne controle over de intensiteit van een emotie. Door de invoerwaarden aan te passen, konden ze de expressie van een personage subtiel intenser of ingetogener maken zonder de synchronisatie met de stem te verbreken. Dit niveau van controle is cruciaal voor het creëren van digitale mensen die echt levend lijken, in staat tot de genuanceerde, continue emotionele verschuivingen die echte menselijke interactie definiend maken. Door af te stappen van discrete categorieën en de continue aard van menselijke affectiviteit te omarmen, biedt dit werk een belangrijke stap voorwaarts om virtuele communicatie minder te laten voelen als het kijken naar een machine en meer als het verbinden met een persoon.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →