← Nieuwste papers
💬 NLP

From Tokens to Faces: Investigating Discrete Speech Representations for 3D Facial Animation

Dit artikel evalueert vier families van discrete spraakrepresentaties voor 3D-gezichtsanimatie, waarbij wordt aangetoond dat het coderen van fonetische klassen nauwkeurige voorspellingen oplevert en de introductie van een Audio Visual Text-to-Speech (AVTTS) pijplijn mogelijk maakt die gedeelde discrete representaties gebruikt om gelijktijdig spraak en 3D-gezichtsbeweging te decoderen.

Oorspronkelijke auteurs: Pedro Correa, Olivier Perrotin, Samir Sadok, Paula Costa, Thomas Hueber

Gepubliceerd 2026-06-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Pedro Correa, Olivier Perrotin, Samir Sadok, Paula Costa, Thomas Hueber

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij moet praten en tegelijkertijd zijn gezicht moet bewegen. Je hebt de stem van de robot, maar hoe vertel je het gezicht wat het moet doen? Geef je het een gedetailleerd script van elke spierbeweging? Geef je het een ruw audiobestand? Of geef je het een reeks eenvoudige, gecodeerde instructies?

Dit artikel, getiteld "From Tokens to Faces," is in feite een smaaktest. De onderzoekers wilden ontdekken welk type "instructiecode" het beste werkt om een 3D-geanimeerd gezicht er natuurlijk uit te laten zien wanneer het spreekt.

De vier soorten "instructiecodes"

De onderzoekers testten vier verschillende manieren om menselijke spraak te vertalen naar data (genaamd "representaties") die een computer kan begrijpen:

  1. De "Semantische" code (HuBERT): Denk aan dit als een vertaler die de betekenis van de zin begrijpt. Hij weet wat er wordt gezegd en de context eromheen. Het is geweldig in het begrijpen van de "idee" van de spraak.
  2. De "Akoestische" code (WavTokenizer): Dit is als een hogesnelheids-audiocompressor. Het focust puur op de geluidsgolven en hoe ze aanvoelen, waarbij de betekenis of de specifieke letters worden genegeerd. Het is zeer efficiënt in het recreëren van het geluid, maar het "weet" niets over woorden.
  3. De "Hybride" code (SpeechTokenizer): Dit is een mix van de twee. Het probeert zowel de betekenis van de woorden als de textuur van het geluid tegelijkertijd te begrijpen.
  4. De "Label-gebaseerde" code (CosyVoice2): Dit is als een strenge leraar met een checklist. Het breekt spraak af in specifieke, discrete labels (zoals specifieke letters of klanken) en focust op de structuur van de taal in plaats van op het vloeiende geluid.

Het experiment: De gezicht-decoder

De onderzoekers namen deze vier verschillende codes en voedden ze aan twee verschillende "gezicht-drivers" (decoders):

  • De GRU: Een stap-voor-stap driver die naar één frame van het gezicht tegelijk kijkt.
  • De Transformer: Een driver die naar de hele zin tegelijk kijkt, zoals het lezen van een paragraaf om de flow te begrijpen.

Vervolgens maten ze hoe goed de resulterende geanimeerde gezichten overeenkwamen met de echte menselijke gezichten met behulp van drie methoden:

  • Wiskunde: Het meten van de afstand tussen de lippen van de robot en de lippen van de mens.
  • Gladheid: Controleren of het gezicht schokkerig was of soepel bewoog.
  • De "Menselijk Oog"-test: Ze lieten echte mensen de video's bekijken en beoordelen hoe realistisch ze eruit zagen, vergelijkbaar met een blinde smaaktest.

Wat ze vonden

Hier zijn de verrassende resultaten, eenvoudig uitgelegd:

  • Betekenis doet ertoe: De "Semantische" code (de vertaler) en de "Label-gebaseerde" code (de checklist) waren de winnaars. Ze produceerden de meest realistische gezichten. Het blijkt dat voor een gezicht om natuurlijk te bewegen, het moet weten wat er wordt gezegd (de fonetische klassen), en niet alleen hoe de geluidsgolven trillen.
  • Te veel geluid is slecht: De "Akoestische" code (puur geluid) en de "Hybride" code (geluid + betekenis) presteerden slecht. Het lijkt erop dat als de computer te gefocust is op de rauwe details van het geluid, het in de war raakt over hoe de lippen moeten bewegen. De "ruis" van het geluid stond de gezichtsanimatie eigenlijk in de weg.
  • De beste driver: De "Transformer"-driver (degene die naar de hele zin kijkt) werkte veel beter met de discrete codes dan de stap-voor-stap driver.
  • De "Label-gebaseerde" verrassing: De "Label-gebaseerde" code, die oorspronkelijk bedoeld was voor tekst-naar-spraak, werkte bijna net zo goed als de complexe "Semantische" code. Dit is een grote zaak omdat het simpeler en gestructureerder is.

Het Grote Idee: De "Alles-in-één" Machine

Het meest opwindende deel van het artikel is een nieuw idee dat ze AVTTS (Audio Visual Text-to-Speech) noemen.

Normaal gesproken, om een pratend hoofd te maken, moet je dit in twee stappen doen:

  1. Zet tekst om in audio.
  2. Zet die audio om in een bewegend gezicht.

De onderzoekers lieten zien dat omdat de "Label-gebaseerde" code zo goed is in het representeren van spraak, je het als een gedeelde taal kunt gebruiken. Je kunt tekst in het systeem voeren, en het kan zowel de audio als het bewegende gezicht op exact hetzelfde moment uitspugen, perfect gesynchroniseerd, zonder dat er een tussenstap nodig is. Het is als een dirigent die zowel het orkestra (de stem) als de dansers (het gezicht) kan aansturen vanaf één enkele partituur.

De Kern van het Verhaal

Om een robotgezicht echt te laten lijken, hoef je het niet te voeren met elk minuscuul detail van de geluidsgolf. Je moet het voeden met een duidelijke, gestructureerde verstandhouding van de klanken en letters die worden uitgesproken. Als je de computer een duidelijke "kaart" van de spraak geeft (zoals een checklist van klanken), kan hij uitzoeken hoe hij de lippen perfect moet bewegen, zelfs als hij niet over het originele audiobestand beschikt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →