← Nieuwste papers
💻 computer science

GestureFM : Compact Latent Flow Matching for Low-Latency Co-Speech Body-Motion Generation

GestureFM is een compact latent Flow Matching-framework dat streaming co-speech lichaamshouding-generatie met lage latentie en hoge kwaliteit mogelijk maakt door SMPL-X-poses te comprimeren naar een latente ruimte en een lichtgewicht smoother in te zetten om discontinuïteiten op chunk-grenzen op te lossen, waarbij competitieve bewegingskwaliteit wordt bereikt met minimale eerste-chunk-latentie.

Oorspronkelijke auteurs: Jie Liu, Tianmei Sun, Zian Liu

Gepubliceerd 2026-08-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jie Liu, Tianmei Sun, Zian Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je met een vriend praat, en terwijl je spreekt, dansen je handen, armen en lichaam op natuurlijke wijze mee met je woorden. Dit wordt "co-speech gebaren" genoemd, en het is een enorm onderdeel van hoe mensen communiceren. Stel je nu een videogamepersonage of een virtuele assistent voor die hetzelfde wil doen. De uitdaging is dat de computer naar je stem moet luisteren, moet begrijpen wat je zegt, en direct het lichaam van het personage moet bewegen om daarbij aan te sluiten. Maar hier komt de crux: als de computer wacht tot je je hele zin hebt afgemaakt voordat hij begint te bewegen, zal het personage eruitzien als een robot die altijd een stap achterloopt. Om echt aan te voelen, moet het personage beginnen te bewegen terwijl je nog aan het praten bent. Dit is de wereld van "low-latency streaming generation" — het maken van bewegingen van een digitale mens in real-time zonder vertraging.

Om dit te doen, gebruiken wetenschappers speciale wiskundige trucjes. Eén truc is een "Variational Autoencoder" (VAE), wat een soort superefficiënte compressie-app is. Het neemt een enorme, complexe 3D-lichaamsbeweging en perst deze samen tot een piekleine, eenvoudige code (een "latent space") die veel gemakkelijker door een computer te verwerken is. Een andere truc is "Flow Matching", wat lijkt op het trekken van een rechte, vloeiende lijn van een willekeurige krabbel naar een perfect plaatje. In plaats van het plaatje stap voor stap te raden zoals een wazige kunstenaar, leert Flow Matching de exacte route te nemen, waardoor de computer de uiteindelijke afbeelding heel snel kan tekenen. De grote vraag die onderzoekers proberen op te lossen is: kunnen we deze tools combineren om een virtuele mens zo snel en vloeiend te laten bewegen dat het voelt alsof hij echt aanwezig is, zelfs terwijl we nog aan het spreken zijn?

Maak kennis met GestureFM, een nieuwe studie die precies probeert die vraag te beantwoorden. De onderzoekers, Jie Liu, Tianmei Sun en Zian Liu, hebben een systeem gebouwd dat ontworpen is om lichaamsbewegingen te genereren vanuit spraak met bijna nul vertraging. Ze noemen hun systeem "GestureFM" omdat het die "Flow Matching"-magie gebruikt binnen een gecomprimeerde "latente" ruimte.

Hier is hoe hun systeem werkt, met behulp van een eenvoudige analogie: Stel je voor dat je een dans probeert te beschrijven aan een vriend via een telefoongesprek, maar dat je hem alleen korte clips van 1 seconde van je stem kunt sturen per keer. Je vriend moet onmiddellijk beginnen met dansen op basis van wat hij tot nu toe heeft gehoord. GestureFM is de "vriend" die hier ongelooflijk goed in is. Eerst gebruikt het een "Gesture VAE" om de complexe 168-dimensionale bewegingen van een menselijk lichaam (zoals alle hoeken van je gewrichten) te vertalen naar een kleine, 44-token code. Dit is als het omzetten van een volledige film in een paar snelle schetsnotities. Vervolgens luistert een "audio-conditioned Flow Matching Transformer" naar je stem (specifiek naar de geluidspatronen die Log-Mel features worden genoemd) en gebruikt die schetsnotities om de volgende seconde aan beweging te tekenen.

Het meest opwindende deel van hun ontdekking is hoe snel en efficiënt dit is. Het team ontdekte dat ze de allereerste brok beweging konden genereren in slechts 22 milliseconden. Om dat in perspectief te plaatsen: dat is 0,022 keer de snelheid van real-time. Dit betekent dat de computer ongeveer 45 keer sneller werkt dan het echte leven, waardoor er genoeg ruimte overblijft voor de beweging om direct te gebeuren terwijl je spreekt.

Ze hebben ook getest hoeveel "stappen" de computer nodig had om de beweging te tekenen. In veel AI-systemen betekent het nemen van meer stappen meestal een beter plaatje maar een lagere snelheid. Echter, GestureFM vond iets verrassends: het nemen van meer stappen maakte de beweging niet echt veel beter. Of ze nu 2 stappen of 32 stappen namen, de kwaliteit van de beweging (gemeten met een score genaamd Fréchet Gesture Distance, of FGD) bleef bijna exact hetzelfde. Vanwege deze reden bevelen ze aan om slechts 2 stappen (K=2) te gebruiken om de mogelijk hoogst mogelijke snelheid te krijgen zonder kwaliteitsverlies.

Maar er was één klein probleempje. Omdat het systeem beweging genereert in brokken van 1 seconde, voelde de overgang tussen de ene brok en de volgende soms een beetje schokkerig aan, alsof een video even hapert. Om dit op te lossen, voegden ze een "7-frame lokale smoother" toe. Denk aan dit als een kleine editor die het einde van de ene seconde aan beweging en het begin van de volgende seconde zachtjes in elkaar laat overvloeien. Deze eenvoudige fix verminderde de "velocity jump" (de plotselinge schokkerigheid) met 85%, waardoor de beweging veel vloeiender werd, zonder de timing van de dans met de muziek te verstoren.

De onderzoekers hebben ook enkele andere ideeën getest om te zien of ze het nog beter konden maken, maar ze hebben er een aantal uitgesloten. Ze probeerden bijvoorbeeld het systeem "geheugen" te geven door het einde van de vorige bewegingsbrok door te geven aan de volgende. Helaft, dit maakte de kwaliteit van de beweging veel slechter (de FGD-score sprong van 0,253 naar 1,740). Ze realiseerden zich dat dit kwam omdat het systeem getraind was op perfecte, real-world bewegingsdata, maar wanneer het tijdens de test zijn eigen "geheugen" probeerde te gebruiken, raakte het in de war door zijn eigen fouten. Daarom besloten ze dat het voor nu beter is om elke brok onafhankelijk te houden en alleen de smoothing-truc te gebruiken om de randen te corrigeren.

Uiteindelijk laat GestureFM zien dat je kwalitatieve, low-latency lichaamsbewegingen voor virtuele mensen kunt creëren zonder te hoeven wachten tot de hele zin is afgemaakt. Door de data te comprimeren, Flow Matching te gebruiken en een eenvoudige smoothing-filter toe te voegen, bereikten ze een systeem dat zowel ongelooflijk snel is (22 ms latentie) als zeer accuraat, waarbij het de ritme van de spraak perfect volgt. Het is een grote stap richting het maken van digitale mensen die niet alleen praten, maar ook echt met ons meebewegen in real-time.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →