← Derniers articles
💻 computer science

GestureFM : Compact Latent Flow Matching for Low-Latency Co-Speech Body-Motion Generation

GestureFM est un cadre de Flow Matching latent compact qui permet une génération de mouvement corporel co-locutif en streaming à faible latence et de haute qualité en compressant les poses SMPL-X dans un espace latent et en employant un lisseur léger pour résoudre les discontinuités aux limites des segments, atteignant une qualité de mouvement compétitive avec une latence du premier segment minimale.

Auteurs originaux : Jie Liu, Tianmei Sun, Zian Liu

Publié 2026-08-14
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jie Liu, Tianmei Sun, Zian Liu

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous parlez à un ami et que, tout en parlant, vos mains, vos bras et votre corps dansent naturellement au rythme de vos paroles. C'est ce qu'on appelle le « geste co-discursif » (co-speech gesture), et c'est une partie essentielle de la façon dont les humains communiquent. Maintenant, imaginez un personnage de jeu vidéo ou un assistant virtuel qui veut faire la même chose. Le défi est que l'ordinateur doit écouter votre voix, comprendre ce que vous dites et faire bouger instantanément le corps du personnage pour correspondre. Mais attention : si l'ordinateur attend que vous ayez terminé toute votre phrase avant de commencer à bouger, le personnage ressemblera à un robot qui est toujours en retard. Pour paraître réel, le personnage doit commencer à bouger pendant que vous parlez encore. C'est le monde de la « génération en streaming à faible latence » — faire bouger un humain numérique en temps réel sans décalage.

Pour y parvenir, les scientifiques utilisent des astuces mathématiques spéciales. L'une de ces astuces est un « Auto-encodeur Variationnel » (VAE), qui est comme une application de compression ultra-efficace. Il prend un mouvement corporel 3D immense et complexe et le comprime en un code minuscule et simple (un « espace latent ») qui est beaucoup plus facile à gérer pour un ordinateur. Une autre astuce est le « Flow Matching » (appariement de flux), qui revient à tracer une ligne droite et lisse à partir d'un gribouillage aléatoire vers une image parfaite. Au lieu de deviner l'image étape par étape comme un artiste maladroit, le Flow Matching apprend le chemin exact à suivre, permettant à l'ordinateur de dessiner l'image finale très rapidement. La grande question que les chercheurs tentent de résoudre est la suivante : pouvons-nous combiner ces outils pour faire bouger un humain virtuel de manière si rapide et fluide qu'il semble vraiment présent, même pendant que nous parlons ?

Entrez dans GestureFM, une nouvelle étude qui tente de répondre précisément à cette question. Les chercheurs, Jie Liu, Tianmei Sun et Zian Liu, ont construit un système conçu pour générer des mouvements corporels à partir de la parole avec un délai presque nul. Ils appellent leur système « GestureFM » car il utilise cette magie du « Flow Matching » à l'intérieur d'un espace « latent » compressé.

Voici comment leur système fonctionne, en utilisant une analogie simple : Imaginez que vous essayez de décrire une danse à un ami lors d'un appel téléphonique, mais que vous ne pouvez envoyer que de courts clips de votre voix de 1 seconde à la fois. Votre ami doit commencer à danser immédiatement en se basant sur ce qu'il entend jusqu'à présent. GestureFM est cet « ami » qui est incroyablement doué pour cela. D'abord, il utilise un « Gesture VAE » pour traduire les mouvements complexes à 168 dimensions d'un corps humain (comme tous les angles de vos articulations) en un code minuscule de 44 jetons (tokens). C'est comme transformer un film complet en quelques notes de croquis rapides. Ensuite, un « Transformer par Flow Matching conditionné par l'audio » écoute votre voix (plus précisément, les motifs sonores appelés caractéristiques Log-Mel) et utilise ces notes de croquis pour dessiner la seconde de mouvement suivante.

La partie la plus excitante de leur découverte est la rapidité et l'efficacité de ce processus. L'équipe a constaté qu'elle pouvait générer le tout premier bloc de mouvement en seulement 22 millisecondes. Pour donner un ordre d'idée, cela représente 0,022 fois la vitesse du temps réel. Cela signifie que l'ordinateur travaille environ 45 fois plus vite que la vie réelle, laissant amplement de place pour que le mouvement se produise instantanément pendant que vous parlez.

Ils ont également testé combien d'« étapes » l'ordinateur devait effectuer pour dessiner le mouvement. Dans de nombreux systèmes d'IA, faire plus d'étapes signifie généralement une meilleure image mais une vitesse plus lente. Cependant, GestureFM a découvert quelque chose de surprenant : faire plus d'étapes ne rendait pas le mouvement beaucoup meilleur. Qu'ils fassent 2 étapes ou 32 étapes, la qualité du mouvement (mesurée par un score appelé distance de geste de Fréchet, ou FGD) restait presque exactement la même. Pour cette raison, ils recommandent d'utiliser seulement 2 étapes (K=2) pour obtenir la vitesse la plus rapide possible sans perdre de qualité.

Mais il y avait un petit problème. Comme le système génère le mouvement par blocs de 1 seconde, la transition entre un bloc et le suivant pouvait parfois paraître un peu saccadée, comme une vidéo qui stagne pendant une fraction de seconde. Pour correr cela, ils ont ajouté un « lisseur local de 7 images » (7-frame local smoother). Considérez cela comme un petit éditeur qui mélange doucement la fin du mouvement d'une seconde avec le début de la seconde suivante. Ce simple correctif a réduit le « saut de vélocité » (la saccade soudaine) de 85 %, rendant le mouvement beaucoup plus fluide, sans perturber le rythme de la danse avec la musique.

Les chercheurs ont également testé d'autres idées pour voir s'ils pouvaient faire encore mieux, mais ils en ont écarté certaines. Par exemple, ils ont essayé de donner de la « mémoire » au système en transmettant la fin du bloc de mouvement précédent au suivant. Malheureusement, cela a considérablement dégradé la qualité du mouvement (le score FGD est passé de 0,253 à 1,740). Ils ont réalisé que c'était parce que le système a été entraîné sur des données de mouvement réelles et parfaites, mais lorsqu'il essayait d'utiliser sa propre « mémoire » pendant le test, il se perdait dans ses propres erreurs. Ils ont donc décidé qu'il était préférable, pour l'instant, de garder chaque bloc indépendant et d'utiliser simplement la technique de lissage pour corriger les bordures.

En fin de compte, GestureFM montre que vous pouvez créer des mouvements corporels de haute qualité et à faible latence pour des humains virtuels sans avoir besoin d'attendre la fin de la phrase. En compressant les données, en utilisant le Flow Matching et en ajoutant un simple filtre de lissage, ils ont obtenu un système qui est à la fois incroyablement rapide (latence de 22 ms) et très précis, s'accordant parfaitement au rythme de la parole. C'est un grand pas vers la création d'humains numériques qui ne font pas que parler, mais qui bougent véritablement avec nous en temps réel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →