← Últimos artículos
💻 computer science

GestureFM : Compact Latent Flow Matching for Low-Latency Co-Speech Body-Motion Generation

GestureFM es un marco de trabajo compacto de Flow Matching latente que permite la generación de movimiento corporal co-discursivo de alta calidad y baja latencia mediante la compresión de poses SMPL-X en un espacio latente y el empleo de un suavizador ligero para resolver las discontinuidades en los límites de los fragmentos, logrando una calidad de movimiento competitiva con una latencia del primer fragmento mínima.

Autores originales: Jie Liu, Tianmei Sun, Zian Liu

Publicado 2026-08-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jie Liu, Tianmei Sun, Zian Liu

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás hablando con un amigo y, mientras hablas, tus manos, brazos y cuerpo se mueven naturalmente al ritmo de tus palabras. Esto se llama "gesto co-discursivo" (co-speech gesture), y es una parte fundamental de cómo nos comunicamos los humanos. Ahora, imagina a un personaje de un videojuego o a un asistente virtual que quiere hacer lo mismo. El desafío es que la computadora necesita escuchar tu voz, entender lo que estás diciendo e instantáneamente mover el cuerpo del personaje para que coincida. Pero aquí está el truño: si la computadora espera a que termines toda tu frase antes de empezar a moverse, el personaje parecerá un robot que siempre va un paso por detrás. Para sentirse real, el personaje necesita empezar a moverse mientras todavía estás hablando. Este es el mundo de la "generación de transmisión de baja latencia": hacer que un humano digital se mueva en tiempo real sin retrasos.

Para lograr esto, los científicos utilizan trucos matemáticos especiales. Un truco se llama "Autoencoder Variacional" (VAE), que es como una aplicación de compresión súper eficiente. Toma un movimiento corporal 3D enorme y complejo y lo reduce a un código diminuto y simple (un "espacio latente") que es mucho más fácil de manejar para una computadora. Otro tructor es el "Flow Matching" (ajuste de flujo), que es como dibujar una línea recta y suave desde un garabato aleatorio hasta una imagen perfecta. En lugar de adivinar la imagen paso a paso como un artista borroso, el Flow Matching aprende el camino exacto a seguir, permitiendo que la computadora dibuje la imagen final muy rápidamente. La gran pregunta que los investigadores intentan resolver es: ¿Podemos combinar estas herramientas para hacer que un humano digital se mueva tan rápido y de forma tan fluida que se sienta que realmente está ahí, incluso mientras todavía estamos hablando?

Entra GestureFM, un nuevo estudio que intenta responder exactamente a eso. Los investigadores, Jie Liu, Tianmei Sun y Zian Liu, construyeron un sistema diseñado para generar movimientos corporales a partir del habla con casi cero de retraso. Llaman a su sistema "GestureFM" porque utiliza esa magia de "Flow Matching" dentro de un espacio "latente" comprimido.

Así es como funciona su sistema, usando una analogía simple: Imagina que estás tratando de describir un baile a un amigo por una llamada telefónica, pero solo puedes enviarle clips cortos de 1 segundo de tu voz a la vez. Tu amigo tiene que empezar a bailar inmediatamente basándose en lo que ha escuchado hasta el momento. GestureFM es el "amigo" que es increíblemente bueno en esto. Primero, utiliza un "Gesture VAE" para traducir los complejos movimientos de 168 dimensiones de un cuerpo humano (como todos los ángulos de tus articulaciones) en un código diminuto de 44 tokens. Esto es como convertir una película de larga duración en unos pocos apuntes rápidos de un boceto. Luego, un "Transformer de Flow Matching condicionado por audio" escucha tu voz (específicamente, los patrones de sonido llamados características Log-Mel) y utiliza esos apuntes de boceto para dibujar el siguiente segundo de movimiento.

La parte más emocionante de su descubrimiento es lo rápido y eficiente que es esto. El equipo descubrió que podían generar el primer fragmento de movimiento en solo 22 milisegundos. Para ponerlo en perspectiva, eso es 0.022 veces la velocidad de tiempo real. Esto significa que la computadora está trabajando aproximadamente 45 veces más rápido que la vida real, dejando mucho espacio para que el movimiento ocurra instantáneamente mientras hablas.

También probaron cuántos "pasos" necesitaba dar la computadora para dibujar el movimiento. En muchos sistemas de IA, dar más pasos suele significar una mejor imagen pero una velocidad más lenta. Sin embargo, GestureFM encontró algo sorprendente: dar más pasos no hacía que el movimiento se viera mucho mejor. Ya fuera que dieran 2 pasos o 32 pasos, la calidad del movimiento (medida por una puntuación llamada Distancia de Gesto de Fréchet, o FGD) se mantenía casi exactamente igual. Debido a esto, recomiendan usar solo 2 pasos (K=2) para obtener la velocidad más rápida posible sin perder ninguna calidad.

Pero hubo un pequeño fallo. Debido a que el sistema genera el movimiento en fragmentos de 1 segundo, la transición entre un fragmento y el siguiente a veces se sentía un poco brusca, como un video que se entrecorta por un segundo. Para solucionar esto, añadieron un "suavizador local de 7 fotogramas". Piensa en esto como un pequeño editor que mezcla suavemente el final de un segundo de movimiento con el inicio del siguiente. Este simple arreglo redujo el "salto de velocidad" (la brusquedad repentina) en un 85%, haciendo que el movimiento fuera mucho más fluido, sin alterar el tiempo del baile con la música.

Los investigadores también probaron algunas otras ideas para ver si podían hacerlo aún mejor, pero descartaron algunas de ellas. Por ejemplo, intentaron darle al sistema "memoria" pasando el final del fragmento de movimiento anterior al siguiente. Desafortunadamente, esto hizo que la calidad del movimiento empeorara mucho (la puntuación FGD saltó de 0.253 a 1.740). Se dieron cuenta de que esto era porque el sistema fue entrenado con datos de movimiento reales y perfectos, pero cuando intentaba usar su propia "memoria" durante la prueba, se confundía con sus propios errores. Así que decidieron que, por ahora, es mejor mantener cada fragmento independiente y simplemente usar el truco de suavizado para arreglar los bordes.

Al final, GestureFM demuestra que puedes crear movimientos corporales de alta calidad y baja latencia para humanos virtuales sin necesidad de esperar a que termine la oración completa. Al comprimir los datos, utilizar Flow Matching y añadir un filtro de suavizado simple, lograron un sistema que es increíblemente rápido (22 ms de latencia) y muy preciso, coincidiendo perfectamente con el ritmo del habla. Es un gran paso hacia la creación de humanos digitales que no solo hablan, sino que realmente se mueven con nosotros en tiempo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →