← Últimos artículos
💻 computer science

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

UniSwap es un marco novedoso que permite el primer reemplazo de identidad audiovisual fluido en videos de personas hablando mediante la utilización de un único transformador de difusión con un proceso de entrenamiento de intercambio y reconstrucción, junto con técnicas de muestreo eficientes para lograr una generación de larga duración sincronizada, consistente y estable.

Autores originales: Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

Publicado 2026-08-13
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo una película, pero el actor en pantalla de repente comienza a hablar con una voz diferente y a parecer una persona completamente distinta, aunque sigue diciendo exactamente las mismas palabras y moviendo los labios en perfecta sincronía. Este es el sueño del "intercambio de identidad" en videos hablados. Durante mucho tiempo, las computadoras han sido excelentes haciendo solo una parte de este truco: o cambiar el rostro de una persona manteniendo su voz original, o cambiar la voz manteniendo el rostro original. Pero intentar hacer ambas cosas al mismo tiempo ha sido como intentar hacer malabares con dos pelotas diferentes mientras se monta un monociclo; los resultados solían estar desincronizados, con los labios moviéndose para las palabras incorrectas o voces que sonaban robóticas. Este artículo se sumerge en el mundo de la IA generativa, específicamente analizando cómo podemos enseñar a las computadoras a intercambiar tanto la apariencia como la voz de una persona simultáneamente, en tiempo real, sin que el video se trabe o el audio se retrase.

Los investigadores detrás de este proyecto, UniSwap, han construido un nuevo sistema que actúa como un maestro titiritero, tirando de los hilos tanto de la parte visual como de la auditiva de un video en el mismo instante. En lugar de usar dos herramientas separadas —una para el rostro y otra para la voz—, crearon un único "cerebro" que entiende cómo el rostro de una persona se mueve y cómo su voz suena como una experiencia conectada. Piensa en ello como un traductor bilingüe que no solo traduce palabras, sino que también captura el acento y las expresiones faciales del hablante instantáneamente.

El artículo presenta una forma ingeniosa de enseñar a este sistema. Dado que es casi imposible encontrar videos de la vida real de la misma persona diciendo las mismas líneas mientras luce y suena como dos personas diferentes, el equipo inventó un juego de "intercambio y reconstrucción". Toman un video real, eliminan digitalmente el rostro y la voz de la persona para crear una versión "fantasma", y luego le piden a la IA que reconstruya el video original usando un nuevo rostro y voz como guía. Es como darle a un chef un lienzo en blanco y una receta, y luego pedirle que recree un plato específico perfectamente. Al entrenar con millones de estas "reconstrucciones", la IA aprende a intercambiar identidades mientras mantiene los movimientos originales y el fondo intactos.

Lo que hace que esto sea verdaderamente especial es que funciona como una transmisión en vivo en lugar de una película pregrabada y lenta. La mayoría de los generadores de video tienen que ver todo el clip antes de poder empezar a dibujar el primer fotograma, lo cual es demasiado lento para un uso interactivo. UniSwap, sin embargo, genera el video en pequeños bloques, como una cinta transportadora, lo que le permite producir alrededor de 13.6 fotogramas por segundo en un chip de computadora potente (un NVIDIA H100). Aunque esto no es lo suficientemente rápido para una interacción en tiempo real instantánea todavía, es un salto masivo, permitiendo al sistema generar videos largos —de hasta una hora de duración— sin que el rostro o la voz del personaje se desvíen o se distorsionen con el tiempo. Los autores descubrieron que, al utilizar un "truco de memoria" especial llamado Descomposición Feature-RoPE, la IA puede recordar la identidad original incluso después de generar miles de fotogramas, asegurando que el personaje se mantenga constante desde el primer segundo hasta el último.

En resumen, UniSwap sugiere que finalmente podemos tener un sistema unificado que intercambie tanto la apariencia como la voz en videos hablados con alta sincronización y estabilidad. Si bien la versión actual no es lo suficientemente rápida para una conversación en tiempo real en vivo (es ligeramente más lenta que la velocidad de una reproducción de video estándar), demuestra que un solo modelo puede manejar ambas tareas juntas mejor que intentar unir dos sistemas separados. Los resultados muestran que los movimientos de los labios permanecen perfectamente sincronizados con la nueva voz y que la identidad del personaje se mantiene estable incluso en clips largos, ofreciendo un paso prometedor hacia avatares digitales más naturales e interactivos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →