← Últimos artículos
🤖 machine learning

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

Este artículo demuestra que añadir una única capa lineal inicializada en cero a un modelo base de texto a audio y video permite un clonado de voz de alta fidelidad con una similitud de hablante superior en comparación con las líneas base de texto a voz existentes, al tiempo que permite una aceleración de la velocidad de inferencia de 30 veces al desacoplar la generación de audio de la ruta de video.

Autores originales: Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

Publicado 2026-08-18
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde una computadora puede observar la descripción de una escena y crear instantáneamente un clip de video completo con los sonidos que le pertenecen. Si escribes "un perro ladrando en un parque", la máquina genera el visual del parque y el audio del ladrido. Esta tecnología, conocida como generación de video y audio a partir de texto, ha avanzado rápidamente, permitiendo que las máquinas sinteticen escenas enteras solo a partir de palabras. Sin embargo, una limitación significativa ha persistido: aunque la computadora puede decidir qué sonidos hacer, no puede decidir quién los hace. La voz que habla o ladra en el resultado es esencialmente aleatoria, extraída de un vasto conjunto de posibilidades que la máquina ha aprendido, lo que deja a los creadores incapaces de especificar que un personaje particular deba sonar como una persona específica. Esta falta de control ha dificultado el uso de estas herramientas para historias personalizadas, el doblaje de personajes animados o el dotar de la voz de un individuo específico a un avatar digital.

Al mismo tiempo, una rama diferente de la inteligencia artificial ha dominado el arte de la clonación de voz, donde un sistema puede imitar el tono único de una persona tras escuchar solo unos segundos de su habla. Sin embargo, estos sistemas de clonación de voz están estrictamente limitados al audio; no pueden generar el video acompañante y, a menudo, requieren estructuras especializadas y complejas construidas desde cero. El desafío para los investigadores ha sido combinar estos dos mundos: tomar un potente generador de video y sonido y enseñarle a copiar una voz específica sin destruir su capacidad de crear escenas realistas o requerir una reconstrucción completa del sistema.

Un equipo de investigadores ha demostrado una forma sorprendentemente simple de cerrar esta brecha. Mostraron que un modelo preexistente y de gran tamaño capaz de generar tanto video como sonido puede transformarse en una herramienta de clonación de voz añadiendo solo una pequeña y vacía capa de conexiones matemáticas sobre su unidad de procesamiento de audio. Esta nueva capa comienza sin información aprendida, lo que significa que el modelo se comporta exactamente igual que antes del cambio. Los investigadores luego entrenaron este sistema modificado durante un periodo de tiempo relativamente corto utilizando un método específico. Alimentaron al modelo con una grabación corta de un hablante objetivo junto con la descripción de texto. El sistema aprendió a escuchar esa grabación y a usar sus cualidades sonoras únicas para dar forma al nuevo audio que generaba, todo esto mientras mantenía intacta la generación de video.

La clave de este éxito reside en cómo los investigadores introdujeron la voz de referencia en la máquina. Utilizaron dos señales complementarias. Primero, tomaron la representación digital de la grabación de referencia corta y la colocaron al principio mismo del flujo de datos de audio, permitiendo que el modelo la observe constantemente mientras crea nuevos sonidos. Segundo, extrajeron un resumen único y compacto de la voz del hablante y lo utilizaron para impulsar suavemente el tono de cada sonido que el modelo producía. Este enfoque requirió solo una nueva capa lineal, una pequeña adición que fue inicializada en cero para que el modelo no fuera perturbado durante las etapas iniciales del aprendizaje. Al entrenar al sistema para que prestara atención a estas señales, los investigadores le permitieron copiar el timbre, o el color único, de una voz con alta precisión.

Los resultados de este enfoque fueron probados contra otros cinco sistemas líderes de clonación de voz utilizando un banco de pruebas de 674 pares únicos de texto y voz que involucraban a 30 hablantes diferentes. El nuevo modelo, que contiene cinco mil millones de parámetros, superó a todos los demás sistemas en su capacidad para igualar la voz del hablante objetivo. Logró las puntuaciones más altas en tres redes de verificación independientes distintas, que son herramientas especializadas diseñadas para medir qué tan similares suenan dos voces entre sí. Los investigadores encontraron que su modelo podía capturar las peculiaridades sutiles y naturales de la voz de un hablante, incluyendo la textura acústica específica que hace que una voz sea reconocible, incluso si esto significaba que el habla resultante ocasionalmente contenía errores menores en la elección de palabras. Este compromiso sugiere que el modelo prioriza la reconstrucción auténtica del sonido del hablante sobre la exactitud textual perfecta, un comportamiento que difiere de otros sistemas que tienden a producir voces más limpias pero menos distintivas.

Un beneficio inesperado de esta arquitectura es que las partes de video y audio del sistema pueden separarse durante la etapa final de creación. Debido a que el modelo fue diseñado con una estructura asimétrica, donde los flujos de audio y video se procesan de manera diferente pero están conectados, los investigadores descubrieron que podían ejecutar solo la parte de audio del modelo por sí sola. Esto les permitió generar el audio clonado de la voz sin esperar a que se creara el video, lo que resultó en un aumento de velocidad de aproximadamente treinta veces en comparación con la ejecución del sistema completo. Esta variante, que utiliza solo una fracción de la potencia de cómputo total, aún preservó la capacidad de clonar voces de manera efectiva, ofreciendo una forma práctica de audicionar rápidamente diferentes voces antes de comprometerse con una generación de video completa.

Crucialmente, los investigadores verificaron que añadir esta capacidad de clonación de voz no dañó las habilidades originales del modelo. Cuando probaron el modelo modificado en tareas donde no se proporcionaba una voz de referencia, este funcionó mejor que la versión original, produciendo un audio más natural y más alineado con las descripciones de texto. Esto indica que la nueva capa, al comenzar desde un estado neutral, actuó como una adición flexible que mejoró el sistema sin obligarlo a olvidar lo que ya sabía. El estudio concluye que es posible equipar a los avanzados generadores de video y sonido con la capacidad de imitar voces específicas mediante cambios arquitectónicos mínimos, abriendo la puerta a una creación de contenido audiovisual más personalizada y controlada sin la necesidad de un reentrenamiento masivo o diseños nuevos y complejos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →