← Últimos artículos
⚡ electrical engineering

UniVoice: A Unified Model for Speech and Singing Voice Generation

UniVoice es un marco de generación unificada de voz de habla y canto basado en el emparejamiento de flujo condicional que factoriza la condicionante en contenido, melodía y timbre, utilizando un token de melodía nula aprendido para permitir el control explícito de la melodía en el canto mientras permite la inferencia de prosodia natural para el habla.

Autores originales: Junjie Zheng, Huixin Xue, Shihong Ren, Chaofan Ding, Hao Liu, Zihao Chen

Publicado 2026-06-05
📖 4 min de lectura☕ Lectura para el café

Autores originales: Junjie Zheng, Huixin Xue, Shihong Ren, Chaofan Ding, Hao Liu, Zihao Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un único robot a realizar dos trabajos muy diferentes: contar una historia (hablar) y interpretar una ópera (cantar).

Normalmente, construirías dos robots separados. Uno está diseñado para sonar natural y conversacional, captando su ritmo a partir de las palabras que está leyendo. El otro está diseñado para seguir una partitura musical estricta, dando cada nota y cada tiempo exactamente como está escrito.

El problema al intentar construir un solo robot para hacer ambas cosas es que las instrucciones para los dos trabajos se contradicen.

  • Para cantar, necesitas obligar al robot a seguir una melodía específica (como un tren en una vía).
  • Para hablar, si obligas al robot a seguir una vía, suena robótico y antinatural. Necesita ser libre para deambular basándose en la emoción de la historia.

Si simplemente mezclas los datos de entrenamiento, el robot se confunde. Intenta seguir la vía cuando debería ser libre, e intenta ser libre cuando debería estar siguiendo la vía. El resultado suele ser malo en ambos casos.

La Solución: UniVoice

Los investigadores crearon UniVoice, un nuevo "robot" (un modelo informático) que resuelve esto mediante un truco ingenioso llamado Condicionamiento Factorizado. Piensa en esto como dar al robot tres perillas de control separadas en lugar de un interruptor grande y desordenado.

Así es como funcionan las tres perillas:

  1. La Perilla de Contenido (Lo que se dice): Esta lee la letra o el texto. Es la misma tanto para el habla como para el canto.
  2. La Perilla de Timbre (Quién lo dice): Esta escucha una muestra corta de la voz de una persona (como un clip de 5 segundos) para copiar su sonido único, ya sea susurrando o cantando a todo pulmón.
  3. La Perilla de Melodía (La tonada): Esta es la parte mágica.
    • Al Cantar: Introduces una partitura musical específica (notas MIDI). El robot debe seguir esta pista.
    • Al Hablar: En lugar de introducir una pista, introduces un "Token Nulo" especial. Piensa en esto como un cartel de "No Molestar" para la melodía. Le dice al robot: "Ignora la pista musical; simplemente escucha las palabras y descubre el ritmo por ti mismo".

El Motor: Un Cerebro Compartido

Bajo el capó, UniVoice utiliza un motor potente llamado Transformer de Difusión (DiT). Imagina esto como un artista altamente cualificado que puede pintar cualquier cosa.

  • En el pasado, podrías haber necesitado dos artistas diferentes (uno para el habla y otro para el canto).
  • UniVoice utiliza un solo artista que es muy bueno escuchando las tres perillas de control.
  • Cuando la "Perilla de Melodía" se establece en el "Token Nulo", el artista sabe que debe improvisar el ritmo de forma natural. Cuando la perilla se establece en una canción específica, el artista sigue la partitura perfectamente.

Por qué esto es importante (Los Resultados)

Los investigadores probaron esto con una cantidad masiva de datos (30,000 horas de habla y 35,000 horas de canto). Esto es lo que encontraron:

  • Es un maestro de ambos: UniVoice habla casi tan bien como los mejores robots dedicados solo al habla (como F5-TTS) y canta mucho mejor que los robots "todo en uno" anteriores.
  • Es eficiente: Hace todo esto con un tamaño relativamente pequeño (0.3 mil millones de parámetros), mientras que los modelos unificados anteriores eran mucho más grandes y aun así rendían peor.
  • El "Token Nulo" funciona: Demostraron que usar ese "No Molestar" especial para el habla es matemáticamente la forma correcta de permitir que el modelo ignore la melodía sin romper su capacidad de cantar después.

La Nueva Prueba: UNISINGING-EVAL

Para asegurarse de que su robot era realmente bueno, el equipo construyó una nueva prueba llamada UNISINGING-EVAL. Imagina un concurso de talentos con 12 géneros musicales diferentes (desde Pop hasta Jazz y Hip-Hop). Probaron al robot para ver si podía cambiar entre hablar y cantar manteniendo la misma voz y manejando diferentes estilos.

La Conclusión

UniVoice es como un actor de voz universal. No necesita ser reentrenado ni tener un cerebro diferente para hablar frente a cantar. Simplemente mira las instrucciones:

  • "Aquí está el texto, aquí está la voz y aquí hay una canción" -> Canta perfectamente.
  • "Aquí está el texto, aquí está la voz y aquí no hay canción" -> Habla con naturalidad.

Al separar las instrucciones, evitaron que el robot se confundiera, permitiéndole ser excelente en ambos trabajos simultáneamente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →