← Últimos artículos
💬 NLP

FreyaTTS Technical Report

Freya-TTS es un modelo de texto a voz compacto, sin tokenizador y centrado en el turco que aprovecha un Transformer de Difusión de ajuste de flujo condicional no autorregresivo en un espacio latente continuo para lograr una síntesis conversacional de alta calidad en tiempo real con una eficiencia y precisión superiores en comparación con sistemas de código abierto más grandes.

Autores originales: Ahmet Erdem Pamuk, Ömer Yentür, Ahmet Tunga Bayrak, Yavuz Alp Sencer Öztürk, Mustafa Yavuz

Publicado 2026-07-13
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Ahmet Erdem Pamuk, Ömer Yentür, Ahmet Tunga Bayrak, Yavuz Alp Sencer Öztürk, Mustafa Yavuz

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que quieres construir un robot que hable turco. La mayoría de la gente intenta construir este robot enseñándole un diccionario masivo de sonidos, descomponiendo cada palabra en piezas diminutas y predefinidas (como piezas de Lego) y luego apilando esas piezas una por una, de izquierda a derecha. Así es como funcionan muchos de los actuales robots de voz de "estado del arte". Son enormes, tardan una eternidad en construirse y, si tropiezan con una frase larga, a menudo se quedan cojos, mezclando números o alterando el orden.

El equipo de FreyaTTS decidió probar un enfoque completamente diferente, mucho más pequeño e inteligente. No construyeron un diccionario gigante ni un apilador de piezas por pieza. En su lugar, construyeron un "motor de imaginación" de 183.2 millones de parámetros que aprende a hablar turco escuchando audio y adivinando la frase completa de una sola vez, como un músico de jazz improvisando un solo completo en lugar de leer una partitura nota por nota.

Así es como funciona su truco de magia, desglosado en tres partes simples:

1. El Plano Congelado (El "AudioVAE2")

Piensa en el equipo de FreyaTTS como arquitectos que encontraron una casa perfecta, ya construida (llamada AudioVAE2), que ya sabe cómo convertir un boceto en una hermosa onda sonora de 48 kHz. Esta casa es tan buena que el equipo decidió no tocarla nunca. La dejaron congelada en su lugar.

Como no tuvieron que perder tiempo enseñando al robot cómo generar ondas sonoras, pudieron usar el 100% de su capacidad cerebral para enseñar al robot qué decir. No necesitaron un traductor (un fonemizador) para convertir letras en sonidos, ni necesitaron descomponer las palabras en pequeños tokens de sonido. Simplemente alimentaron al robot con texto puro en turco (92 símbolos, incluyendo letras especiales como ç, ğ, ı, ö, ş, ü) y dejaron que descubriera la pronunciación por su cuenta. Es como enseñar a un niño a hablar hablándole, en lugar de darle un libro de texto sobre fonética.

2. La Magia de "Todo a la Vez" (No Autoregresiva)

La mayoría de los robots de voz son como un mecanógrafo lento: escriben una letra, luego la siguiente, luego la siguiente. Si cometen un error al principio, toda la frase se vuelve ininteligible. Esto se llama generación "autoregresiva".

FreyaTTS es diferente. Es como un pintor que ve todo el lienzo y pinta la imagen completa de un solo golpe. Utiliza un Transformer de Difusión de ajuste de flujo condicional para predecir el patrón de sonido de toda la frase en paralelo.

  • La Analogía: Imagina que estás adivinando la voz de un amigo. En lugar de adivinar una palabra a la vez (lo que podría llevarte a adivinar la palabra incorrecta y arruinar la frase), FreyaTTS adivina el ritmo y el tono de la frase completa de una sola vez.
  • El Resultado: Evita la "acumulación de errores de izquierda a derecha". Si le pides que diga una lista larga de números, no se confunde a mitad de camino. Predice la duración completa y el patrón de sonido simultáneamente.

3. El "Bloqueo de Voz" (Para lograr consistencia)

Cuando entrenaron este robot desde cero, era un poco camaleónico. Cada vez que le pedías que dijera "Hola", sonaba como una persona diferente. Una vez podía sonar como un hombre de voz profunda, la siguiente como un niño de tono agudo. Esto se debía a que el robot estaba aprendiendo de una mezcla de muchas voces y no tenía una identidad específica.

Para solucionar esto, el equipo realizó un "bloqueo de voz" de dos pasos:

  1. Etapa 1: Enseñaron al robot a imitar a una persona específica (un talento de voz profesional único). Esto colapsó la variación del tono de voz del robot de un rango salvaje de 74.9 Hz a un constante 5.0 Hz. Ahora, suena como la misma persona cada vez.
  2. Etapa 2: Se dieron cuenta de que el robot era malo con frases cortas (como "Sí" o "No"). Así que le dieron práctica adicional específicamente en frases de una o dos palabras.

Los Resultados: Pequeño pero Poderoso

El equipo probó su robot contra otros modelos de voz de código abierto famosos. Esto es lo que encontraron:

  • Tamaño: FreyaTTS es diminuto (183.2M de parámetros) comparado con gigantes como XTTS-v2 (470M) o F5-TTS (336M).
  • Precisión: En una prueba de 495 frases en turco, FreyaTTS cometió menos errores que los modelos más grandes. Logró una Tasa de Error de Palabra (WER) del 8.0% y una Tasa de Error de Carácter (CER) del 3.0%.
    • Nota: Los modelos más grandes obtuvieron 11.1% y 24.3% respectivamente.
  • Velocidad: Debido a que no tiene que esperar a que una palabra termine antes de comenzar la siguiente, es increíblemente rápido. En una tarjeta gráfica de consumo estándar, funciona con un factor de tiempo real de 0.11. Esto significa que puede generar 10 segundos de audio en solo 1.1 segundos.
  • Potencia de Laptop: Es tan eficiente que puede funcionar más rápido que el tiempo real en una CPU de laptop (como un Apple M3), lo que lo hace perfecto para teléfonos o dispositivos pequeños.

Lo que explícitamente dicen que NO es

El artículo es muy claro sobre lo que FreyaTTS no es:

  • No es un clonizador "zero-shot" que puede imitar cualquier voz que le des mediante un clip. Es un modelo de voz única. Obtienes la única voz para la que fue entrenado, y eso es todo.
  • No está construido sobre una base multilingüe masiva que intenta hablar 50 idiomas a la vez. Es un modelo especializado en turco, enfocado en un solo idioma.
  • No utiliza un "fonemizador" (un sistema basado en reglas para convertir letras en sonidos). Aprende los sonidos directamente del audio.
  • No es perfecto leyendo números en su forma escrita (como "1999"). El artículo señala que todavía es necesario expandir los números a su forma hablada (como "mil novecientos noventa y nueve") antes de pasarlos al modelo, porque el robot a veces tiene dificultades con la duración de las cadenas largas de dígitos.

¿Qué tan seguros están?

El equipo está muy seguro de estas cifras porque no solo adivinaron; lo midieron todo.

  • Construyeron un benchmark específico llamado Freya-TR-Eval con 495 frases.
  • Realizaron las pruebas 10,000 veces utilizando un método de "bootstrap" para asegurar que los resultados no fueran cuestión de suerte.
  • Compararon su modelo contra las mismas frases exactas usando las mismas reglas de puntuación (reduciendo todo a 8 kHz para que el campo de juego fuera equitativo).
  • Incluso midieron la estabilidad del "bloqueo de voz", mostrando que la variación del tono cayó de 74.9 Hz a 5.0 Hz después de sus pasos de entrenamiento.

En resumen, FreyaTTS demuestra que no necesitas un monstruo multibilingüe de mil millones de dólares para crear un gran habla en turco. Puedes construir un motor pequeño, especializado y de "todo a la vez" que se ejecute en una laptop, suene consistente y hable turco mejor que los gigantes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →