ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis
El artículo presenta ParsVoice, un corpus de voz persa multihablante de 2.200 horas de libre acceso, construido mediante una pipeline escalable a partir de audiolibros, que amplía significativamente los recursos abiertos de síntesis de voz en persa y demuestra un rendimiento de síntesis de alta calidad al utilizarse para afinar el modelo XTTS.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que quieres enseñar a un robot a hablar persa. No puedes simplemente darle un diccionario; necesitas alimentarlo con miles de horas de voces humanas reales leyendo historias, para que pueda aprender el ritmo, la emoción y los sonidos únicos del idioma.
Durante mucho tiempo, el idioma persa ha sido como un invitado en una fiesta masiva a quien no le dieron un asiento a la mesa. Mientras que idiomas como el inglés tienen enormes bibliotecas de habla grabada (imagínalas como almacenes masivos y bien organizados), el persa tenía muy poco. Esto dificultaba la creación de buenos asistentes de voz o robots narradores para los hablantes de persa.
La Solución: ParsVoice
Los autores de este artículo construyeron ParsVoice, que es esencialmente una biblioteca masiva y de alta calidad de habla persa. Es la colección pública más grande de su tipo jamás creada para este idioma.
Así es como lo hicieron, desglosado en pasos simples:
1. La Materia Prima: Audiolibros
En lugar de contratar actores para leer guiones en un estudio (lo cual es costoso y lento), el equipo acudió a una biblioteca pública de audiolibros llamada IranSeda. Imagina esto como encontrar una montaña de rollos de película crudos y sin editar. Tenían más de 3.800 libros, pero había un problema: no tenían los guiones escritos (transcripciones) que coincidieran perfectamente con el audio.
2. La Cadena de Procesamiento "Cortador Inteligente"
No puedes simplemente tomar un archivo de audiolibro de 10 horas y alimentarlo a un robot; necesita ser cortado en oraciones diminutas y perfectas. El equipo construyó una "línea de fábrica" automatizada para hacer esto:
- El Corte Aproximado: Utilizaron un programa informático para encontrar el silencio entre las oraciones y cortar el audio allí.
- La Verificación "¿Terminaste?": A veces, la computadora corta el audio en medio de una oración (como detener una película justo antes de que el héroe diga "Te amo"). Utilizaron una IA inteligente (basada en un modelo llamado ParsBERT) para leer el texto y preguntar: "¿Es este un pensamiento completo?". Si la respuesta era "No", el sistema extendía automáticamente el corte una fracción de segundo y volvía a verificar hasta que la oración estuviera completa.
- El Paso "Poda la Grasa": Incluso después de cortar, podría haber un pequeño silencio o un carraspeo al principio o al final de un clip. El sistema utilizó una "búsqueda binaria" (una forma astuta de adivinar y verificar) para recortar exactamente la cantidad correcta de silencio para que la voz comience y termine limpiamente, sin cortar ninguna palabra.
- El Inspector de Calidad: No todos los audiolibros se graban en un estudio insonorizado. Algunos podrían tener música de fondo o micrófonos deficientes. El sistema actuó como un editor estricto, calificando cada clip en cuanto a claridad de audio y precisión del texto. Si un clip era demasiado ruidoso o el texto era ininteligible, se descartaba.
- El Detective de Voces: Dado que un audiolibro podría tener múltiples narradores, el sistema utilizó una herramienta de "huella dactilar vocal" para agrupar todos los clips según quién hablaba. Esto les permitió identificar automáticamente a 1.815 hablantes diferentes.
3. El Resultado
El producto final es una biblioteca de 2.200 horas de oraciones persas limpias y perfectamente cortadas.
- Es 25 veces más grande que la colección de habla persa más grande anterior.
- Contiene 1,36 millones de clips de oraciones individuales.
- Cubre 1.815 voces diferentes.
4. ¿Funcionó?
Para probar si esta biblioteca era realmente útil, el equipo enseñó un modelo moderno de voz de IA (llamado XTTS) utilizando únicamente estos nuevos datos. No le enseñaron primero los sonidos de las letras persas (fonemas); dejaron que aprendiera directamente del texto y el audio.
Los resultados fueron impresionantes:
- Naturalidad: Los humanos calificaron la voz del robot como muy natural (3,6 sobre 5).
- Coincidencia de Voz: Cuando pidieron al robot que imitara una voz nueva que nunca había escuchado antes, lo hizo muy bien (4,0 sobre 5).
- Inteligibilidad: El robot hablaba con suficiente claridad para que otros programas informáticos pudieran entenderlo perfectamente.
Lo Que No Hace (Las Limitaciones)
Los autores son honestos sobre lo que esta biblioteca no es:
- No es para charlar: Debido a que los datos provienen de audiolibros, las voces suenan como si estuvieran leyendo una historia (formal y constante). Si le pides al robot que tenga una charla casual y rápida como dos amigos en una cafetería, podría sonar un poco rígido.
- No es perfecta: Dado que tuvieron que usar una computadora para adivinar el texto (porque no tenían los libros originales), hay algunos pequeños errores en el texto, aunque filtraron la mayoría de ellos.
- Equilibrio de Género: La biblioteca tiene más voces masculinas que femeninas, simplemente porque los audiolibros que utilizaron tenían más narradores masculinos.
En Resumen:
El equipo construyó una fábrica gigante y automatizada que convirtió miles de horas de audiolibros persas crudos en un conjunto de datos limpio, organizado y masivo. Este conjunto de datos ahora está disponible para que cualquiera lo utilice para construir mejores tecnologías de voz en persa, dando finalmente al idioma un asiento a la mesa de la investigación de habla de alta tecnología.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.