CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
Autores originales: Shijun Luo
Autores originales: Shijun Luo
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: CN-NEWSTTS BENCH
Planteamiento del Problema
Los textos de noticias en chino contienen con frecuencia formas escritas densas y no estandarizadas, tales como puntuaciones deportivas (p. ej., 96-91), nombres de modelos con guiones (p. ej., 苏 -27), rangos, símbolos de unidades, porcentajes y nombres mixtos de chino-latín-dígitos. Aunque estos elementos son inequívocos para los editores humanos, presentan desafíos significativos para los sistemas de Texto a Voz (TTS). Un modelo de TTS puede preservar la cadena escrita mientras altera el significado hablado (p. ej., leer una puntuación como un rango, o un modelo militar como un número negativo). Los métodos de evaluación existentes, como las pruebas subjetivas de Puntuación Media de Opinión (MOS) o las comparaciones de ida y vuelta de ASR genérico, son demasiado imprecisos para rastrear estas decisiones de lectura específicas y de alto impacto. Además, los benchmarks actuales suelen depender de la normalización por parte del usuario, la reescritura mediante Modelos de Lenguaje Extensos (LLM) o pistas de SSML, lo que impide evaluar el comportamiento de "entrada bruta" (raw-input) de las API de TTS desplegadas.
Metodología
El artículo presenta CN-NewsTTS Bench v0.1, un benchmark automático abierto a nivel de objetivo diseñado para evaluar la pronunciación de noticias en chino a partir de texto bruto sin reglas externas o ediciones manuales.
Construcción de Datos: El conjunto de datos consiste en 1,000 oraciones sintéticas deterministas de estilo de noticias generadas a partir de plantillas y léxicos específicos de categorías (que cubren deportes, modelos militares, unidades técnicas, etc.). Incluye un conjunto de desarrollo de 200 registros y un conjunto de prueba público de 800 registros, que contiene 992 objetivos auto-evaluables.
Protocolo de Evaluación (Pista de Producto de Entrada Bruta): Los sistemas se evalúan por su capacidad para procesar directamente el texto original de noticias en chino. Se permite la normalización interna del proveedor, pero se excluyen estrictamente los frontends de reglas externos, las reescrituras de LLM, las pistas de SSML y las ediciones manuales de texto. Se utiliza una voz fija para todas las muestras para aislar el rendimiento de la pronunciación.
Protocolo de Puntuación de Tres-ASR: Para evitar la subjetividad de la escucha humana y las limitaciones de los modelos ASR individuales, el benchmark emplea un conjunto heterogéneo de tres rutas de ASR:
- ASR de la API MiMo (basado en API)
- SenseVoiceSmall (Open-source local)
- Paraformer-zh (Open-source local)
El evaluador normaliza las transcripciones (Unicode, mayúsculas/minúsculas, puntuación) y las coteja con patrones de lectura predefinidos "positivos" (correctos) y "negativos" (incorrectos). Un objetivo se marca como correcto si se encuentra un patrón positivo, incorrecto si se encuentra un patrón negativo, y desconocido en caso contrario. Los resultados finales utilizan el voto de la mayoría (al menos dos rutas deben coincidir).
Métricas: La métrica principal es la Precisión Automática Estricta (objetivos correctos divididos por el total de objetivos auto-evaluables). Los autores también informan la Cobertura (objetivos resueltos como correctos o incorrectos) y la Precisión Resuelta (objetivos correctos divididos por objetivos resueltos) para evitar que los sistemas parezcan precisos simplemente por no lograr resolver objetivos difíciles.
Contribuciones Clave
- División Determinista Abierta: Una división fija de desarrollo/pública para objetivos de pronunciación de noticias en chino, lo que garantiza la reproducibilidad.
- Pista de Producto de Entrada Bruta: Una pista de evaluación específica que excluye la normalización del lado del usuario, probando el comportamiento de extremo a extremo de las API de TTS desplegadas.
- Esquema a Nivel de Objetivo: Un esquema de evaluación granular que distingue entre lecturas positivas y negativas para objetivos específicos.
- Puntuación Automática de Tres-ASR: Un protocolo robusto que utiliza un conjunto de modelos ASR con diagnósticos de ruta y estudios de ablación para manejar la ambigüedad.
- Leaderboard Reproducible: Resultados iniciales para siete sistemas de TTS de productos, proporcionando una base para comparaciones futuras.
Resultados
El benchmark evaluó siete sistemas principales de TTS: Volcano/Doubao, Azure, Google, MiniMax, Aliyun, MiMo y AWS Polly.
- Variación de Rendimiento: Existe una variación sustancial en el rendimiento. El mejor sistema (Volcano) alcanzó una precisión estricta de 0.879, mientras que varios sistemas ampliamente utilizados puntuaron por debajo de 0.60.
- Dificultad por Categoría: El rendimiento varía significativamente según la categoría. Los sistemas resolvieron mayoritariamente porcentajes, modelos de vehículos y abreviaturas. Sin embargo, las puntuaciones deportivas fueron la categoría más difícil (con una precisión estricta tan baja como 0.000 para algunos sistemas), leídas a menudo como rangos o sustracciones. Los símbolos de unidades tuvieron la tasa de "desconocido" más alta debido a las limitaciones de los ASR para exponer lecturas a nivel de símbolo.
- Diagnósticos de ASR: El conjunto de tres rutas mostró que, si bien las rutas individuales tuvieron una precisión estricta similar, su cobertura difirió. El ASR de la API MiMo fue conservador (alta precisión resuelta pero muchos desconocidos), mientras que los modelos locales resolvieron más objetivos. El voto de la mayoría redujo el impacto de los errores de las rutas individuales.
- Modos de Fallo: Para los sistemas que puntuaron cero en puntuaciones deportivas, el fallo dominante fue la lectura de los guiones de puntuación como rangos (p. ej., interpretar "96-91" como "96 a 91" en lugar de "96 contra 91").
Significado y Reivindicaciones
El artículo afirma que CN-NewsTTS Bench v0.1 hace que un modo de fallo común en producción —la pronunciación incorrecta de formas compactas de noticias en chino— sea medible y reproducible. Al fijar la división de datos, las transcripciones de ASR, el evaluador y los diagnósticos de categoría, el benchmark proporciona una forma estandarizada de evaluar el comportamiento de entrada bruta de los TTS. Los resultados indican que, a pesar de los avances en TTS, la lectura correcta de estas formas no estandarizadas sigue siendo un desafío práctico para los productos comerciales actuales. Los autores enfatizan que el benchmark es una herramienta automática destinada a complementar, no a reemplazar, las pruebas de escucha humana, particularmente para detectar errores tonales que el texto de ASR puede ocultar.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.
Recibe los mejores artículos de electrical engineering cada semana.
Utilizado por investigadores de Stanford, Cambridge y la Academia Francesa de Ciencias.
Revisa tu bandeja de entrada para confirmar tu suscripción.
Algo salió mal. ¿Intentar de nuevo?
Sin spam, cancela cuando quieras.