CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
Autores originais: Shijun Luo
Autores originais: Shijun Luo
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Resumo Técnico: CN-NEWSTTS BENCH
Definição do Problema
Textos de notícias em chinês frequentemente contêm formas escritas densas e não padronizadas — como placares esportivos (ex: 96-91), nomes de modelos hifenizados (ex: 苏 -27), intervalos, símbolos de unidades, porcentagens e nomes mistos de caracteres chineses, latinos e dígitos. Embora inequívocos para editores humanos, essas strings apresentam desafios significativos para sistemas de Text-to-Speech (TTS). Um modelo de TTS pode preservar a string escrita enquanto altera o significado falado (ex: ler um placar como um intervalo, ou um modelo militar como um número negativo). Métodos de avaliação existentes, como testes subjetivos de Mean Opinion Score (MOS) ou comparações genéricas de ida e volta via ASR, são muito grosseiros para rastrear essas decisões de leitura específicas e de alto impacto. Além disso, os benchmarks atuais frequentemente dependem de normalização pelo usuário, reescrita por Large Language Models (LLM) ou dicas de SSML, falhando em avaliar o comportamento de "entrada bruta" (raw-input) de APIs de TTS implantadas.
Metodologia
O artigo apresenta o CN-NewsTTS Bench v0.1, um benchmark automático de nível de alvo aberto, projetado para avaliar a pronúncia de notícias em chinês a partir de texto bruto, sem regras externas ou edições manuais.
Construção de Dados: O conjunto de dados consiste em 1.000 sentenças determinísticas sintéticas de estilo jornalístico geradas a partir de templates e léxicos específicos de categorias (cobrindo esportes, modelos militares, unidades técnicas, etc.). Inclui um conjunto de desenvolvimento de 200 registros e um conjunto de teste público de 800 registros, contendo 992 alvos autoavaliáveis.
Protocolo de Avaliação (Trilha de Produto de Entrada Bruta): Os sistemas são avaliados em sua capacidade de processar o texto original de notícias em chinês diretamente. A normalização interna do provedor é permitida, mas front-ends de regras externos, reescritas por LLM, dicas de SSML e edições manuais de texto são estritamente excluídos. Uma voz fixa é usada para todas as amostras para isolar o desempenho da pronúncia.
Protocolo de Pontuação de Três-ASR: Para evitar a subjetividade da escuta humana e as limitações de modelos ASR únicos, o benchmark emprega um conjunto heterogêneo de três rotas de ASR:
- MiMo API ASR (baseado em API)
- SenseVoiceSmall (open-source local)
- Paraformer-zh (open-source local)
O pontuador normaliza as transcrições (Unicode, caixa, pontuação) e as confronta com padrões de leitura pré-definidos "positivos" (corretos) e "negativos" (incorretos). Um alvo é marcado como correto se um padrão positivo for encontrado, errado se um padrão negativo for encontrado, e desconhecido caso contrário. Os resultados finais utilizam votação majoritária (pelo menos duas rotas devem concordar).
Métricas: A métrica primária é a Acurácia Estrita Automática (alvos corretos divididos pelo total de alvos autoavaliáveis). Os autores também reportam a Cobertura (alvos resolvidos como corretos ou errados) e a Acurácia Resolvida (alvos corretos divididos pelos alvos resolvidos) para evitar que os sistemas pareçam precisos simplesmente por falharem em resolver alvos difíceis.
Principais Contribuições
- Divisão Determinística Aberta: Uma divisão fixa de dev/público para alvos de pronúncia de notícias em chinês, garantindo reprodutibilidade.
- Trilha de Produto de Entrada Bruta: Uma trilha de avaliação específica que exclui a normalização do lado do usuário, testando o comportamento de ponta a ponta das APIs de TTS implantadas.
- Esquema de Nível de Alvo: Um esquema de avaliação granular que distingue entre leituras positivas e negativas para alvos específicos.
- Pontuação Automática de Três-ASR: Um protocolo robusto usando um conjunto de modelos ASR com diagnósticos de rota e estudos de ablação para lidar com ambiguidades.
- Leaderboard Reproduzível: Resultados iniciais para sete sistemas de TTS de produtos, fornecendo uma base para comparações futuras.
Resultos
O benchmark avaliou sete sistemas de TTS principais: Volcano/Doubao, Azure, Google, MiniMax, Aliyun, MiMo e AWS Polly.
- Variância de Desempenho: Há uma variação substancial de desempenho. O melhor sistema (Volcano) alcançou uma acurácia estrita de 0,879, enquanto vários sistemas amplamente utilizados pontuaram abaixo de 0,60.
- Dificuldade por Categoria: O desempenho varia significamente por categoria. Os sistemas resolveram majoritariamente porcentagens, modelos de veículos e abreviações. No entanto, placares esportivos foram a categoria mais difícil (acurácia estrita tão baixa quanto 0,000 para alguns sistemas), frequentemente lidos como intervalos ou subtrações. Símbolos de unidades tiveram a maior taxa de "desconhecidos" devido às limitações do ASR em expor leituras ao nível de símbolo.
- Diagnósticos de ASR: O conjunto de três rotas mostrou que, embora as rotas individuais tivessem acurácia estrita semelhante, suas coberturas diferiam. O MiMo API ASR foi conservador (alta acurácia resolvida, mas muitos desconhecidos), enquanto os modelos locais resolveram mais alvos. A votação majoritária reduziu o impacto dos erros individuais de cada rota.
- Modos de Falha: Para sistemas com pontuação zero em placares esportivos, a falha dominante foi ler hifens de placar como intervalos (ex: interpretando "96-91" como "96 para 91" em vez de "96 contra 91").
Significância e Alegações
O artigo alega que o CN-NewsTTS Bench v0.1 torna um modo de falha comum de produção — a pronúncia incorreta de formas compactas de notícias em chinês — mensurável e reproduzível. Ao fixar a divisão de dados, as transcrições de ASR, o pontuador e os diagnósticos de categoria, o benchmark fornece uma maneira padronizada de avaliar o comportamento de entrada bruta de TTS. Os resultados indicam que, apesar dos avanços no TTS, ler essas formas não padronizadas corretamente continua sendo um desafio prático para os produtos comerciais atuais. Os autores enfatizam que o benchmark é uma ferramenta automática destinada a complementar, e não substituir, testes de escuta humana, particularmente para detectar erros tonais que o texto do ASR pode ocultar.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.
Receba os melhores artigos de electrical engineering toda semana.
Confiado por pesquisadores de Stanford, Cambridge e da Academia Francesa de Ciências.
Verifique sua caixa de entrada para confirmar sua inscrição.
Algo deu errado. Tentar novamente?
Sem spam, cancele quando quiser.