CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
Oorspronkelijke auteurs: Shijun Luo
Oorspronkelijke auteurs: Shijun Luo
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: CN-NEWSTTS BENCH
Probleemstelling
Chinese nieuwsteksten bevatten vaak dichte, niet-standaard geschreven vormen—zoals sportuitslagen (bijv. 96-91), met koppeltekens aangeduide modelnamen (bijv. 苏 -27), bereiken, eenheidssymbolen, percentages en gemengde Chinees-Latijn-cijfer namen. Hoewel deze tekstreeksen voor menselijke redacteurs eenduidig zijn, vormen ze een aanzienlijke uitdaging voor Text-to-Speech (TTS) systemen. Een TTS-model kan de geschreven tekst behouden terwijl de gesproken betekenis verandert (bijv. een score lezen als een bereik, of een militair model als een negatief getal). Bestaande evaluatiemethoden, zoals subjectieve Mean Opinion Score (MOS) tests of generieke ASR round-trip vergelijkingen, zijn te grof om deze specifieke, hoog-impact leesbeslissingen te volgen. Bovendien vertrouwen huidige benchmarks vaak op gebruikerszijde-normalisatie, Large Language Model (LLM) herschrijving of SSML-hints, waardoor het gedrag van de "raw-input" (ruwe invoer) van uitgerolde TTS API's niet wordt geëvalueerd.
Methodologie
Het artikel introduceert CN-NewsTTS Bench v0.1, een open, target-niveau automatische benchmark ontworpen om de Chinese nieuws TTS-uitspraak te evalueren vanuit ruwe tekst zonder externe regels of handmatige bewerkingen.
Dataconstructie: De dataset bestaat uit 1.000 deterministische, synthetische nieuwsstijl zinnen gegenereerd uit categorie-specifieke sjablonen en lexiconen (dekking van sport, militaire modellen, technische eenheden, etc.). Het bevat een ontwikkelset van 200 records en een publieke testset van 800 records, bevattende 992 automatisch evalueerbare targets.
Evaluatieprotocol (Raw Input Product Track): Systemen worden geëvalueerd op hun vermogen om originele Chinese nieuwstekst direct te verwerken. Interne normalisatie door de provider is toegestaan, maar externe regel-frontends, LLM-herschrijvingen, SSML-hints en handmatige tekstbewerkingen zijn strikt uitgesloten. Een vaste stem wordt gebruikt voor alle samples om de uitspraakprestaties te isoleren.
Drie-ASR Scoring Protocol: Om de subjectiviteit van menselijk luisteren en de beperkingen van enkele ASR-modellen te vermijden, maakt de benchmark gebruik van een heterogene ensemble van drie ASR-routes:
- MiMo API ASR (API-gebaseerd)
- SenseVoiceSmall (Open-source lokaal)
- Paraformer-zh (Open-source lokaal)
De scorer normaliseert transcripties (Unicode, hoofdletters, interpunctie) en matcht deze met vooraf gedefinieerde "positieve" (correcte) en "negatieve" (onjuiste) leespatronen. Een target wordt gemarkeerd als correct als een positief patroon wordt gevonden, onjuist als een negatief patroon wordt gevonden, en onbekend anders. De definitieve resultaten maken gebruik van meerderheidsstemming (minstens twee routes moeten het eens zijn).
Metrieken: De primaire metriek is Strict Auto Accuracy (correcte targets gedeeld door het totaal aantal automatisch evalueerbare targets). De auteurs rapporteren ook Coverage (targets opgelost als correct of onjuist) en Resolved Accuracy (correcte targets gedeeld door de opgeloste targets) om te voorkomen dat systemen accuraat lijken simpelweg door moeilijke targets niet op te lossen.
Belangrijkste Bijdragen
- Open Deterministische Split: Een vaste dev/publieke split voor Chinese nieuws-uitspraak targets, wat reproduceerbaarheid garandeert.
- Raw Input Product Track: Een specifiek evaluatietrack die gebruikerszijde-normalisatie uitsluit, waardoor het end-to-end gedrag van uitgerolde TTS API's wordt getest.
- Target-Level Schema: Een granulair evaluatieschema dat onderscheid maakt tussen positieve en negatieve lezingen voor specifieke targets.
- Drie-ASR Automatische Scoring: Een robuust protocol gebruikmakend van een ensemble van ASR-modellen met route-diagnostiek en ablatie-studies om ambiguïteit te behandelen.
- Reproduceerbare Leaderboard: Initiële resultaten voor zeven product TTS-systemen, wat een baseline biedt voor toekomstige vergelijkingen.
Resultaten
De benchmark evalueerde zeven belangrijke TTS-systemen: Volcano/Doubao, Azure, Google, MiniMax, Aliyun, MiMo, en AWS Polly.
- Prestatievariantie: Er is een aanzienlijke variatie in prestaties. Het beste systeem (Volcano) behaalde een strikte nauwkeurigheid van 0,879, terwijl verschillende veelgebruikte systemen onder de 0,60 scoorden.
- Categorie-moeilijkheid: Prestaties variëren significant per categorie. Systemen losten percentages, voertuigmodellen en afkortingen grotendeels op. Echter, sportuitslagen waren de moeilijkste categorie (strikt nauwkeurigheid zo laag als 0,000 voor sommige systemen), vaak foutief gelezen als bereiken of aftrekkingen. Eenheidssymbolen hadden het hoogste "onbekend" percentage vanwege ASR-beperkingen in het blootstellen van symbool-niveau lezingen.
- ASR Diagnostiek: De drie-route ensemble toonde aan dat hoewel individuele routes vergelijkbare strikte nauwkeurigheid hadden, hun coverage verschilde. MiMo API ASR was conservatief (hoge resolved accuracy maar veel unknowns), terwijl lokale modellen meer targets oplosten. De meerderheidsstemming verminderde de impact van individuele route-fouten.
- Foutmodi: Voor systemen die nul scoorden op sportuitslagen, was de dominante fout het lezen van sport-koppeltekens als bereiken (bijv. het interpreteren van "96-91" als "96 tot 91" in plaats van "96 tegen 91").
Betekenis en Claims
Het artikel claimt dat CN-NewsTTS Bench v0.1 een veelvoorkomende productiefout—de onjuiste uitspraak van compacte Chinese nieuwsvormen—meetbaar en reproduceerbaar maakt. Door de dataspit, ASR-transcripten, scorer en categorie-diagnostiek vast te leggen, biedt de benchmark een gestandaardiseerde manier om de raw-input TTS-prestaties te evalueren. De resultaten wijzen erop dat ondanks de vooruitgang in TTS, het correct lezen van deze specifieke niet-standaard vormen een praktische uitdaging blijft voor huidige commerciële producten. De auteurs benadrukken dat de benchmark een automatisch hulpmiddel is bedoeld om menselijke luistertests aan te vullen, en niet te vervangen, met name voor het detecteren van toonhoogtefouten die ASR-tekst mogelijk verbergt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.
Ontvang wekelijks de beste electrical engineering papers.
Vertrouwd door onderzoekers van Stanford, Cambridge en de Franse Academie van Wetenschappen.
Check je inbox om je aanmelding te bevestigen.
Er ging iets mis. Opnieuw proberen?
Geen spam, altijd opzegbaar.