CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
Ursprüngliche Autoren: Shijun Luo
Ursprüngliche Autoren: Shijun Luo
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Technisches Resümee: CN-NEWSTTS BENCH
Problemstellung
Chinesische Nachrichtentexte enthalten häufig dichte, nicht-standardisierte Schriftformen – wie etwa Sportergebnisse (z. B. 96-91), Bindestrich-Modellnamen (z. B. 苏 -27), Bereiche, Einheiten-Symbole, Prozentsätze und gemischte Chinesisch-Latein-Ziffern-Namen. Während diese Zeichenfolgen für menschliche Redakteure eindeutig sind, stellen sie eine erhebliche Herausforderung für Text-to-Speech (TTS)-Systeme dar. Ein TTS-Modell kann die geschriebene Zeichenfolge beibehalten, aber die gesprochene Bedeutung verändern (z. B. ein Ergebnis als Bereich statt als Vergleich lesen oder ein Militärmodell als negative Zahl aussprechen). Bestehende Evaluierungsmethoden, wie subjektive Mean Opinion Score (MOS)-Tests oder generische ASR-Round-Trip-Vergleiche, sind zu grob, um diese spezifischen, hochwirksamen Lesentscheidungen zu verfolgen. Zudem verlassen sich aktuelle Benchmarks oft auf die Normalisierung auf der Nutzerseite, LLM-Umschreibungen oder SSML-Hinweise, wodurch das Verhalten der „Roh-Input“-APIs von eingesetzten TTS-Systemen nicht evaluiert wird.
Methodik
Das Paper stellt CN-NewsTTS Bench v0.1 vor, einen offenen, zielorientierten automatischen Benchmark zur Evaluierung der chinesischen Nachrichten-TTS-Aussprache aus Rohtext ohne externe Regeln oder manuelle Bearbeitungen.
Datenerstellung: Der Datensatz besteht aus 1.000 deterministischen, synthetischen nachrichtenartigen Sätzen, die aus kategoriespezifischen Templates und Lexika generiert wurden (abdeckend für Sport, Militärmodelle, technische Einheiten usw.). Er umfasst einen Entwicklungsdatensatz mit 200 Datensätzen und einen öffentlichen Testdatensatz mit 800 Datensätzen, die insgesamt 992 automatisch evaluierbare Zielvorgaben enthalten.
Evaluierungsprotokoll (Raw Input Product Track): Systeme werden darauf geprüft, den ursprünglichen chinesischen Nachrichtentext direkt zu verarbeiten. Interne Normalisierungen des Anbieters sind zulässig, externe Regel-Frontends, LLM-Umschreibungen, SSML-Hinweise und manuelle Textbearbeitungen sind jedoch strikt ausgeschlossen. Eine feste Stimme wird für alle Proben verwendet, um die Ausspracheleistung zu isolieren.
Drei-ASR-Scoring-Protokoll: Um die Subjektivität des menschlichen Hörens und die Einschränkungen einzelner ASR-Modelle zu vermeiden, nutzt der Benchmark ein heterogenes Ensemble aus drei ASR-Routen:
- MiMo API ASR (API-basiert)
- SenseVoiceSmall (Open-Source lokal)
- Paraformer-zh (Open-Source lokal)
Der Scorer normalisiert die Transkripte (Unicode, Groß-/Kleinschreibung, Interpunktion) und gleicht sie mit vordefinierten „positiven“ (korrekten) und „negativen“ (inkorrekten) Lesemustern ab. Ein Ziel wird als korrekt markiert, wenn ein positives Muster gefunden wird, als falsch, wenn ein negatives Muster gefunden wird, und andernfalls als unbekannt. Die Endergebnisse nutzen Mehrheitsentscheidungen (mindestens zwei Routen müssen übereinstimmen).
Metriken: Die primäre Metrik ist die Strict Auto Accuracy (korrekte Ziele geteilt durch die Gesamtzahl der automatisch evaluierbaren Ziele). Die Autoren berichten zudem über die Coverage (Ziele, die als korrekt oder falsch aufgelöst wurden) und die Resolved Accuracy (korrekte Ziele geteilt durch die aufgelösten Ziele), um zu verhindern, dass Systeme allein dadurch als präzise erscheinen, dass sie schwierige Ziele nicht auflösen können.
Wesentliche Beiträge
- Offener deterministischer Split: Ein fester Dev/Public-Split für chinesische Nachrichten-Ausspracheziele, der die Reproduzierbarkeit gewährleistet.
- Raw Input Product Track: Ein spezifischer Evaluierungs-Track, der die Normalisierung auf der Nutzerseite ausschließt und das End-to-End-Verhalten bereitgestellter TTS-APIs testet.
- Zielorientiertes Schema: Ein granularer Evaluierungsansatz, der zwischen positiven und negativen Lesarten für spezifische Ziele unterscheidet.
- Drei-ASR-Automatisches Scoring: Ein robustes Protokoll unter Verwendung eines ASR-Modell-Ensembles mit Routendiagnostik und Ablationsstudien zur Handhabung von Ambiguitäten.
- Reproduzierbares Leaderboard: Erste Ergebnisse für sieben kommerzielle TTS-Systeme, die eine Basis für zukünftige Vergleiche bieten.
Ergebnisse
Der Benchmark evaluierte sieben große TTS-Systeme: Volcano/Doubao, Azure, Google, MiniMax, Aliyun, MiMo und AWS Polly.
- Leistungsvarianz: Es gibt erhebliche Unterschiede in der Leistung. Das beste System (Volcano) erreichte eine strikte Genauigkeit von 0,879, während mehrere weit verbreitete Systeme unter 0,60 lagen.
- Kategorie-Schwierigkeit: Die Leistung variiert signifikant nach Kategorie. Systeme lösten Prozentsätze, Fahrzeugmodelle und Abkürzungen weitgehend korrekt. Sportergebnisse waren jedoch die schwierigste Kategorie (strikte Genauigkeit teilweise bei 0,000 für einige Systeme), da sie oft als Bereiche oder Subtraktionen fehlinterpretiert wurden. Einheitssymbole wiesen die höchste „Unknown“-Rate auf, bedingt durch die Einschränkungen der ASR bei der Offenlegung von Symbol-Ebenen-Lesarten.
- ASR-Diagnostik: Das Drei-Routen-Ensemble zeigte, dass die einzelnen Routen zwar ähnliche strikte Genauigkeiten aufwiesen, sich ihre Coverage jedoch unterschied. Die MiMo API ASR war konservativ (hohe Resolved Accuracy, aber viele Unbekannte), während lokale Modelle mehr Ziele auflösten. Die Mehrheitsentscheidung reduzierte den Einfluss einzelner Routenfehler.
- Fehlermodi: Für Systeme, die bei Sportergebnissen eine Nullpunkt-Genauigkeit erreichten, war der dominante Fehler das Lesen von Bindestrichen als Bereiche (z. B. Interpretation von „96-91“ als „96 bis 91“ statt „96 zu 91“).
Bedeutung und Ansprüche
Das Paper behauptet, dass CN-NewsTTS Bench v0.1 einen häufigen Produktionsfehler – die falsche Aussprache kompakter chinesischer Nachrichtenformen – messbar und reproduzierbar macht. Durch die Fixierung des Datensplits, der ASR-Transkripte, des Scorers und der Kategorie-Diagnostik bietet der Benchmark eine standardisierte Methode zur Evaluierung des Raw-Input-Verhaltens von TTS. Die Ergebnisse zeigen, dass trotz Fortschritten in der TTS die korrekte Lesart dieser spezifischen, nicht-standardisierten Formen weiterhin eine praktische Herausforderung für aktuelle kommerzielle Produkte darstellt. Die Autoren betonen, dass der Benchmark ein automatisiertes Werkzeug ist, das menschliche Hörtests ergänzen, aber nicht ersetzen soll, insbesondere zur Erkennung von Tonalfehlern, die durch ASR-Texte verborgen bleiben können.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.
Erhalten Sie die besten electrical engineering Papers jede Woche.
Vertraut von Forschern in Stanford, Cambridge und der Französischen Akademie der Wissenschaften.
Prüfen Sie Ihr Postfach, um Ihr Abonnement zu bestätigen.
Etwas ist schiefgelaufen. Nochmal versuchen?
Kein Spam, jederzeit abbestellbar.