CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
原著者: Shijun Luo
原著者: Shijun Luo
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術サマリー: CN-NEWSTTS BENCH
問題提起
中国語のニューステキストには、スポーツのスコア(例:96-91)、ハイフンで繋がれたモデル名(例:苏 -27)、範囲、単位記号、パーセンテージ、漢字・ラテン文字・数字が混在した名称など、高密度で非標準的な表記形式が頻繁に含まれています。これらは人間の編集者にとっては明白ですが、TTS(Text-to-Speech)システムにとっては大きな課題となります。TTSモデルは、書かれた文字列を保持したまま、読み上げの意味を変えてしまう可能性があります(例:スコアを範囲として読んだり、軍用モデルを負の数として読んだりするなど)。MOS(平均意見スコア)による主観的なテストや、一般的なASR(自動音声認識)を用いたラウンドトリップ比較といった既存の評価手法は、これら特定の、かつ影響の大きい読み上げの判断を追跡するには粗すぎます。さらに、現在のベンチマークの多くは、ユーザー側による正規化、LLMによる書き換え、またはSSMLヒントに依存しており、デプロイされたTTS APIの「生の入力(raw-input)」に対する挙動を評価できていません。
手法
本論文では、外部ルールや手動の編集なしに、生のテキストから中国語ニュースTTSの読み上げを評価するために設計された、ターゲットレベルの自動ベンチマークである CN-NewsTTS Bench v0.1 を導入します。
データ構築: データセットは、カテゴリ固有のテンプレートとレキシコン(スポーツ、軍用モデル、技術単位などを網羅)から生成された、1,000個の決定論的かつ合成的なニュース形式の文章で構成されています。これには、200件の開発用セットと、992件の自動評価可能なターゲットを含む800件の公開テストセットが含まれます。
評価プロトコル (Raw Input Product Track): システムは、外部のルールフロントエンド、LLMによる書き換え、SSMLヒント、および手動のテキスト編集を一切排除し、元の中国語ニューステキストを直接処理する能力に基づいて評価されます。プロバイダー内部の正規化は許可されます。音声の性能を分離するため、すべてのサンプルには固定された音声が使用されます。
Three-ASR スコアリング・プロトコル: 人間のリスニングによる主観性と単一のASRモデルによる制限を避けるため、本ベンチマークは3つのASつのASRルートによるヘテロジニアスなアンサンブルを採用しています:
- MiMo API ASR (APIベース)
- SenseVoiceSmall (オープンソース・ローカル)
- Paraformer-zh (オープンソース・ローカル)
スコアラーはトランスクリプトを正規化(Unicode、ケース、句読点)し、定義済みの「ポジティブ(正解)」および「ネガティブ(不正解)」な読み上げパターンと照合します。ターゲットは、ポジティブなパターンが見つかった場合は正解(correct)、ネガティブなパターンが見つかった場合は不正解(wrong)、それ以外の場合は**不明(unknown)**と判定されます。最終結果は多数決(少なくとも2つのルートが一致すること)を使用します。
指標: 主要な指標は Strict Auto Accuracy(正解ターゲット数 ÷ 全自動評価可能ターゲット数)です。また、困難なターゲットの解決に失敗することでシステムが実際よりも正確に見えてしまうことを防ぐため、Coverage(正解または不正解として解決されたターゲット)および Resolved Accuracy(解決されたターゲット数 ÷ 正解ターゲット数)も報告します。
主な貢献
- オープンな決定論的分割: 中国語のニュース読み上げターゲットに関する固定されたdev/public分割を提供し、再現性を確保します。
- Raw Input Product Track: ユーザー側の正規化を除外し、デプロイされたTTS APIのエンドツーエンドの挙動をテストする特定の評価トラックを提供します。
- ターゲットレベルのスキーマ: 特定のターゲットに対するポジティブな読み方とネガティブな読み方を区別する、粒度の高い評価スキーマ。
- Three-ASR 自動スコアリング: 曖昧さを処理するために、ルート診断とアブレーション研究を備えた、ASRモデルのアンサンブルを用いた堅牢なプロトコル。
- 再現可能なリーダーボード: 7つの製品TTSシステムの初期結果を提供し、将来の比較のためのベースラインを提供します。
結果
ベンチマークは、7つの主要なTTSシステム(Volcano/Doubao, Azure, Google, MiniMax, Aliyun, MiMo, AWS Polly)を評価しました。
- 性能の差異: パフォーマンスには大幅な差が見られました。最良のシステム(Volcano)は 0.879 の厳密な精度を達成しましたが、広く使用されているシステムのいくつかは 0.60 を下回りました。
- カテゴリの難易度: カテゴリによって性能は大きく異なります。システムはパーセンテージ、車両モデル、略語については概ね解決できていました。しかし、スポーツのスコアは最も困難なカテゴリであり(一部のシステムでは厳密な精度が 0.000 まで低下)、しばしば範囲や減算として誤読されました。単位記号は、ASRの制限により記号レベルの読み上げが露出されないため、「不明(unknown)」の割合が最も高くなりました。
- ASR 診断: 3つのルートのアンサンブルは、個々のルートは同様の厳密な精度を持つ一方で、そのカバレッジが異なることを示しました。MiMo API ASRは保守的(高い解決精度を持つが、不明が多い)でしたが、ローカルモデルはより多くのターゲットを解決しました。多数決は、個々のルートのエラーの影響を軽減しました。
- 失敗モード: スポーツのスコアでゼロのスコアとなったシステムにおいて、支配的な失敗は、スコアのハイフンを範囲として読むこと(例:「96-91」を「96対91」ではなく「96から91」と解釈する)でした。
意義と主張
本論文は、CN-NewsTTS Bench v0.1が、一般的なプロダクションにおける失敗モードである「コンパクトな中国語ニュース形式の誤読」を、測定可能かつ再現可能にすることを主張しています。データ分割、ASRトランスクリプト、スコアラー、およびカテゴリ診断を固定することで、本ベンチマークは生の入力に対するTTSの挙動を評価するための標準化された方法を提供します。結果は、TTSが進歩しているにもかかわらず、これらの特定の非標準的な形式を正しく読むことは、現在の商用製品にとって依然として実用的な課題であることを示しています。著者らは、このベンチマークが、ASRのテキストが隠してしまう可能性のあるトーン(声調)のエラーを検出するための、人間のリスニングテストを置き換えるのではなく、補完するための自動ツールであることを強調しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の electrical engineering 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。