CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
원저자: Shijun Luo
원저자: Shijun Luo
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기술 요약: CN-NEWSTTS 벤치
문제 정의
중국어 뉴스 텍스트에는 스포츠 점수(예: 96-91), 하이픈이 포함된 모델명(예: 苏 -27), 범위, 단위 기호, 백분율, 한자-라틴-숫자 혼합 명칭 등 밀집된 비표준 서술 형식이 자주 포함됩니다. 이러한 문자열은 인간 편집자에게는 모호함이 없으나, TTS(Text-to-Speech) 시스템에는 상당한 도전 과제가 됩니다. TTS 모델은 작성된 문자열을 유지하면서도 발음되는 의미를 변경할 수 있습니다(예: 점수를 범위로 읽거나, 군용 모델을 음수로 읽는 경우). 기존의 평가 방법인 주관적 MOS(Mean Opinion Score) 테스트나 일반적인 ASR(자동 음성 인식) 왕복 비교는 이러한 특정하고 영향력이 큰 읽기 결정 사항들을 추적하기에는 너무 거칠고 포괄적입니다. 또한, 현재의 벤치마크들은 사용자 측의 정규화, LLM(대규모 언어 모델) 재작성 또는 SSML 힌트에 의존하고 있어, 배포된 TTS API의 "원시 입력(raw-input)" 동작을 평가하는 데 한계가 있습니다.
방법론
본 논문은 외부 규칙이나 수동 편집 없이 원시 텍스트로부터 중국어 뉴스 TTS 발음을 평가하기 위해 설계된 개방형 타겟 레벨 자동 벤치마크인 CN-NewsTTS Bench v0.1을 소개합니다.
데이터 구축: 데이터셋은 카테기별 템플릿과 사전(스포츠, 군용 모델, 기술 단위 등 포함)으로부터 생성된 1,000개의 결정론적 합성 뉴스 스타일 문장으로 구성됩니다. 여기에는 200개의 개발 세트와 800개의 공개 테스트 세트가 포함되며, 총 992개의 자동 평가 가능 타겟을 포함합니다.
평가 프로토콜 (Raw Input Product Track): 시스템은 외부 규칙 프론트엔드, LLM 재작성, SSMM 힌트, 또는 수동 텍스트 편집 없이 원래의 중국어 뉴스 텍스트를 직접 처리하는 능력을 평가받습니다. 내부 정규화는 허용되지만, 외부 규칙 프론트엔드, LLM 재작성, SSML 힌트 및 수동 텍스트 편집은 엄격히 제외됩니다. 발음 성능만을 분리하여 측정하기 위해 모든 샘플에 고정된 목소리를 사용합니다.
Three-ASR 스코어링 프로토콜: 인간 청취의 주관성과 단일 ASR 모델의 한계를 피하기 위해, 본 벤치마크는 세 가지 ASR 경로의 이질적인 앙상블을 채택합니다:
- MiMo API ASR (API 기반)
- SenseVoiceSmall (오픈 소스 로컬)
- Paraformer-zh (오픈 소스 로컬)
스코어러는 전사(transcripts)를 정규화(Unicode, 대소문자, 구두점)하고 이를 미리 정의된 "긍정적(정답)" 및 "부정적(오답)" 읽기 패턴과 대조합니다. 타겟은 긍정적 패턴이 발견되면 정답(correct), 부정적 패턴이 발견되면 오답(wrong), 그 외의 경우에는 **알 수 없음(unknown)**으로 표시됩니다. 최종 결과는 다수결 투표(최소 두 개의 경로가 일치해야 함)를 사용합니다.
지표: 주요 지표는 엄격 자동 정확도(Strict Auto Accuracy) (전체 자동 평가 가능 타겟 대비 정답 타겟 수)입니다. 저자들은 시스템이 어려운 타겟을 해결하지 못함으로써 정확도가 높아 보이는 현상을 방지하기 위해 커버리지(Coverage) (정답 또는 오답으로 해결된 타겟)와 해결 정확도(Resolved Accuracy) (해결된 타겟 대비 정답 타겟 수)도 함께 보고합니다.
주요 기여
- 개방형 결정론적 분할: 중국어 뉴스 발음 타겟에 대한 고정된 dev/public 분할을 제공하여 재현성을 보장합니다.
- Raw Input Product Track: 사용자 측 정규화를 제외하여 배포된 TTS API의 엔드 투 엔드 동작을 테스트하는 특정 평가 트랙을 제공합니다.
- 타겟 레벨 스키마: 특정 타겟에 대해 긍정적 읽기와 부정적 읽기를 구분하는 세밀한 평가 스키마를 제공합니다.
- Three-ASR 자동 스코어링: 모호성을 처리하기 위해 경로 진단 및 어블레이션 연구(ablation studies)를 포함한 ASR 모델 앙상블을 사용하는 견고한 프로토콜을 사용합니다.
- 재현 가능한 리더보드: 7개의 제품 TTS 시스템에 대한 초기 결과를 제공하여 향후 비교를 위한 베이스라인을 마련합니다.
결과
본 벤치마크는 7개의 주요 TTS 시스템(Volcano/Doubao, Azure, Google, MiniMax, Aliyun, MiMo, AWS Polly)을 평가했습니다.
- 성능 편차: 성능 차이가 상당합니다. 가장 우수한 시스템(Volcano)은 0.879의 엄격 정확도를 달 기록한 반면, 널리 사용되는 여러 시스템은 0.60 미만의 점수를 기록했습니다.
- 카테고리별 난이도: 카테고리에 따라 성능 차이가 큽니다. 시스템들은 대체로 백분율, 차량 모델, 약어는 잘 해결했습니다. 그러나 스포츠 점수는 가장 어려운 카테고리였으며(일부 시스템에서 엄격 정확도가 0.000까지 떨어짐), 종종 범위나 뺄셈으로 잘못 읽혔습니다. 단위 기호는 ASR의 기호 수준 읽기 노출 한계로 인해 가장 높은 "알 수 없음(unknown)" 비율을 보였습니다.
- ASR 진단: 세 경로의 앙상블 결과, 개별 경로의 엄격 정확도는 유사했으나 커버리지는 달랐습니다. MiMo API ASR은 보수적(높은 해결 정확도를 가졌으나 많은 '알 수 없음' 발생)이었던 반면, 로컬 모델들은 더 많은 타겟을 해결했습니다. 다수결 투표는 개별 경로의 오류 영향을 줄였습니다.
- 실패 모드: 스포츠 점수에서 0점을 기록한 시스템들의 주요 실패 원인은 점수 사이의 하이픈을 범위(예: "96-91"을 "96에서 91"으로 해석)로 읽는 것이었습니다.
의의 및 주장
본 논문은 CN-NewsTTS Bench v0.1이 흔한 프로덕션 실패 모드인—압축된 중국어 뉴스 형태의 잘못된 발음—을 측정 가능하고 재현 가능하게 만든다고 주장합니다. 데이터 분할, ASR 전사, 스코어러 및 카테고리 진단을 고정함으로써, 본 벤치마크는 원시 입력(raw-input) TTS 동작을 평가하는 표준화된 방법을 제공합니다. 결과에 따르면, TTS의 발전에도 불구하고 이러한 특정 비표준 형식을 정확하게 읽는 것은 현재 상용 제품들에게 여전히 실질적인 과제로 남아 있습니다. 저자들은 본 벤치마크가 인간의 청취 테스트를 대체하기보다는, 특히 ASR 텍스트가 숨길 수 있는 성조 오류를 탐지하기 위한 자동화 도구로서 보완하는 용도임을 강조합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.
매주 최고의 electrical engineering 논문을 받아보세요.
스탠포드, 케임브리지, 프랑스 과학 아카데미 연구자들이 신뢰합니다.
받은편지함에서 구독을 확인해주세요.
문제가 발생했습니다. 다시 시도하시겠어요?
스팸 없음, 언제든 구독 취소 가능.