CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
原作者: Shijun Luo
原作者: Shijun Luo
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:CN-NEWSTTS BENCH
问题陈述
中文新闻文本经常包含密集的、非标准书写形式的内容——例如体育比分(如 96-91)、连字符连接的模型名称(如 苏 -27)、范围、单位符号、百分比以及中英数混合名称。虽然这些字符串对人类编辑来说是明确的,但它们给文本转语音(TTS)系统带来了显著挑战。TTS 模型可能会保留书写形式,却改变了朗读含义(例如,将比分读成范围,或将军事型号读成负数)。现有的评估方法,如主观平均意见得分(MOS)测试或通用的 ASR(自动语音识别)回环对比,过于粗糙,无法追踪这些具有高影响力的特定朗读决策。此外,目前的基准测试通常依赖于用户侧的归一化、大语言模型(LLM)重写或 SSML 提示,未能评估部署的 TTS API 的“原始输入”行为。
方法论
本文介绍了 CN-NewsTTS Bench v0.1,这是一个开放的、目标层级的自动基准测试,旨在评估在不使用外部规则或人工编辑的情况下,中文新闻 TTS 对原始文本的发音能力。
数据构建: 该数据集由 1,000 个确定性的、基于类别模板和词表生成的合成新闻风格句子组成(涵盖体育、军事模型、技术单位等)。它包含一个 200 条记录的开发集和一个 800 条记录的公开测试集,共包含 992 个可自动评估的目标。
评估协议(原始输入产品赛道): 系统被评估其直接处理原始中文新闻文本的能力。允许使用供应商内部的归一化,但严格排除外部规则前端、LLM 重写、SSML 提示和人工文本编辑。所有样本使用固定的声音,以隔离发音性能。
三 ASR 评分协议: 为了避免人类听感的主观性以及单一 ASR 模型的局限性,该基准测试采用了由三个 ASR 路径组成的异构集成:
- MiMo API ASR(基于 API)
- SenseVoiceSmall(开源本地)
- Paraformer-zh(开源本地)
评分器会对转录文本进行归一化(Unicode、大小写、标点),并将其与预定义的“正向”(正确)和“负向”(错误)朗读模式进行匹配。如果找到正向模式,则目标标记为正确;如果找到负向模式,则标记为错误;否则标记为未知。最终结果采用多数投票法(至少两个路径必须达成一致)。
指标: 主要指标是严格自动准确率(正确目标数除以总可自动评估目标数)。作者还报告了覆盖率(被解析为正确或错误的 target)和解析准确率(正确目标数除以已解析目标数),以防止系统仅仅通过无法解析困难目标而显得准确。
核心贡献
- 开放的确定性划分: 为中文新闻发音目标提供了固定的开发/公开划分,确保了可复现性。
- 原始输入产品赛道: 一个特定的评估赛道,排除了用户侧的归一化,测试了部署的 TTS API 的端到端行为。
- 目标层级架构: 一个细粒度的评估架构,能够区分特定目标的正向和负向朗读。
- 三 ASR 自动评分: 一个鲁棒的协议,利用 ASR 模型集成,并通过路径诊断和消融研究来处理歧义。
- 可复现的排行榜: 展示了七个产品 TTS 系统的初步结果,为未来的比较提供了基准。
结果
该基准测试评估了七个主要的 TTS 系统:火山引擎/豆包、Azure、Google、MiniMax、阿里云、MiMo 和 AWS Polly。
- 性能差异: 性能表现存在显著差异。表现最好的系统(火山引擎)达到了 0.879 的严格准确率,而几个广泛使用的系统得分低于 0.60。
- 类别难度: 性能随类别变化显著。系统在处理百分比、车辆模型和缩写方面表现较好。然而,体育比分是最难的类别(某些系统的严格准确率低至 0.000),经常被误读为范围或减法。单位符号由于 ASR 在暴露符号级朗读方面的局限性,具有最高的“未知”率。
- ASR 诊断: 三路径集成显示,虽然单个路径的严格准确率相似,但它们的覆盖率不同。MiMo API ASR 较为保守(解析准确率高但未知数多),而本地模型解析了更多的目标。多数投票降低了单个路径错误的影响。
- 失败模式: 对于在体育比分上得分为零的系统,主要的失败模式是将比分中的连字符读成了范围(例如,将“96-91”解释为“96 到 91”而非“96 比 91”)。
意义与主张
本文声称,CN-NewsTTS Bench v0.1 使一种常见的生产故障模式——即紧凑型中文新闻形式的错误发音——变得可衡量且可复现。通过固定数据划分、ASR 转录、评分器和类别诊断,该基准测试提供了一种评估原始输入 TTS 行为的标准方式。结果表明,尽管 TTS 技术在进步,但正确朗读这些特定的非标准形式仍然是当前商业产品面临的一个实际挑战。作者强调,该基准测试是一个自动工具,旨在补充而非取代人工听感测试,特别是用于检测 ASR 转录文本可能掩盖的声调错误。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。