Voice Mapping of Text-to-Speech Systems: A Metric-Based Approach for Voice Quality Assessment
本研究提出了一种基于指标的语音映射框架,用于评估六种模型的文语转换质量,结果表明语音范围是主要的能力指标,而诸如倒谱峰值显著度(CPPs)和频谱平衡等具体指标能有效区分自然发声努力与机器人伪影。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位音乐评论家,试图评判不同机器人的歌唱水平。多年来,唯一的方法是请一群人聆听,并为机器人打分(1 到 5 分)。但这种方法既缓慢又昂贵,而且有时人们为了友善而给出高分,或者他们无法就“好听”的声音达成共识。
本文提出了一种新的、科学的方法来评判这些歌唱机器人(文本转语音或 TTS 系统),而无需依赖人类的耳朵。作者将这种方法称为“语音映射(Voice Mapping)”。
以下是他们所做的工作及其发现简要概述:
1. 问题所在:“机器人嗓音”与“人类嗓音”
当人类说话时,他们不仅仅是声音变大或变小。当他们大喊时,嗓音的质感会发生变化;当他们耳语时,又会再次改变。这是努力与声音之间的一场复杂舞蹈。旧式的电脑语音往往听起来像单调、机械的嗡嗡声,因为它们无法处理这些细微的变化。较新的 AI 模型正在变得更好,但我们如何精确地衡量它们究竟有多像人类呢?
2. 解决方案:“语音地图”
作者创建了一种名为语音地图的可视化工具。这就像一张天气图,只不过它映射的不是温度和降雨,而是音高(声音的高低)和响度(声音的轻柔或洪亮)。
- 网格:想象一个网格,其横轴是音符(音高),纵轴是音量。
- 颜色:每当计算机说话时,它都会在这张地图上投下一个点。点的颜色告诉我们该特定时刻声音的质量。
- 暖色(红色/橙色):声音听起来清晰、丰富且自然。
- 冷色(蓝色):声音听起来有气声、嘈杂或机械。
通过观察整张地图,你可以看到机器人能够覆盖的“领地”。它能唱得又高又响吗?它能轻声耳语吗?还是被困在一个狭小、乏味的角落里?
3. 实验:测试机器人
研究人员从一段著名录音(一位女性朗读书籍)中选取了 100 个句子,并让六个不同的 AI 模型朗读它们。随后,他们将 AI 的“语音地图”与原始人类的地图进行了比较。
他们使用了三个特定的“尺子”来衡量声音质量:
- 波峰因数(“峰值”):这衡量声波有多“尖锐”。太尖锐听起来刺耳;太平坦则听起来沉闷。
- 频谱平衡(“亮度”):这检查声音是否拥有足够的高频“光泽”,或者听起来是否像被毯子盖住一样沉闷。
- CPPs(“和谐度”):这衡量声波的有序程度。完全有序的波形听起来清晰;杂乱的波形听起来像静电噪音或机器人。
4. 结果:谁唱得最好?
该研究比较了从旧模型(如 2016 年的Merlin)到最新模型(如 2021 年的VITS)的各种模型。
- 老牌阵营(Merlin):它的地图狭小且分散。听起来非常机械。“和谐度”得分过高(超过 10 dB),作者表示这是“完美僵硬”的机器人嗓音而非人类嗓音的标志。
- 新星(VITS):该模型生成的地图与人类的地图几乎一模一样。它覆盖了最多的领地(高音、低音、大声和轻声),并具有最自然的声音质量。它最接近真实情况。
- 轻柔耳语者(Glow-TTS):该模型的地图较小(它无法发出同样多的大声或高音),但在耳语时表现最佳。它比任何其他模型都更好地捕捉到了“轻柔”的人类嗓音,在安静时刻听起来非常清晰自然。
- “机器人”警告:研究发现“和谐度”得分有一个最佳区间。如果得分在7 到 8 dB之间,听起来就很自然。如果超过 10 dB,声音开始听起来机械且不自然。
5. “引擎”检查(声码器)
研究人员还测试了将 AI 音符转化为实际声音的“引擎”(称为声码器)。他们发现,其中一个引擎UnivNet产生的声音比另一个(Multiband-MelGAN)更清晰、更自然,尤其是在声音洪亮时。
核心结论
这篇论文不仅仅说“这个机器人听起来不错”。它提供了一份视觉蓝图,说明了为什么它听起来不错。
- VITS 目前是全方位听起来像真人的冠军。
- Glow-TTS 是轻柔耳语的冠军。
- 语音映射 是一项新工具,它让我们无需让人类坐在那里聆听数小时,就能确切地看到机器人嗓音在哪里失败(例如高音部分过于机械)以及在哪里成功。
简而言之,他们构建了一种“语音指纹”扫描仪,告诉我们电脑的声音是真正鲜活,还是仅仅是一种巧妙的模仿。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。