Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation
本文表明,文本转语音(TTS)评估需要具备上下文感知能力的指标,而非一成不变的方法,因为语音的适用性在不同领域之间存在显著差异,且往往与传统的自然度评分相冲突。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在雇佣一名配音演员。如果你需要有人给孩子读睡前故事,你会想要一个平静、稳定且舒缓的声音。但如果你需要有人在电子游戏中扮演一个疯狂的角色,或者听起来像是在咖啡馆里和朋友聊天,那么同样平静的声音就会显得很奇怪,格格不入。
这篇论文认为,文本转语音(TTS)技术正面临着同样的问题。多年来,开发者一直试图让计算机声音听起来尽可能“自然”(像人一样)。但这项研究表明,“自然”并不总是等同于“合适”。
以下是研究人员发现的内容,使用了简单的类比:
1. “瑞士军刀”的迷思
长期以来,目标是构建一个能把所有事情都做得很好的完美 TTS 系统——就像一把瑞士军刀,被要求同时成为最好的小刀、螺丝刀和剪刀。
研究人员测试了当今五种最聪明、最先进的 TTS 系统。他们要求人类听众在五个不同的“角色”中对它们进行评分:
- 朗读者: 大声朗读书籍。
- 助手: 扮演一个乐于助人的 AI(如 Siri 或 Alexa)。
- 演员: 演绎一段戏剧性的场景。
- 角色: 扮演一个动画卡通角色。
- 自发演讲者: 进行一次随意的、非剧本式的闲聊。
结果: 没有一个系统能在所有领域都胜出。
- 有些系统擅长朗读书籍,但在尝试进行随意的闲聊时,听起来却显得机械且乏味。
- 其他系统在听起来像是一个真实的人在进行混乱、自发的对话时表现出色,但对于一个乐于助人的助手来说,它们听起来又显得过于粗糙且缺乏润色。
类比: 这就像试图穿着燕尾服去参加一场泥泞的足球赛。燕尾服是“高质量”且“正式”的,但它是错误的工具。同样,针对正式朗读而优化的 TTS 系统,在面对随意的对话时可能会表现得很糟糕。
2. “类人化”陷阱
研究发现了一个令人惊讶的转折:仅仅因为一个声音听起来像人,并不意味着它是适合这项工作的声音。
- “机器人式”助手: 当人们听 AI 助手说话时,他们实际上更喜欢听起来稍微没那么像人、更稳定的声音。他们不想要一个爱聊天、有情绪的朋友;他们想要一个可靠的工具。
- “太真实”的角色: 在听动画角色说话时,如果一个声音听起来过于像一个真实、不完美的普通人(带有停顿、呼吸声和结巴),会让听众感到不对劲。听众希望角色听起来是风格化的,而不是像一个措手不及的真人。
启示: “自然度”是一个微妙的指标。有时,听起来“没那么像人”反而是特定任务中最“合适”的选择。
3. “缺陷”悖论
研究人员观察了实际的声波,以了解是什么让一种声音感觉对了。他们发现,不同的角色需要不同类型的“瑕疵”。
- 对于随意的闲聊: 听众实际上会喜欢听到像“嗯”、“啊”这样的小瑕疵,以及轻微的声音颤动。这些让 AI 听起来像是一个正在即兴思考的真人。
- 对于朗读或助手: 同样的瑕疵会让声音听起来不专业或出现了故障。
类比: 想想一位即兴演奏的爵士乐手。一些错音或混乱的节奏可能会让表演感觉更有“生命力”和“自发性”。但如果新闻主播在播报晚间新闻时犯了同样的错误,那将是一场灾难。只有在错误的语境下,“错误”才是坏事。
4. 破碎的尺子
最后,论文指出我们衡量 TTS 质量的工具通常是失效的。
大多数自动评分系统(开发者用来检查工作的“尺子”)都是为了奖励“干净”和“完美”的音频而设计的。
- 问题在于: 这些尺子会惩罚那些让声音在闲聊或戏剧性场景中变得出色的元素(如停顿、情感和变化)。
- 结果: 一个 TTS 系统可能会因为听起来很“干净”而获得计算机的高分,但人类听众可能会因为它听起来乏味或不符合情境而讨厌它。
总结
这篇论文的核心信息是:我们不应该再问“这听起来像不像人?”,而应该问“这听起来是否适合这项工作?”
不存在单一的“最佳”声音。正如你不会穿着泳装去参加商务会议,也不会穿着西装去海滩一样,你不应该把用于视频游戏角色的 TTS 设置用在导航应用上。为了创造更好的 AI 声音,我们需要根据它们所扮演的具体角色来评估它们,而不仅仅是看它们在真空状态下听起来有多“像人”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。