Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions
本文评估了 45 种客观语音质量指标在清洁条件下针对 17 种神经音频编解码器的表现,并将其与主观听感评分进行对比,发现基于神经的指标(如 ScoreQ 和 UTMOS)实现了最高的关联度,同时也指出非侵入式指标在高质量水平下往往会出现饱和现象。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图判断一首歌曲在被压缩成一个极小的文件并通过互联网发送后,听起来效果如何。在数字音频的世界里,这种“挤压”过程是由一种被称为 编解码器 (codec) 的技术完成的。你可以把编解码器想象成一位超级高效的大厨,他将一块巨大的、多汁的牛排(原始声音)切成许多微小的、一口大小的碎块,以便能装进你的口袋,然后在稍后尝试将其重新组装起来。有时,重新组装后的牛排味道极佳;而有时,它则显得干巴巴的,或者口感很奇怪。
几十年来,工程师们一直在使用两种主要的方法来检查这块牛排的味道是否好。第一种方法是 主观测试 (Subjective Test):他们邀请一群人来聆听并按 1 到 5 分进行评分。这是“金标准”,但它速度慢、成本高,且需要人类极大的耐心。第二种方法是 客观指标 (Objective Metric):一个计算机程序通过观察声波,在没有人类实际聆听的情况下尝试猜测评分。这种方法快速且廉价,但长期以来,这些计算机评委都是针对传统的音频问题进行训练的。现在,新一代的“神经”编解码器已经到来——它们利用人工智能来重建声音,几乎就像数字艺术家根据草图从零开始绘画一样。现在的大问题是,那些旧式的计算机评委是否仍然懂得如何评价这种新的 AI 艺术,或者说,它们观察的角度是否已经过时了?
本论文旨在通过组织一场大规模的“味觉测试对决”来回答这个问题。研究人员收集了 17 种不同的神经音频编解码器,它们以不同的速度和比特率运行(有些低至 1.0 kbps,有些高达 8.0 kbps),并将 100 个纯净的语音样本喂给它们。随后,他们要求一群人类使用一种被称为 MUSHRA-1S 的方法来对质量进行评分,这就像一把能够察觉高质量声音之间细微差异的超精密尺子。接着,研究人员将这些相同的声音通过了 45 种不同的计算机评分程序——其中一些需要参考原始声音进行对比(侵入式/intrusive),另一些则仅观察结果本身(非侵入式/non-intrusive)。
结果就像是一场预期中的赢家并未出现的惊喜派对。研究发现,像 PESQ 和 WARDRP 这样的传统计算机评委表现尚可但并不出色;它们与人类意见的相关性约为 0.73。然而,新的 AI 驱动指标,特别是 ScoreQ、UTMOS 和 Audiobox,成为了明显的冠军,其中 ScoreQ 的相关性达到了 0.87。这表明,要评判 AI 音频,你需要一位 AI 评委。
但故事中还有一个转折。当研究人员仔细观察那些最好的声音——即人类评价为近乎完美的那些声音时,他们注意到一个奇怪的故障。非侵入式 AI 指标(那些不需要原始声音的指标)似乎遇到了一个“天花板”。一旦声音变得非常好,这些指标就会停止改变分数,即使人类仍然能听到细微的区别。这就像是一个温度计一旦达到 100 度就停止移动,即便房间变得更热了也一样。作者认为,这是因为这些指标在训练时使用的都是人类评分,而这些评分通常只是简单的“5 分中的 5 分”,导致计算机很难区分“5 分”和“5.5 分”。
相比之下,侵入式指标(那些将结果与原始声音进行对比的指标)即使在最高质量水平下也能完美运作,展现出更小的误差范围,并对极其微小的变化保持敏感。论文得出了一个实用的经验法则:如果你正在测试平均水平或带有轻微噪声的音频,那么像 UTMOS 和 ScoreQ 这样快速的非侵入式 AI 指标将是你的好帮手。但如果你正在打磨高保真音频,并且需要捕捉最细微的瑕疵,你应该坚持使用像 ScoreQ Ref 这样的侵入式方法,它们就像一个在高精尖端不会变得模糊的放大镜。这项研究不仅找到了最好的工具,还向我们展示了每种工具失效的具体位置,帮助工程师为不同的任务选择合适的评委。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。