← 最新论文
⚡ electrical engineering

MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

本文介绍了 MRMAD,这是一个全新的多轮、多音频基准测试,旨在评估大型音频语言模型对语音、音乐和声音中声学退化进行感知、诊断和推理的能力,并揭示了当前模型尽管具备语义理解能力,但在可靠的退化分析方面仍存在困难。

原作者: Yize Li, Ningyuan Yang, Sile Yin, Sindhuja Thogarrati, Sung-En Chang, Andrew C. Singer, Xue Lin, Chuan-Che Huang, Shuo Zhang

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yize Li, Ningyuan Yang, Sile Yin, Sindhuja Thogarrati, Sung-En Chang, Andrew C. Singer, Xue Lin, Chuan-Che Huang, Shuo Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

我们生活在一个日益充斥着具备听觉能力的机器的世界。这些被称为大型音频语言模型的系统,旨在倾听语音、音乐和环境声音,然后针对其所听内容回答问题或遵循指令。它们已经非常擅长理解句子的含义,或者识别出某种声音是狗在吠叫。然而,听觉有一个基本方面被这些机器在很大程度上忽略了:声音本身的质量。在现实世界中,音频很少是完美的。录音经常受到背景噪声、回声或网络连接不佳产生的杂音的干扰。对于人类听众来说,注意到这些缺陷是判断一段录音是清晰还是损坏的第一步。人工智能是否真的能感知这些低层级的缺陷,还是仅仅根据它听到的词汇进行猜测,仍然是一个悬而未决的问题。

为了调查这一点,来自东北大学、博世公司(Bose Corporation)和斯托尼布鲁克大学的研究人员创建了一个名为 MRMAD 的新测试基准。该基准旨在观察音频语言模型是否真的能听出清晰录音与退化录音之间的区别。该测试涵盖了三种主要的声学领域:人类语音、音乐和一般的环境噪声。它专注于九种特定的音频受损方式,例如丢包产生的静态噪声、回声产生的空洞感,或低通滤波导致的沉闷感。研究人员不仅要求模型听一次;他们设置了一个对话场景,让模型先听到一段清晰的参考片段,然后再听到一个退化的版本,并要求它识别损伤类型、比较严重程度,或将多个片段按从轻微到严重的顺序进行排序。这种多轮对话的方法迫使模型在分析第二个声音时,必须在脑海中保留第一个声音的记忆,从而模拟人类对比两段录音的过程。

这项涉及 8,400 个问题和 18 种模型的广泛评估结果显示,当前的技术与人类感知之间存在显著差距。大多数受测的开源模型表现仅略好于随机猜测。当被要求识别具体的损伤类型或对失真程度进行排序时,这些模型往往无法区分清晰的声音与损坏的声音。即使是包括一些来自大型科技公司的先进模型,也在这项任务中表现挣扎。虽然谷歌的一款特定闭源模型表现出色,在各项指标上都取得了高准确率,但许多其他强大的系统却表现不佳。这表明,仅仅扩大模型规模或增强其推理能力,并不会自动赋予其感知音频质量的能力。研究发现,许多模型过度依赖语义内容——即词汇或旋律——而非声音的声学纹理。

研究人员进行了更深入的研究,以了解这些模型失败的原因。他们发现,这些模型通常并不使用对话第一轮中提供的清晰参考音频。在许多情况下,移除清晰的参考音频或将其替换为静态噪声,并不会显著改变模型的性能,这表明模型完全忽略了对比过程。此外,这些模型内部对音频的表征似乎抹平了检测损伤所需的细节。代表声音的数字标记(tokens)在清晰片段与退化片段之间往往如此相似,以至于模型无法分辨它们。这表明问题不仅在于推理步骤,还在于模型在开始“思考”之前,是如何对声音进行初步处理和保留的。

这项工作凸显了音频智能发展中一个关键的缺失环节。虽然机器已经精通于理解正在被说出或播放的内容,但它们尚未掌握判断这些内容被表达或播放得如何好坏的能力。该基准测试表明,目前的系统尚不足以应对现实世界中混乱、不完美的音频条件。在这些模型能够可靠地检测并推理关于声学退化的现象之前,它们对听觉世界的理解仍将是不完整的。研究结论认为,构建未来真正鲁棒的系统,需要音频处理方式发生根本性的转变,即从高层级的意义理解转向对音频质量更深层、更敏感的感知。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →