我们生活在一个日益充斥着具备听觉能力的机器的世界。这些被称为大型音频语言模型的系统,旨在倾听语音、音乐和环境声音,然后针对其所听内容回答问题或遵循指令。它们已经非常擅长理解句子的含义,或者识别出某种声音是狗在吠叫。然而,听觉有一个基本方面被这些机器在很大程度上忽略了:声音本身的质量。在现实世界中,音频很少是完美的。录音经常受到背景噪声、回声或网络连接不佳产生的杂音的干扰。对于人类听众来说,注意到这些缺陷是判断一段录音是清晰还是损坏的第一步。人工智能是否真的能感知这些低层级的缺陷,还是仅仅根据它听到的词汇进行猜测,仍然是一个悬而未决的问题。
为了调查这一点,来自东北大学、博世公司(Bose Corporation)和斯托尼布鲁克大学的研究人员创建了一个名为 MRMAD 的新测试基准。该基准旨在观察音频语言模型是否真的能听出清晰录音与退化录音之间的区别。该测试涵盖了三种主要的声学领域:人类语音、音乐和一般的环境噪声。它专注于九种特定的音频受损方式,例如丢包产生的静态噪声、回声产生的空洞感,或低通滤波导致的沉闷感。研究人员不仅要求模型听一次;他们设置了一个对话场景,让模型先听到一段清晰的参考片段,然后再听到一个退化的版本,并要求它识别损伤类型、比较严重程度,或将多个片段按从轻微到严重的顺序进行排序。这种多轮对话的方法迫使模型在分析第二个声音时,必须在脑海中保留第一个声音的记忆,从而模拟人类对比两段录音的过程。
这项涉及 8,400 个问题和 18 种模型的广泛评估结果显示,当前的技术与人类感知之间存在显著差距。大多数受测的开源模型表现仅略好于随机猜测。当被要求识别具体的损伤类型或对失真程度进行排序时,这些模型往往无法区分清晰的声音与损坏的声音。即使是包括一些来自大型科技公司的先进模型,也在这项任务中表现挣扎。虽然谷歌的一款特定闭源模型表现出色,在各项指标上都取得了高准确率,但许多其他强大的系统却表现不佳。这表明,仅仅扩大模型规模或增强其推理能力,并不会自动赋予其感知音频质量的能力。研究发现,许多模型过度依赖语义内容——即词汇或旋律——而非声音的声学纹理。
研究人员进行了更深入的研究,以了解这些模型失败的原因。他们发现,这些模型通常并不使用对话第一轮中提供的清晰参考音频。在许多情况下,移除清晰的参考音频或将其替换为静态噪声,并不会显著改变模型的性能,这表明模型完全忽略了对比过程。此外,这些模型内部对音频的表征似乎抹平了检测损伤所需的细节。代表声音的数字标记(tokens)在清晰片段与退化片段之间往往如此相似,以至于模型无法分辨它们。这表明问题不仅在于推理步骤,还在于模型在开始“思考”之前,是如何对声音进行初步处理和保留的。
这项工作凸显了音频智能发展中一个关键的缺失环节。虽然机器已经精通于理解正在被说出或播放的内容,但它们尚未掌握判断这些内容被表达或播放得如何好坏的能力。该基准测试表明,目前的系统尚不足以应对现实世界中混乱、不完美的音频条件。在这些模型能够可靠地检测并推理关于声学退化的现象之前,它们对听觉世界的理解仍将是不完整的。研究结论认为,构建未来真正鲁棒的系统,需要音频处理方式发生根本性的转变,即从高层级的意义理解转向对音频质量更深层、更敏感的感知。
技术摘要:用于音频退化感知的 MRMAD 基准测试
问题陈述
尽管大型音频语言模型(LALMs)和全模态语言模型(OLMs)在语音、音乐和通用声音的语义理解、事件识别及高层推理方面取得了显著进展,但它们对低层音频质量的感知与推理能力仍未得到充分探索。现实世界的音频经常受到背景噪声、混响、编解码压缩和丢包等因素的影响。目前的基准测试主要评估内容理解或指令遵循,却未能解决一个根本问题:LALMs 是否理解音频质量之间的差异? 现有的评估往往缺乏多轮、多音频的结构,而这种结构对于测试模型对比退化信号与干净参考信号,或在多个输入中对严重程度进行排序的能力至关重要。
方法论:MRMAD 基准测试
为了填补这一空白,作者引入了 MRMAD(多轮多音频退化),这是一个旨在评估 LALMs 音频退化感知和质量理解能力的基准测试。
基准测试设计
MRMAD 涵盖三个音频领域(语音、音乐、声音)和九种常见的退化类型(环境噪声、低通/高通/带通滤波、MP3 压缩、混响、回声、神经声码器伪影、DSP 去噪伪影以及丢包)。该基准测试围绕三个特定任务构建:
- 退化类型识别 (DTI): 模型聆听一段干净的参考片段和一段退化的片段,然后识别所应用的特定退化类型。
- 退化严重程度比较 (DSC): 模型比较两个具有相同退化类型但不同严重程度级别的退化片段,以确定哪一个更严重。
- 退化严重程度排序 (DSR): 模型将三个相同类型的退化片段按从轻微到严重的顺序进行排序。
数据构建
- 源数据: 该基准测试利用高质量的源数据集(如 VCTK、LibriSpeech、MUSDB18-HQ、FSD50K),以确保退化过程在感知上是可区分的。
- 退化模拟: 干净音频经过归一化处理,然后使用特定领域的参数在三个严重程度级别(可听、中等、强)下进行退化。
- 格式: 该基准测试采用多轮对话格式。每一轮呈现一个音频片段和一个文本提示,通过对话上下文进行比较,而不是将多个片段拼接成单个输入,因为后者会引入时间定位的混淆。
- 规模: 最终数据集包含 8,400 个多项选择题(在 DTI、DSC 和 DSR 之间按 3:3:1 的比例分配)。
评估协议
作者评估了 18 个代表性模型,包括:
- LALMs:(例如 SALMONN、Qwen2-Audio、Audio Flamingo 3)。
- 大型音频推理模型 (LARMs):(例如 Step-Audio-R1、Qwen3-Omni-Thinking)。
- 全模态语言模型 (OLMs):(例如 Qwen2.5-Omni、Gemini 3 系列)。
- 闭源模型: 包括 GPT-Audio-1.5 及各种 Gemini 3 变体。
评估遵循基于输出的多项选择协议,即模型在接收多轮音频输入后必须选择正确选项(A、B、C 或 D)。
关键结果
系统性评估揭示了当前模型在具备退化感知能力的听觉感知方面存在实质性局限:
- 通用性能差距: 大多数开源模型的表现仅略高于随机猜测。在 DTI 和 DSR 任务上,许多模型的表现接近 25% 的基准线;而在 DSC(二选一)任务上,它们仍维持在 50% 左右。这表明尽管在通用音频理解方面取得了进展,但模型仍无法捕捉低层退化线索。
- 闭源模型的优越性: 闭源模型,特别是 Gemini 3 系列,表现显著领先。Gemini 3.1 Pro 在所有任务中均取得了最佳结果(DTI 为 86.22%,DSC 为 90.81%,DSR 为 64.25%)。然而,即使是像 GPT-Audio-1.5 这样强大的闭源模型,在特定任务(如 DSC)上也表现不佳,这表明仅靠部署规模并不能保证鲁棒的退化感知。
- 推理与非推理模型: 引入显式推理机制(例如“Thinking”变体)的结果褒贬不一。虽然 Qwen3-Omni-Thinking 优于其非推理版本,但其他推理模型(如 Audio Flamingo Next-Think)的表现却逊于其基础版本。这表明推理本身无法补偿精细化声学表示的缺失。
- 退化敏感度: 性能因退化类型而异。模型通常在具有显著时间特征的伪影(如丢包、低通滤波)上表现较好,但在处理微妙的光谱失真(如 MP3 压缩、混响)时表现挣扎。
诊断分析
作者进行了诊断分析以识别失效模式:
- 对参考音频的利用不足: 用高斯噪声替换干净的参考音频或完全移除参考音频,对许多模型而言几乎没有造成性能下降。这表明模型往往依赖退化片段本身或语言先验,而非进行显式的“参考-退化”对比。
- 多轮上下文限制: 在某些情况下,移除第一轮(干净参考)反而提高了或维持了性能,这表明当前模型难以在多轮对话中保留并比较音频证据,且多轮上下文可能会引入记忆负担或对齐问题。
- 表示瓶颈: 对投影音频序列的 Token 级分析显示,某些模型(如 SALMONN)在干净音频和退化音频的 Token 之间保持了高度相似性,这表明其音频编码器对低层质量退化具有不变性。这种在到达语言模型之前就削弱了退化线索的现象,限制了可用于推理的证据。
意义与主张
论文声称 MRMAD 为构建能够应对现实世界声学条件的未来 LALM 提供了诊断基础。其主要贡献包括:
- 首个统一基准: 它是第一个明确针对 LALM 音频质量感知与理解的统一基准,补充了现有的侧重于语义理解的评估。
- 揭示了关键差距: 它强调了当前的模型,即使是先进的推理模型和全模态模型,也缺乏可靠的精细感知和比较能力。
- 识别了失效模式: 研究表明,音频退化理解不能仅仅简化为高层推理;它需要对退化敏感的音频表示以及有效的跨轮次对齐(cross-turn grounding)。
作者总结道,虽然 MRMAD 识别了这些局限性,但它并未提出新的训练方法或架构解决方案,将开发能够实现鲁棒退化感知的模型留作未来的研究方向。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。