← 最新论文
🤖 machine learning

Investigating Modality Contribution in Audio LLMs for Music

本文通过调整 MM-SHAP 框架来研究音频大语言模型在音乐任务中的模态贡献,揭示出尽管性能更优的模型严重依赖文本推理,但它们仍能有效利用音频来定位关键声音事件。

原作者: Giovana Morais, Magdalena Fuentes

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Giovana Morais, Magdalena Fuentes

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位热爱音乐的超级智能机器人朋友。你可以与它交谈,它也能聆听歌曲。你可能会问:“这首歌开头有什么奇特的声音?”它应当聆听音频并告诉你:“是门铃声!”

但这里有个谜团:这个机器人真的在“听”吗,还是仅仅根据你写下的文字在猜测?

本文正是研究这一问题的。研究人员想知道,这些“音频大语言模型”(Audio LLMs)是否真的在运用它们的“耳朵”,还是仅仅依靠它们的“大脑”(文本处理能力)来推断答案。

侦探工具:MM-SHAP

为了揭开这个谜团,研究人员使用了一种名为MM-SHAP的特殊侦探工具。可以将这个工具想象成机器人感官的“音量旋钮”。

  • 工作原理:该工具接收一个问题与一首歌曲,然后玩一场“捉迷藏”游戏。它会随机静音(遮蔽)部分文本和部分音频。
  • 目标:它观察当某段音频被静音时机器人的答案变化程度,与当某段文本被静音时的变化程度进行对比。
  • 结果:它会给出一个分数,显示机器人在做出最终决策时,多大程度上依赖音频,多大程度上依赖文本

实验:两个机器人,一次测试

研究人员使用名为MuChoMusic的测验,对两款不同的音乐机器人(分别命名为Qwen-AudioMU-LLaMA)进行了测试。该测验包含关于歌曲的选择题,例如“正在演奏的是什么乐器?”或“听到了什么音效?”。

以下是他们的发现:

  1. “聪明”的机器人(Qwen-Audio):这款机器人答对了最多的题目。然而,侦探工具揭示了一个令人惊讶的事实:它几乎没听音乐! 它严重依赖问题的文本来猜测答案。这就像一个没有读书却猜对了答案的学生,因为它熟悉考试格式。
  2. “均衡”的机器人(MU-LLaMA):这款机器人答对的题目较少,但它实际上更均衡地使用了音频和文本。这就像一个既读书又听老师讲解的学生,即使它仍然答错了一些题目。

核心结论:“准确”(答对题目)并不意味着机器人使用了音频。事实上,使用音频最少的机器人反而答对了最多的题目。这表明,对于这些特定的选择题,机器人擅长运用逻辑和文本线索,但它们未必以我们期望的方式在“聆听”。

它们完全忽略了音频吗?

并非完全如此。研究人员深入挖掘,观察了歌曲中的特定时刻

  • “铃声”示例:在一个关于“铃声”的问题中,当音频中实际出现铃声时,机器人的内部逻辑确实被激活了。
  • 关键问题:尽管机器人注意到了铃声,但它似乎并不需要该信息就能得出正确答案。它仅通过阅读选项就能猜对。

这就像一名侦探在犯罪现场看到了指纹,但依然破案了,因为他早已知道嫌疑人的名字。指纹(音频)确实存在并被注意到了,但它并非破案的主要原因。

这为何重要?

该论文得出结论:这些模型目前“文本过重”。它们擅长用文字进行推理,但尚未完全学会通过“聆听”音乐来解决问题。

研究人员还指出,这些测试的设计方式(选择题)对机器人来说可能过于简单。它们往往仅通过阅读文本就能排除错误答案,而根本不需要听到音乐。

简而言之:这些音乐机器人非常擅长交谈和思考,但它们仍在学会如何真正“聆听”。本文开发的工具帮助我们看清,它们究竟在多大程度上使用了“耳朵”而非“大脑”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →