ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval
本文介绍了 ReasonAudio,这是首个旨在评估文本 - 音频检索模型在否定和时长等复杂推理任务上表现的基准,揭示了尽管当前最先进的模型和多模态大语言模型在基础语义匹配方面表现娴熟,但在应对这些挑战时仍存在显著困难。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在一个庞大的音效图书馆中寻找一首特定的歌曲,但你不能只是哼唱旋律,而必须向图书管理员提供一套非常具体的逻辑指令。
本文介绍了一种名为ReasonAudio的新“测试”,旨在评估计算机在搜索声音时遵循这些棘手指令的能力。
问题:计算机不擅长“逻辑”
目前,计算机擅长根据整体氛围将声音与词语进行匹配。如果你要求“一只狗在叫”,计算机通常能找到一段带有狗叫声的片段。
但现实生活更加混乱。想象一下,你要求:
- “一只狗在叫,但不是猫在叫。”(否定)
- “先是门砰地关上,然后汽车鸣笛。”(顺序)
- “警笛声和火警警报在同一时刻发生。”(重叠)
- “一段恰好持续 5 秒的鼓点。”(时长)
作者发现,当前的计算机在这些“逻辑谜题”上表现极差。它们会被“但不是”、“然后”以及“持续多久”搞糊涂。它们倾向于抓取任何听起来像这些词语的内容,而忽略了规则。
解决方案:为计算机设计的新“考试”
为了证明这一点,研究团队构建了ReasonAudio,这是一套庞大的模拟试卷。
- 图书馆:他们通过将简单声音(如铃声、汽车声或鸟叫声)按特定模式混合,创建了 10,000 个自定义音效片段。
- 题目:他们编写了 1,000 道题目,要求计算机运用逻辑而非仅仅依靠记忆来作答。
- 规则:答案 100% 正确,因为它们是由计算机程序生成的,因此评分中不存在人为错误。
结果:所有人都不及格
研究人员让 10 台最智能、最先进的音频搜索计算机参加了这次考试。结果令人震惊:
- “两步走”的学生:有些计算机试图先“听”声音,写下描述,然后再搜索该描述。这是最差的方法。这就像试图通过先让朋友描述情节,再根据描述找书来寻找一本书。朋友的描述往往过于冗长或偏离重点,导致计算机迷失方向。
- “直接”的学生:其他计算机试图直接理解声音和文本。它们的表现稍好一些,但得分仍然很低(准确率约为 8%)。
- “优等生”(多模态大语言模型,MLLMs):最先进的模型(基于庞大的 AI 大脑)表现最好,但它们仍然只答对了约**20%**的题目。这仅仅比随机猜测好一点点。
最大的惊喜:尽管这些“优等生”因在文本阅读或图片识别中擅长逻辑而闻名,但它们在听声音时却忘记了如何使用这种逻辑。当它们被微调用于搜索声音时,似乎失去了理解“不”、“之前”或“持续多久”的能力。
它们为何失败?
作者深入分析了这些计算机的“大脑”,发现了两个主要问题:
- 它们忽略规则:当计算机看到“狗”这个词时,它会抓取所有带有狗的片段,即使指令中说了“不要狗”。这就像一位图书管理员听到“狗”这个词,却忽略了你请求中“不要猫”的部分。
- 它们杂乱无章:当计算机尝试将文本问题与声音匹配时,它并没有将它们整齐地组织起来。在计算机的“脑海”中,“错误”的答案有时看起来比“正确”的答案更接近问题。
结论
这篇论文并非声称我们还无法搜索音频。它只是指出,如果你希望计算机根据复杂的逻辑规则(例如“雨声,但前提是没有雷声,且必须很短”)来查找声音,当前的技术尚未准备好。计算机目前只是在将词语与声音进行“匹配”,但它们并没有真正对其进行“推理”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。