EXAM: $Understanding$ $in$ $and$ $Analysis$
本文介绍了 EXAM,这是一个综合性的多语言、多模态基准测试,旨在评估并推进涵盖六种语言和多种音视频场景的音频理解能力,展示了当前模型存在的显著性能差距,以及新提出的微调模型在应对这些挑战方面的有效性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
声音的世界广阔而多样,充满了人类的嗓音、海浪的撞击声以及歌曲的旋律。几十年来,计算机一直难以理解这些听觉信号,往往将其视为单纯的噪声而非有意义的信息。近年来,新一代人工智能已经出现,它们能够倾听音频并回答有关所听内容的问题。这些被称为大型音频语言模型的系统,在理解语音和识别声音方面展现出了巨大的潜力。然而,在如何测试它们方面,仍然存在着显著的差距。现有的测试大多仅侧重于英语,并且仅依赖音频,忽略了一个事实:在现实世界中,声音很少在真空中发生。声音几乎总是伴随着视觉场景,而且声音的含义会根据所使用的语言和所见的语境而改变。
为了填补这一空白,研究人员引入了一种名为 EXAM2 的新型评估工具。该基准旨在测试人工智能在音频与视觉图像结合,并以多种语言进行表达时,理解音频的能力如何。该项目的团队由来自德国、中国、日本和新加坡的研究机构专家组成,他们意识到目前的测试过于狭隘。他们构建了一个综合性的数据集,其中包含数千个问题,要求计算机倾听一段音频剪辑,观察一张图像,然后从一系列选项中选择正确答案。这些问题涵盖了三种主要类型的声音:人类言语、环境噪声和音乐。至关重要的是,这些问题不仅有英语,还被翻译成了另外五种语言:德语、西班牙语、日语、马来语和中文。这使得研究人员能够观察,当语言发生变化或必须将所听到的内容与所看到的联系起来时,模型的理解能力是否依然稳健。
研究人员通过精心挑选来自各种来源的音频录音来构建这一基准,确保它们代表现实世界的场景而非合成数据。对于每一个多选题,他们都生成了一张相应的图像作为视觉线索。这一过程涉及严格的质量控制流程,由人类专家对音频、文本和生成的图像进行审核,以确保其准确且相关。最终的数据集包含了近 5,700 个问题、超过 22,000 张图像以及跨六种语言的 135,000 多个翻译实例。这个庞大的集合作为一个严苛的训练场和测试场,推动着人工智能在不同类型的信息之间进行同步推理。
当研究人员在这一新基准上测试最先进的人工智能模型时,结果揭示了它们的优势与显著的弱点。最强大的模型,特别是那些能够同时处理音频和图像的模型,表现优于仅依赖声音的模型。这表明视觉语境有助于计算机消除声音的歧义,使理解场景中的发生情况变得更加容易。然而,研究也发现,性能表现因语言而异,存在明显的差异。模型在处理西方语言(如英语、德语和西班牙语)时,通常比处理东方语言(如日语和中文)的表现要好得多。这种差距在涉及识别环境声音或音乐的任务时尤为明显,表明目前的系统仍然严重偏向高资源语言,并且在应对其他语言和文化语境的细微差别方面仍显吃力。
为了应对这些挑战,团队开发了他们自己的轻量化模型,并使用他们新的多语言和多模态数据对其进行了微调。该模型经过训练,可以处理所有六种语言以及音频和视觉输入,并显示出相对于现有基准模型的实质性提升。它在准确率上实现了显著飞跃,特别是在言语和音乐类别中,并证明了同时使用多种语言进行训练有助于模型在不同的语言环境下更好地泛化。研究结果表明,虽然人工智能正在变得更擅长倾听,但真正的理解需要具备观察世界及其语言的能力。研究人员总结道,为了使这些系统变得真正鲁棒,未来的发展必须优先考虑多样化的语言,以及视觉与听觉信息的整合,从而超越仅限于英语、仅限于音频测试的局限性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。