Genre Classification of Saint Yared Qum Zema Using a Convolutional Neural Network
本研究提出了一种定制的卷积神经网络模型,通过将1,555个音频片段转换为频谱图图像,在对圣雅烈德(Saint Yared)埃塞俄比亚圣咏(Qum Zema)的三种流派进行分类时实现了88%的测试准确率,其表现优于ResNet、VGGNet和AlexNet等既有架构。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
音乐向来不仅仅是声音;几个世纪以来,它一直是历史、信仰与身份的载体。在现代科学领域,研究人员已经开发出让计算机学会“倾听”的方法,这一领域被称为音乐信息检索(Music Information Retrieval)。这一学科要求机器完成人类耳朵自然而然就能做到的事情:识别模式、辨别乐器,并将歌曲分类为爵士、摇滚或古典等类别。虽然计算机在分析西方音乐的海量库方面已经做得相当出色,但它们在面对仅依赖人声的独特传统形式时却往往显得力不从心。这些古老的传统没有书面的乐谱或乐器,纯粹通过代代相传,呈现出了一种特殊的挑战。它们的音色微妙,变化细微,且保护工作迫在眉睫,因为能够教授这些传统的人数正在不断减少。
在埃塞俄比亚,埃塞俄比亚正教教会(Ethiopian Orthodox Tewahedo Church)守护着一种被称为“泽玛”(Zema)的神圣音乐传统。这是一种由圣雅雷德(Saint Yared)——一位被尊为当时音乐首席教授的学者——在六世纪创作的精神赞美诗。圣雅雷德将这些赞美诗分为三种截然不同的风格:格兹(Geez)、埃齐尔(Ezil)和阿拉拉伊(Araray)。当这些赞美诗在没有任何乐器伴奏、仅使用人声演唱时,被称为“库姆·泽玛”(Qum Zema)。几个世纪以来,区分这三种风格的知识一直存在于教会学校少数专业学者的大脑中。然而,随着这些专家的减少以及公众难以分辨这些风格,这种微妙的艺术面临着被遗忘或被误解的风险。研究人员面临的问题是,现代技术是否能像资深学者那样清晰地听出这些差异。
来自德布雷马科斯大学(Debre Markos University)的一个研究小组致力于回答这个问题,他们构建了一个专门用于识别圣雅雷德“库姆·泽玛”三种流派的计算机模型。他们并没有尝试通过手动列出音乐规则(如特定的音符或节奏)来教导计算机,而是使用了一种被称为卷积神经网络(convolutional neural network)的人工智能,这是一种旨在通过观察图像进行学习的系统。为了实现这一点,研究人员首先必须将声音转化为计算机可以“看到”的东西。他们将赞美诗的录音分解成短小的十秒钟片段。随后,每一个片段都被转化为一张谱图(spectrogram),这是一种展示声音的音高和音量随时间变化的视觉图谱。在这张图中,水平轴代表时间,垂直轴代表音高,而颜色的亮度则显示了声音在任何给定时刻的响度。
研究人员从传统教会学校的学者那里收集了总计 1,555 个此类十秒钟的音频片段。他们通过去除背景噪音确保了录音的纯净,并将每一个片段都转换成了谱图图像。这组图像成为了他们新模型的训练数据,他们将该模型命名为“圣雅雷德库姆·泽玛分类器”(Saint Yared's Qum Zema Classifier)。系统被输入了这些图像,并被要求学习与格兹、埃齐尔和阿拉拉伊风格相对应的视觉模式。为了测试系统是否真正学会了知识,研究人员将数据进行了拆分,使用 70% 的图像来训练模型,并保留剩余的 30% 用以测试其在从未见过的音乐上的表现。
结果表明,计算机确实能够学会区分这些古老的声乐风格。当模型在未见的音频片段上进行测试时,其正确识别流派的准确率达到了 88%。考虑到这三种风格非常相似,且在演唱时没有任何器乐辅助来引导听者,这一成就具有重大意义。研究人员将他们定制的模型与几种著名的图像识别计算机系统(如 ResNet、VGGNet 和 AlexNet)进行了对比。虽然那些系统规模更大且需要更多的计算能力,但在处理这项特定任务时表现并不理想。定制模型在实现更高准确率的同时,其运行速度更快,体积也更小。
研究还探讨了计算机模型内部的不同设置如何影响其学习能力。他们发现,一种被称为 ReLU 激活函数(ReLU activation function)的信息处理方式,比其他方法能更有效地帮助模型学习模式。整个过程建立在一个理念之上:通过将声音转化为图像,计算机可以找到每种音乐风格独特的“指纹”,而无需人类解释其规则。研究人员指出,模型的性能受限于数据集仅包含高度相似的人声,这使得任务本身具有内在的难度,但 88% 的成功率证明了深度学习可以成为保护无形文化瑰宝的强大工具。
这项工作为保护和教授圣雅雷德的音乐遗产提供了一条切实可行的路径。通过创建一个能够自动分类这些赞美诗的工具,研究人员提供了一种支持新学者教育的方法,确保格兹、埃齐尔和阿拉拉伊之间的区别不会随时间流逝而消失。研究表明,尽管这项任务非常复杂,但传统知识与现代机器学习的结合可以架起连接过去与未来的桥梁。研究人员计划通过收集更多数据并探索使系统更加精确的方法来继续这项工作,但初步的成功已经证明,计算机可以学会以一种全新的理解力去聆听埃塞俄比亚的神圣歌曲。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。