CultureMERT: Continual Pre-Training for Cross-Cultural Music Representation Learning
本文介绍了 CultureMERT-95M,这是一个通过一种新颖的两阶段持续预训练策略在多样化的非西方传统上进行训练的多文化适应性音乐基础模型,该模型在保持西方基准性能的同时,显著提升了跨文化自动标签分类性能,并为任务算术提供了可行的替代方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
音乐是一种通用语言,然而我们用来理解它的计算机往往只懂得一种方言。多年来,旨在聆听并分类音乐的最强大的人工智能模型,几乎完全是在西方风格(如流行乐、摇滚乐和古典交响乐)上进行训练的。这些系统在识别这些特定传统的模式方面变得极其出色,但在面对世界其他音乐文化的丰富多样性时却显得力不从心。它们错失了印度古典音乐中微妙的旋律结构、土耳其传统中独特的节奏循环,或是希腊民歌中独特的音阶。这种局限性意味着,对于数十亿音乐遗产属于西方经典之外的人民来说,这些数字工具仍然是“盲目”的,无法保存、推荐或分析那些定义了他们社区的艺术。
研究人员长期以来一直寻求一种方法,教导这些模型进行更广泛的聆听,而无需从头开始重建它们——因为那是一个成本极高且耗时的过程。挑战在于,如何让一个已经学习了一套规则的模型去理解一套完全不同的规则,同时又不让它忘记原本已掌握的知识。这正是这项引入名为 CultureMERT 系统的新研究所解决的核心问题。研究人员的目标是将一个主要在千小时西方音乐上训练过的基础模型,温和地引导其理解东地中海和印度次大陆的音乐语言,同时确保它不会丧失识别最初构建时所熟知的西方风格的能力。
为了实现这一目标,团队采用了被称为“持续预训练”的策略。他们并没有丢弃现有模型并重新开始,而是为它喂食了一种经过精心平衡的新音频数据“食谱”。这个新数据集包含了源自四种不同传统的 650 小时音乐:土耳其马卡姆(makam)、印度斯坦古典音乐、卡纳蒂克(Carnatic)古典音乐以及希腊传统音乐。然而,仅仅将这些新数据喂给模型会导致它出现“踉跄”现象,即当计算机试图学习新任务时,它在原任务上的表现会发生崩溃。为了解决这个问题,研究人员设计了一个两阶段的方法。在第一阶段,他们向模型引入了较小部分的音乐,同时保持其最复杂的内部层处于冻结状态,仅允许基础的声音处理部分进行调整。他们还在这一阶段混入了一小部分西方音乐,以提醒模型其原始的训练内容。在第二阶段,他们解锁了整个模型,并用完整的 650 小时数据集对其进行训练,从而让它能够充分整合这些新的文化细微差别。
结果令人瞩目。当测试要求模型识别非西方音乐中的乐器、情绪或特定调式等任务时,经过适配的模型表现出了显著的提升,与原始版本相比,准确率平均提高了近 5%。至关重要的是,这种增益并未以牺牲其原有知识为代价;该模型保留了识别西方音乐的能力,几乎没有性能损失。研究还探索了另一种称为“任务算术”(task arithmetic)的方法,该方法涉及将若干个针对单一文化进行训练的小型模型的“知识”在数学上组合成一个统一的系统。这种方法的表现与直接训练法在处理非西方任务时同样出色,甚至在西方基准测试中超越了后者,这表明合并专业化模型是替代一次性重新训练的一种强大的途径。
研究人员发现,模型在不同文化间转移知识的能力并非均等。例如,在南印度卡纳蒂克音乐上训练的模型,对北印度印度斯坦音乐甚至土耳其传统的表现出了很强的泛化能力,这可能是因为这些系统在旋律和节奏方面有着深层的理论根源。相比之下,该模型在向希腊传统音乐进行知识迁移时则显得较为吃力,尽管希腊音乐本身很独特,但在计算机编码声音的具体方式上,它与印度和土耳其数据集共享的结构相似性较少。通过分析模型用于表示声音的数字“标记”(tokens),团队发现这些音乐传统之间的数学距离可以预测模型的学习效果,这为未来的训练数据规划提供了一种新方法。
最终,这项工作证明了人工智能可以在不牺牲核心能力的前提下变得更加包容。研究人员已向公众发布了适配后的模型 CultureMERT,提供了一个终于能以更广阔视野聆听世界音乐的工具。他们承认,虽然该模型是一个重要的进步,但它并非完美的解决方案;将声音转换为数字标记的基础技术仍是在西方音乐上训练的,这可能会限制它对某些文化细微差别的深度理解。尽管如此,通过展示一个模型可以在记住旧语言的同时学习新语言,这项研究为实现一个数字音乐系统真正全球化的未来指明了一条清晰的路径,使其能够致敬人类音乐表达的全谱系。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。