MusPyExpress: Extending MusPy with Enhanced Expression Text Support
MusPyExpress 是 MusPy 库的一个扩展,它通过实现从 MusicXML 数据集中提取并利用表达文本(如速度和力度),弥补了符号音乐建模方面的空白,从而促进了诸如音符-表达联合生成以及表达条件下的音乐合成等新的生成任务。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
音乐存在于两个截然不同的世界中。一个是我们在听到的声音,是充盈在房间里的流动的声波。另一个是音乐家用来创作这种声音的说明书,即被称为乐谱的静态符号页面。几十年来,计算机非常擅长读取第一个世界,将音频转化为数据,但在第二个世界却一直步履维艰。当研究人员想要教会计算机理解或创作音乐时,他们依赖于一种叫做 MIDI 的数字格式。这种格式非常擅长告诉计算机该演奏哪些音符以及何时演奏,就像是给机器人钢琴家提供的一份精确指令清单。然而,这份清单缺失了一个至关重要的层次——人类的细微差别。它告诉机器音符是什么,却忽略了那些告诉人类表演者如何去感受这些音符的情感指令。
在西方乐谱中,作曲家会在音符之间的空白处填入引导表演的词汇和符号。这些不仅仅是建议,而是关于速度、音量和风格的具体指令。作曲家可能会写下“adagio”(柔板)来告诉演奏者放慢速度,或者写下“crescendo”(渐强)来表示音量逐渐增加。他们可能会标注一段音乐应该以尖锐、断续的方式演奏,或是以平滑、连贯的流向进行。这些被称为“表现性文本”(expression text)的指令,是让一段音符序列转化为有生命、有呼吸的艺术品的路线图。直到现在,用于教授计算机音乐知识的标准工具在很大程度上都忽略了这张路线图,仅将音符视为唯一重要的事物。这一差距意味着,虽然计算机可以生成旋律,但它们无法轻易生成让音乐具有人性感的氛围、张力或动态形态。
一支研究团队通过开发一个名为 MusPyExpress 的新工具,解决了这一局限性。该软件是现有用于处理音乐数据的库的一个升级版。这个新系统旨在读取 MusicXML 中丰富的详细指令,MusicXML 是一种用于数字乐谱的格式,其表现力远高于旧有的 MIDI 标准。通过构建这个扩展程序,研究人员使计算机能够提取并理解全范围的表现性文本,从改变音乐速度的节奏标记到控制音符强弱的动态符号。他们并未将这些指令仅仅视为注释,而是将其视为可以存储、分析并用于教导机器如何带有情感地作曲的核心数据点。
为了证明这个新工具能够处理现实世界音乐的复杂性,研究人员转向了一个包含超过 22 万个文件的公共领域乐谱海量集合。他们使用 MusPyExpress 扫描了这个库,发现这些歌曲中的绝大多数(超过 95%)都包含这些表现性指令。总计,该软件在整个集合中识别出了超过 350 万个独立的标记。分析显示,这些指令并非随机分布;它们遵循着反映音乐历史的模式。例如,研究人员发现,生活在 1 世纪的浪漫主义时期作曲家比早期的巴洛克或古典时期作曲家更频繁地使用这些表现性标记。这符合历史实践,因为浪漫主义作曲家通常会编写具体的情感方向来引导表演者,而早期的作曲家则更多地依赖于当时的表演惯例。
研究还展示了这些指令在乐曲中的密度是如何变化的。结构性标记(如划分乐曲段落的复句字母)出现频率较低且间距较大。相比之下,关于节奏和音量的指令则可能非常密集,通过频繁出现来塑造旋律的即时流动。研究人员甚至观察到,某些作曲家(如李斯特和德彪西)在他们的总谱中填充了大量细节,而其他作曲家则使用得较为节制。这种对表现性文本的详细映射,首次清晰地展示了隐藏在标准数字乐谱中的情感数据究竟有多少,而这些数据此前对于大多数计算机模型来说是无法获取的。
凭借这种阅读和理解表现性文本的新能力,研究人员展示了计算机使用这些信息的三个不同方式。首先,他们展示了一个模型可以同时学习生成音符和表现性指令,模拟人类作曲家编写总谱的过程。其次,他们训练了一个系统,根据特定的情感指令来创作音乐,允许用户提供如“慢、强、然后弱”之类的词语序列,并让计算机生成符合该情绪的旋律。这对于为电影或电子游戏创作背景音乐非常有用,因为声音需要与特定的叙事弧线相匹配。第三,他们测试了一个系统,该系统可以接收一段纯粹的、缺乏情感的音符序列,并自动为其添加适当的表现性标记,从而有效地为原始旋律注入缺失的情感语境。
实验表明,当计算机获得这些表现性指令时,其创作真实音乐的能力得到了提升。那些学习同时生成音符和表现性文本,或利用表现性文本作为引导的模型,所产生的作品比仅关注音符的模型更符合人类的音乐模式。研究人员发现,最有效的方法是在模型生成相应的音符之前,将表现性指令输入给模型,从而让计算机能够预判音乐的情感走向。虽然这些模型并不能完美地复制人类表演的复杂性,但结果表明,包含这些文本指令能显著帮助计算机理解作品的结构与情感。
这项工作并不声称已经解决了人工智能创作完美音乐的问题,也不暗示机器现在可以取代人类作曲家。相反,它为计算机如何与乐谱交互建立了新的基础。通过解锁乐谱的表现性层面,MusPyExpress 让研究人员能够构建能够感知作品完整语境的模型。研究人员计划利用这一工具来标注现有的、目前缺乏这些情感细节的大规模音乐收藏,从而可能为庞大的数字音乐库带来更高水平的表现力。其最终目标并非取代人类的触感,而是赋予机器理解并再现那些将音符序列转化为故事的微妙指令的词汇量。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。