MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models
本文介绍了 MIDI-LLM,这是一个两阶段训练框架,旨在使大语言模型能够生成高质量、文本控制的多轨 MIDI 音乐和谱表,通过广泛的消融实验和大规模真实世界的盲测,证明了其相对于现有基准模型的卓越性能和用户认可度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你可以通过与计算机对话,让它为你创作一首歌曲。在人工智能领域,这被称为“文本转音乐”(text-to-music)。有一段时间,实现这一目标的最佳方式是让计算机生成原始声波,就像一段数字录音。但问题在于:一旦这种声音被制造出来,它就像画布上的画作。你无法轻易擦掉其中一笔,或者在不破坏整个画面结构的情况下只改变鼓点的节奏。音乐家需要更具灵活性的东西,一种可以进行逐个音符编辑的东西。这就是“MIDI”发挥作用的地方。不要把 MIDI 仅仅看作声音,而要把它看作数字乐谱,或者是一套指令,告诉虚拟钢琴该按下哪些键、按下的力度有多大以及持续多久。这就像是成品录音与乐高积木之间的区别:你可以把乐高拆开并重新构建。
现在,想象一下将超级智能的语言模型(那些会写论文和回答问题的 AI)进行升级,教会它们这种音乐语言。这就是这项新研究背后的核心理念。科学家们想看看他们是否可以将一个文本专家转化为音乐专家,从而让人们可以通过输入诸如“一首带有快速鼓点的忧伤爵士乐”之类的文字,获得一份完美的、可编辑的乐谱。他们不仅仅是想制造出悦耳的噪音;他们想打造一个工具,帮助人类创作者以一种自然且可控的方式与 AI 进行头脑风暴和协作。
论文:MIDI-LLM
这项论文背后的研究人员——来自麻省理工学院(MIT)、Hooktheory 和卡内基梅隆大学的一个团队——调制出了一套新配方,叫做 MIDI-LLM。你可以把它看作是一种升级标准大语言模型(LLM,即那些会写故事和解数学题的 AI)的方法,使其也能创作音乐。
通常,这些 AI 模型就像是只懂用文字烹饪的厨师。它们理解“苹果”和“派”,但不知道“升C音”听起来是什么样,也不知道如何将其写下来。团队的第一步是给 AI 一套新的词汇。他们扩展了模型的字典,加入了特殊的“MIDI 标记”(tokens)。模型不再需要将一个音符写成一段长句子,比如“从 10 秒开始,持续 0.5 秒,播放高音 C”,而是将其视为一个单一且紧凑的符号,就像一个秘密代码。这就像是教一位厨师阅读一种新语言,其中一个单词就代表“加盐”,这使得烹饪过程更加快速高效。
但仅仅给模型一个新字典是不够的;它还需要学习如何使用它。团队通过两个截然不同的阶段对 AI 进行了训练,就像音乐系学生先学习乐理,然后再加入乐队一样。
第一阶段:独奏练习(单模态预训练)
首先,他们让 AI 进行自主练习。他们向其输入了两类数据:
- 与音乐相关的文本: 关于音乐理论的文章、问题和答案(例如“什么是小调和弦?”)。
- 独立的 MIDI 文件: 数千份没有任何文本描述的原始乐谱。
这个阶段旨在教 AI 音乐的“语法”。它学习了音符如何组合在一起、节奏是如何运作的,以及歌曲的结构,而无需人类告诉它该怎么做。这就像音乐家在安静的房间里练习音阶和阅读乐谱。
第二阶段:二重奏(多模态监督微调)
接下来,他们为 AI 配对了一个搭档。他们向其输入“文本+音乐”的配对数据:一个类似于“一首欢快的流行歌曲”的提示词,紧接着就是对应的 MIDI 乐谱。这教会了 AI 将人类的想法转化为音乐指令。如果你说“爵士乐”,它就会学会编写爵士乐的音符。如果你说“忧伤”,它就会学会编写缓慢的小调和弦。这是 AI 学习倾听你的需求并真正演奏出你所要求的音乐的时刻。
他们的发现
结果非常令人印象深刻。当他们将新的 MIDI-LLM 与最近的一个竞争对手 Text2midi 进行对比测试时,他们的模型在两个主要方面脱颖而出:
- 更好的质量: 它生成的音乐听起来更真实,也更符合音乐规则。
- 更好的控制力: 它能更紧密地遵循文本指令。如果你要求特定的情绪或流派,它确实能够实现。
- 速度: 由于采用了标准的 AI 架构(基于 L-Llama 3.2),他们可以使用现有的、超快速的计算机工具来运行该模型。尽管他们的模型体积稍大,但速度比竞争对手快了 7 到 13 倍。
他们还测试了一个名为“补全”(infilling)的特殊功能。想象一下你有一首完成了一半的歌,你想让 AI 写出中间的部分。团队发现 AI 在这方面表现出色,但存在一个微妙的平衡点。如果 AI 太过于关注你输入的文本,它可能会忽略你已经写好的音乐;如果它太专注于现有的音乐,它可能会忽略你的新文本指令。为了解决这个问题,他们引入了一个“旋钮”(称为无分类器指导,Classifier-Free Guidance),允许用户调整 AI 应该在多大程度上听从文本指令,以及在多大程度上遵循现有音乐。
现实世界测试:“实战”研究
为了观察这是否真的对现实中的人有所帮助,团队不仅进行了计算机测试,还走进了现实世界。他们与 Hookpad(一个音乐人创作音乐的网站)合作,让 58 名真实的活跃用户尝试使用他们的新 AI 副驾驶(co-pilot)。
用户被要求从零开始创作歌曲,或者填补现有歌曲中的缺失部分。他们可以选择三种不同的 AI 模型:
- 旧模型(仅观察音乐,忽略文本)。
- 一个忽略文本的新版本模型。
- 完整的全新 MIDI-LLM(既能听从文本,也能观察音乐)。
结果显示,当用户从头开始创作歌曲(“从零到一”)时,完整的 MIDI-LLM 是明显的赢家。它的接受率几乎是其他模型的两倍。这表明,当人们试图开启一个新的想法时,能够输入“让它听起来像 90 年代的摇滚乐”是非常有价值的。
然而,当用户只是在现有歌曲中填补一个小缺口时,结果则比较复杂。有时,用户更倾向于使用那个忽略文本的旧模型。研究人员认为,这可能是因为当你已经深入创作一首歌时,你可能希望 AI 仅仅是“融入”已有的内容,而不是试图强行引入一个可能与现有旋律产生冲突的新想法。
总结
论文得出结论,将大语言模型适配于音乐是一种强大的配方。通过教会这些模型同时理解“文本”和“MIDI”,他们创造了一个有助于人类与 AI 更有效协作的工具。这不仅仅是为了生成噪音;这是为了给创作者提供一个灵活、快速且智能的伙伴,能够将简单的句子转化为完整的乐谱,供他们随后进行微调和完善。该团队正在将此功能推广给更多用户,希望能看到它在未来如何改变人们创作音乐的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。