Musical Agent Systems: MACAT and MACataRT
本文介绍了 MACAT 和 MACataRT,这两个是人机协作生成式人工智能系统,旨在通过优先考虑伦理参与和艺术完整性的个性化、小数据集训练,来增强实时音乐表演与协作即兴创作。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你的电脑不仅仅是在播放你下载的一首歌,而是真正学会了与你一起即兴演奏。这就是音乐元创作(musical metacreation)的领域——这是一个用于描述利用计算机模拟人类创造力的专业术语。在这个领域的核心是音乐智能体(musical agents):旨在扮演音乐伙伴角色的软件程序。它们可以聆听你的演奏,学习你的风格,然后实时即兴创作自己的部分。把它们想象成永不疲倦、从不掉拍、并且能瞬间适应你情绪的数字乐队队友。
长期以来,这些数字乐队队友都是通过海量的数据进行训练的——数以千计来自各种想象不到的流派的歌曲。虽然这种方法很强大,但它就像是通过听取历史上所有的录音来学习爵士乐一样;你可能会掌握那种大致的感觉,但你永远无法真正听起来像“你自己”。研究人员正在提出的重大问题是:我们能否构建一种 AI,通过一小部分个人的声音收藏进行学习,从而成为特定艺术家独特声音的真实反映?本论文深入探讨了这个问题,探索如何构建既符合伦理、又透明且具有深度个性化的 AI 音乐家,而不是仅仅作为通用的模式机器。
走进数字即兴演奏会:MACAT 与 MACataRT
在本文中,研究人员 Keon Ju M. Lee 和 Philippe Pasquier 介绍了两种新的音乐智能体:MACAT 和 MACataRT。你可以将它们视为两种不同的数字侧翼,旨在帮助人类音乐家进行即兴创作。这些智能体并非基于整个互联网进行训练,而是建立在“小数据”哲学之上。想象一下,教一只狗做动作不是通过向它展示一百万个其他狗的视频,而是通过用几块零食和你的声音进行练习。这正是这些系统所做的事情:它们从艺术家提供的少量精选音频片段中学习,从而能够完美地模仿该艺术家的独特风格。
AI 乐队队友的两副人格
论文将这两个系统呈现为具有不同的“人格”和工作方式,就像乐队中两种不同类型的音乐家一样。
1. MACAT:自我聆听的独奏者
MACAT 专为 AI 需要主导或驱动表演的情况而设计。它的工作方式就像一位在演奏时不断倾听自己声音的音乐家。
- 工作原理: 它使用一种“自组织映射(self-organizing map)”,这就像一张心理地图,它将相似的声音组合在一起。当它播放一个声音时,它会聆听结果,检查其心理地图,并根据在艺术家自身录音中发现的模式来决定下一步播放什么。
- 魔力所在: 它使用一种叫做“因子预言机(Factor Oracle)”的工具来捕捉声音序列中的模式。如果艺术家演奏了一个快速的鼓点,紧接着是一个轻微的哼鸣,MACAT 就会学习这个序列。在现场表演期间,它可以观察自己最近的“想法”(它刚刚播放的声音),并决定是向前推进到一个新想法,还是向后回溯以重复一个精彩时刻,这一切都是实时进行的。
- 氛围: 它非常适合独奏表演,或者当人类音乐家希望 AI 成为主要的驱动者时,从而创造出一种充满生命力、动态演进的声音景观。
2. MACataRT:协作式马赛克艺术家
MACataRT 是一个更灵活的伙伴,专为人类与 AI 之间交换想法的协作即兴演奏而设计。它建立在“音频马赛克(audio mosaicing)”的概念之上。
- 马赛克类比: 想象你有一个装有数千块不同颜色的小瓷砖(音频片段)的盒子。MACataRT 可以瞬间抓取最完美的瓷砖来填补你正在绘制的画作。如果你弹奏了一个高音,它就会抓取一个听起来音调很高的瓷砖。如果你演奏了一个粗糙、沙哑的声音,它就会抓取一个粗糙的瓷砖。
- 工作原理: 它根据声音特征(如音高或亮度)将这些瓷砖组织在一个二维空间中。人类音乐家可以指向这个空间中的某个点,AI 就会从该区域提取声音。
- 转折之处: 与其前身(原始的 CataRT 系统)不同,MACataRT 加入了“时光机”元素。它能够学习艺术家通常演奏内容的顺序。因此,它不仅可以挑选正确的音色,还可以预测下一个正确的音色,以保持节奏和流畅度。它有两种模式:反应式(Reactive)(对你的演奏做出即时响应)和主动式(Proactive)(基于学到的模式预测接下来的内容)。
为什么“小数据”改变了一切
这项研究最重要的部分不仅在于音乐听起来很好,还在于它是如何实现的。作者认为,使用海量、匿名的数据库(如整个互联网)来训练 AI 是有风险的。这就像一个画家复制了一点点梵高的作品,一点点毕加索的作品,以及一点点随机的路标,最终导致了一幅混乱且缺乏原创性的作品。此外,这还引发了伦理问题:AI 是否窃取了那些从未同意将其作品纳入训练数据的音乐家的风格?
通过使用个性化的小型数据集,这些智能体解决了这两个问题:
- 伦理与透明度: 因为 AI 仅在特定艺术家的录音上进行训练,所以音乐的来源清晰明确,不存在任何神秘感。这是一种清晰、诚实的协作。艺术家完全清楚 AI 从哪里学习到了东西。
- 真正的个性化: AI 变成了艺术家的镜子。它不仅仅是听起来“像音乐”,它听起来就像是“那个特定的音乐家”。论文指出,这创造了人类与机器之间更深层、更有意义的连接。
现实世界的即兴演奏
论文并未止步于实验室,而是展示了这些系统的实际应用。
- MACAT 被 K-Phi-A 艺术团体用于中国杭州的 MusicAcoustica 音乐节。在那里,它协助创作了一场环境电子表演,由 AI 和人类共同进行即兴创作,其中 AI 负责塑造声音的主导地位。
- MACataRT 被打击乐手和吉他手组成的二重奏 KeRa 用于创作名为《合成森林的回响》(Echoes of Synthetic Forest)的作品。这部作品表现出色,成功入围了 2024 年 AI 音乐大赛的前十名决赛圈,并在瑞士苏黎世进行了演出。这证明了这些基于小数据的智能体能够创造出引起观众和评委共鸣的音乐。
绿色与伦理的额外优势
这些系统还有一个隐藏的超能力:它们是环保的。训练大规模 AI 模型需要超级计算机并消耗大量电力,会留下巨大的碳足迹。然而,这些音乐智能体可以在标准笔记本电脑上进行训练(甚至是配备 Intel Core i7 或 Apple M2 芯片的老旧笔记本),无需强大的外部显卡。因为它们使用小型数据集,所以运行起来更快、更便宜,也更绿色。
未来展望
作者明确表示,这仍是一项正在进行中的工作。他们建议,虽然目前的系统在捕捉短期模式方面表现出色,但通过理解长期的音乐叙事,它们可以变得更加优秀。未来的版本可能会使用深度学习来记忆更长的序列,并增加“可解释性”,让音乐家能够准确看到 AI 为什么选择某个特定的音符。他们还计划加入一个反馈循环,让 AI 从错误中实时学习,使即兴演奏更加紧密契合。
简而言之,这篇论文向我们展示了,AI 音乐的未来并不是用一个巨大的、通用的机器人来取代人类艺术家。它是为每一位音乐家提供一个定制的、符合伦理且环保的数字伙伴,帮助他们在保持独特声音的同时,探索全新的声音领域。这不仅仅是关于 AI 为你演奏;更是关于 AI 与你共同演奏。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。