Library learning with e-graphs on jazz harmony
本文提出了一种计算模型,该模型利用 e 图上的库学习来发现爵士和声进行的简洁、生成性解释,旨在通过和声库与程序重构的联合优化,捕捉人类内化结构化音乐模式的过程。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在聆听一支爵士乐队。对普通听众而言,那只是一连串酷酷的和弦流。但对音乐家来说,这股流并非随机;它是由 handful 个熟悉的“乐句”或“licks"构建而成,这些乐句被重复、微调并以不同方式组合。
本文旨在教计算机像音乐家一样聆听爵士乐。研究人员曾仁、Maddy Bowers、Xinyi Guan 和 Martin Rohrmeier 构建了一个系统,该系统不仅记忆和弦,更能找出构成音乐的隐藏规则和可复用的构建模块。
以下是他们如何实现这一点的简明解释:
1. 问题:解释音乐的方式太多
想象你有一句话:“猫坐在垫子上。”你可以用多种方式解释它:
- “猫” + “坐” + “在垫子上”。
- “猫” + “坐在” + “垫子上”。
- “猫坐在” + “在” + “垫子上”。
在爵士乐中,一串和弦(例如 C 大调、A 小调、D 小调、G 七和弦)可以以成千上万种不同的方式分解为关系。如果计算机试图列出分解一首歌曲的每一种可能方式,它会瞬间不堪重负。这就像试图阅读字典中的每一个可能句子来理解一个故事。
2. 解决方案:"E-Graph"(一个超级有条理的文件柜)
为了解决这个问题,团队使用了一种巧妙的数据结构,称为e-graph。将其想象为一个超级有条理的文件柜,它不仅仅存储文件的一个版本,而是同时存储文件的所有可能版本,且不浪费空间。
- 类比:想象你在建造一座房子。与其为每一座房子绘制新的蓝图,不如拥有一份主蓝图,展示墙壁、窗户和门可以排列的所有可能方式。E-graph 将这些可能性紧凑地保存在一个共享空间中。
3. “库学习”(寻找乐高套装)
一旦计算机拥有了分解歌曲的所有可能方式,它就会寻找模式。这就是“库学习”部分。
- 类比:想象你是一位厨师。你有一本包含 100 道食谱的巨著。你注意到其中 50 道食谱使用了完全相同的“秘制酱汁”(大蒜、柠檬、黄油)。
- 没有库:你在每一道食谱中都写下“大蒜、柠檬、黄油”。这既冗长又重复。
- 有了库:你创造了一种名为“秘制酱汁”的新食材。现在,你只需在食谱中写下“秘制酱汁”。你节省了空间,食谱也变得更清晰。
计算机对音乐也这样做。它发现重复出现的和弦模式(如"V-I"解决或"ii-V-I"进行),并给它们命名。然后,它“重构”歌曲,用这些新的命名模式替换冗长的和弦列表。
4. 他们如何测试
他们在三首著名的爵士标准曲上进行了测试:《Red Clay》、《Valse Hot》和《Sunny》。
- 结果:计算机成功压缩了这些歌曲。它将冗长杂乱的和弦列表转化为使用其新“模式库”的简短、清晰的指令。
- 效率:通过在三首歌曲之间共享这些模式,计算机描述音乐所需的“内存”远少于试图从头解释每首歌曲所需的情况。
5. 计算机“学到”了什么
该系统发现的不仅仅是随机模式;它发现了人类音乐理论家所寻找的东西。
- 它发现了标准的爵士乐手法,例如“属音到主音”(一种张力与释放的模式)。
- 它发现了更复杂的结构,例如“后门属和弦”(一种特定类型的惊喜和弦)。
- 一个惊人的转折:在一首歌曲(《Red Clay》)中,计算机对开头和弦提出了一个独特的解释,这与标准的人类分析不同。它认为这种奇怪的解释实际上是使用其库来解释音乐最高效的方式。这表明,有时,数学上最高效的解释对人类耳朵来说可能看起来很奇怪,或者它可能揭示出聆听音乐的新方式。
大局观
这篇论文认为,学习音乐不仅仅是记忆音符。它是建立一个可复用模块的心理库。当我们聆听爵士乐时,我们的大脑本质上在进行“库学习”:我们识别出特定的和弦组只是我们以前听过的“熟悉乐句”,这有助于我们更快、更省力地理解歌曲。
这个计算机模型证明,我们可以教机器做同样的事情:接收原始数据流,找出隐藏的、可复用的构建模块,并利用它们高效地解释整体图景。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。