✨ 要点🔬 技术摘要
想象一下,你正试图教一个机器人通过听觉来识谱。你想让它听一首完整的流行歌曲——鼓、贝斯、吉他、人声全部混在一起——然后写下每一种乐器正在演奏的每一个音符。这听起来很酷,对吧?但问题在于,直到现在,我们还没有一个好的“标准答案”来检查机器人做得对不对。现有的多数答案集要么是针对独奏钢琴的(太简单了),要么是由计算机生成的(过于完美),或者只列出了主旋律和和弦(太简单了)。
MulTTiPop 应运而生,这是一个由卡内基梅隆大学的研究人员创建的新数据集,旨在解决这个问题。把 MulTTiPop 想象成一个长达 3.5 小时的真实流行音乐播放列表,涵盖了从 20 世纪 30 年代到 2000 年代的经典曲目,并配有一份“魔法乐谱”,能精确到毫秒级地告诉你每种乐器在做什么。
伟大的匹配游戏
他们是如何构建这个数据集的呢?这就像是一场高风险的“找茬”游戏。
线索: 他们从一个巨大的 YouTube 视频列表(来自 TheoryTab 数据库)和一个巨大的数字乐谱库(来自 Lakh MIDI 数据集)开始。
第一层过滤: 他们利用计算机魔法来匹配歌曲名称和艺术家名称。如果名称几乎完全相同,他们就会保留这对组合。这把范围缩小到了大约 1,164 个潜在匹配项。
节奏的转折: 这是最棘手的地方。即使是同一首歌,数字乐谱中的“节拍”可能比真实的 YouTube 视频快一点或慢一点。这就像两个人在跳同一支舞,但其中一个人动作稍微拖了后腿。
人工干预: 为了修复时值问题,研究人员使用了一个聪明的技巧。他们找到了一个特定的“锚点节拍”(即音乐能够完美对齐的时刻),然后拉伸或压缩数字乐谱,使其与真实视频的节奏完美契合。但计算机并不擅长挑选这种锚点节拍。因此,他们邀请了人工标注员 (热爱音乐且精通技术的学生)同时观看视频并查看数字乐谱,从而选出正确的 对齐方式。
最终,他们成功对齐了 572 段 音乐片段。这大约是 3.5 小时 的音频,涵盖了 374 首独特的歌曲 和 263 位不同的艺术家 。
现实检验:机器人还有很长的路要走
研究人员不仅构建了这个数据集,还立即对最顶尖的机器人音乐家进行了测试。他们让两个顶尖的 AI 模型(称为 MT3 和 YourMT3+)聆听这些 MulTTiPop 片段并写下音符。
结果如何?机器人的表现很挣扎。
表现最好的模型也仅能获得约 38% 的音符起始准确率(一个被称为“Onset F1”的指标)。
当音乐变得密集时,机器人经常会感到困惑。它们可能会听到旋律,但会错过贝斯,或者它们会死磕在一种乐器上而忽略了其他乐器。
其中一个模型试图猜测人声,却将其标记成了萨克斯风(这很有趣,但显然是错的)。
论文指出 ,这些机器人之所以失败,是因为它们主要是在虚假的、计算机生成的音乐(如 Slakh2100 数据集)上进行训练,而不是在真实的、杂乱的商业流行录音上进行训练。这就像教一位厨师做菜时,只给他看完美的塑料食物模型,然后递给他一块正在滋滋作响的真牛排,却指望他知道该怎么处理一样。
这个数据集是什么(以及不是什么)
作者非常明确地说明了游戏规则:
它是为了测试: MulTTiPop 是音乐转录 AI 的“期末考试”。它的设计目的是向我们展示机器人在哪里失败了,以便我们能够修复它们。
它不是为了训练: 研究人员明确排除 了使用该数据集来训练机器人的可能性。因为这些歌曲是受版权保护的商业热门歌曲,且数据集相对较小,使用它来训练模型是不公平且在法律上存在争议的。
它具有偏差: 论文承认所选歌曲大多是西方流行音乐(美国艺术家、西方和声)。它暗示 ,如果一个机器人在 MulTTiPop 上表现出色,那么它擅长的是西方流行乐,但我们无法确定它是否能在世界其他地区或不同的音乐传统中表现出色。
总结
MulTTiPop 是一个至关重要的全新工具,它终于为复杂的流行音乐提供了一个现实的“标准答案”。它证明了虽然我们的 AI 音乐转录技术在处理简单任务时正在进步,但在真正理解真实流行乐队那种混乱、美妙的混沌状态之前,仍有巨大的提升空间 。目前的机器人在这场测试中只能拿到“C-”的成绩,而研究人员希望通过这个新数据集,能帮助它们更努力地学习,并在下次考试中拿到“A”。
技术摘要:MulTTiPop
问题陈述
自动音乐转谱(AMT)已从单钢琴转谱发展到更广泛的乐器和风格覆盖。然而,在真实世界商业流行音乐的多轨转谱 方面仍存在显著差距。现有模型在处理商业制作的歌曲时往往表现不佳,因为它们是在合成数据(如 Slakh2100)或受限领域(如 MAESTRO 中的单钢琴)上训练的。此外,由于缺乏将商业流行音频与地面真值(Ground Truth)、时间对齐的多轨转谱 相匹配的数据集,系统性评估受到了阻碍。虽然像 TheoryTab 这样的数据集提供了商业音频,但它们仅提供弱对齐的旋律和和弦标注,而非完整的多轨 MIDI。相反,像 RWC-Pop 这样的数据集虽然提供多轨 MIDI,但缺乏流派多样性,且使用的是专门为研究而创作而非真实流行音乐的歌曲。
方法论
作者引入了 MulTTiPop ,这是一个通过将商业流行音频片段与多轨 MIDI 文件进行对齐而创建的数据集。构建过程包含四个关键阶段:
基于元数据的匹配:
音频来源: 片段源自 TheoryTab 数据集(初始目标为 25,947 个),该数据集包含用户生成的旋律/和弦标注以及 YouTube 视频时间戳。
MIDI 来源: 多轨 MIDI 文件源自 Lakh MIDI 数据集 (LMD) ,特别是与 Million Song Dataset 相匹配的子集(31,305 首歌曲)。
匹配: 作者使用 RapidFuzz 计算 TheoryTab 和 LMD 之间艺术家和歌曲标题元数据的编辑距离(Levenshtein distance)。通过此过滤过程,获得了 1,164 个潜在匹配项。
基于节拍的时间对齐:
由于 MIDI 速度(Tempo)通常与商业音频略有不同,因此需要进行细粒度的对齐。
节拍追踪: 作者在音频片段(带有 0.5s 填充)上使用基于 RNN 的节拍追踪(通过 madmom)来提取音频节拍网格 b a b_a b a 。MIDI 节拍网格 b m b_m b m 则由其内部结构导出。
扭曲(Warping): 为了处理速度差异,系统对 MIDI 音符时值进行线性插值。它定义了一个锚点节拍 k k k ,将第一个音频节拍连接到第 k k k 个 MIDI 节拍,从而通过扭曲使 MIDI 在时间上与音频匹配。
候选锚点节拍选择:
自动锚点节拍选择被发现是不可靠的。作者使用不同的指标生成了最多四个候选对齐方案:
基础(Base): 扭曲后的 MIDI 与音频之间的 Chroma 余弦相似度和起始点相关性(Pearson)。
旋律(Melody): TheoryTab 旋律标注与单个 MIDI 乐器部分之间的 Chroma 余弦相似度(权重为 75%)。
YouTube 时间(yt): 根据 YouTube 视频相对于完整 MIDI 时长的绝对开始时间对节拍进行过滤。
组合(yt_melody): 将旋律指标应用于经过 YouTube 时间过滤后的节拍。
人工标注:
人类标注员(计算机科学和音乐技术专业的学生)对候选方案进行审查。他们会看到原始音频、钢琴卷帘图可视化、合成的 MIDI 版本以及音频/MIDI 叠加视图。
标注员选择与音频最匹配的对齐方案。如果没有完美的候选方案,则拒绝该样本。标注员还会区分错误是由错误的元数据匹配(错误的歌曲)还是对齐问题(错误的节拍/速度)引起的。
核心贡献
MulTTiPop 数据集: 一个包含 572 个片段 (3.5 小时)的商业流行音乐集合,并配有时间对齐的多轨 MIDI 转谱。
多样性: 该数据集涵盖了从 20 世纪 30 年代到 2000 年代的 374 首独特歌曲和 263 位艺术家,跨越 101 种流派(如摇滚、新浪潮、Motown)。这显著超过了 RWC-Pop 的流派多样性。
商业音频地面真值: 与合成数据集不同,MulTTiPop 为完全制作的商业录音提供了地面真值,解决了 AMT 中的“合成到真实”差距问题。
评估协议: 数据集分为开发集(169 个片段)和测试集(403 个片段),并通过艺术家进行分层以防止数据泄露。作者明确建议仅将 MulTTiPop 用于评估 ,而非训练,原因是其规模较小且存在版权限制。
结果
作者在 MulTTiPop 测试集上评估了两种最先进的 AMT 模型:MT3 和 YourMT3+ :
性能: 与它们在其他基准测试(如 MusicNet、GuitarSet)上的表现相比,这两个模型的表现都很差。
YourMT3+ 取得了最佳的 Onset F1 (谐波-打击乐部分为 37.87%,精确部分为 25.29%)。
MT3 取得了 Onset F1(谐波-打击乐部分为 36.83%,精确部分为 28.42%)。
定性分析:
模型在处理纹理密集的音乐时表现挣扎,经常无法生成连贯的多轨转谱。
MT3 倾向于捕捉歌曲中的一两个部分,导致转谱不连贯且乐器标签不一致。
YourMT3+ 表现出更好的连贯性,但会遗漏乐器部分且缺乏节奏细节。它也会误识别人声线条(常将其标记为萨克斯风),这在“精确(Exact)”指标中反映得并不好。
结论: 低分表明,当应用于真实世界的多轨流行音乐时,当前的 AMT 系统仍有“巨大的改进空间”。
意义与主张
本文将 MulTTiPop 定位为解决 AMT 在商业流行音乐领域停滞不前的必要基准。其主要意义在于:
弥合差距: 提供了首个将商业音频与完整多轨 MIDI 配对的此类数据集,从而能够对旨在用于真实场景的模型进行严格评估。
揭示局限性: 证明了即使是在合成多轨数据(如 Slakh2100)上训练的模型,在处理商业录音时也难以泛化,凸显了对更好训练数据或架构的需求。
代表性采样: 为多轨 AMT 提供了西方流行音乐用例的多样化样本。
局限性与注意事项: 作者明确指出该数据集存在西方偏见 ,因为其来源材料(TheoryTab/HookTheory)主要是以美国和西方为中心的。因此,他们声称 MulTTiPop 反映的是在“西方流行音乐经典”上的表现,而非全球音乐。此外,由于数据集规模较小且标签性质(受版权保护的商业音频),作者严格建议不要将 MulTTiPop 用于训练生成式模型。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。