Velocity Prediction in Automatic Guitar Transcription
本文提出了一种自动吉他转谱的方法论,该方法通过在利用虚拟乐器生成的合成数据上对模型进行预训练,随后将这些权重迁移至在真实吉他音频上训练的模型中,从而成功预测音符力度,并实现了最先进的转谱性能以及力度预测能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个机器人,它可以聆听一段吉他曲并为你写下乐谱。这被称为“自动吉他转谱”(Automatic Guitar Transcription)。长期以来,这些机器人非常擅长识别弹奏了哪些音符(比如“C”或“E”),但它们却很难搞清楚吉他手弹奏的力度有多大。
在数字音乐的世界里,“弹奏力度有多大”被称为力度(velocity)。在钢琴上,这很容易测量,因为计算机知道琴键被按下的确切速度。但在吉他上,这就像是仅仅通过听那个“砰砰”声来猜测有人踢足球的力量有多大一样——这很模糊,而且没有标准的方法来衡量。因此,大多数吉他转谱机器人都会忽略它。
这篇论文介绍了一个聪明的技巧,可以教机器人理解吉他的“力度”(或强度),而无需使用特殊的、昂贵的测量力的吉他。
问题所在:没有训练手册
要教机器人任何东西,你通常需要大量已经有已知答案的例子(就像老师的答案解析)。对于钢琴,我们有这些答案解析;对于吉他,我们没有。我们只有真实吉他手的录音,但我们并不知道他们弹奏每个音符时确切的“力度”数值。
解决方案:“虚拟吉他”模拟器
研究人员决定先构建一个训练模拟器,而不是直接使用真实的录音。
- 模拟器: 他们使用了能够模拟吉他的计算机软件(虚拟乐器)。他们告诉计算机:“以 50 的力度弹奏这个音符”,然后计算机生成了一个声音文件。因为声音是由计算机生成的,所以它知道每一个音符确切的“力度”数值。
- 第一课: 他们使用这种虚构的、合成的数据来训练他们的机器人模型。机器人学会了观察声波并猜测:“啊,这听起来像是 50 的力度。”
- 迁移: 一旦机器人在虚构数据中掌握了强度的“概念”,他们就把这个特定的部分(“力度权重”)移动到了一个新的模型中。
- 第二课: 然后,他们使用真实的吉他手录音(来自 GAPS 和 GOAT 等数据集)来教这个新模型。他们告诉机器人:“现在忘掉那些虚构的数字;只需学习识别真实的音符和琴弦。”但他们保持了在第 2 步中学习到的“力度大脑”处于冻结状态。
这就像教学生开车。首先,你让他们在驾驶模拟器上练习,在那里你知道他们的速度到底有多快。一旦他们理解了速度和刹车,你就把他们放进真正的汽车里。你不再需要告诉他们速度有多快;他们已经有了那种“感觉”,现在他们只需要学习如何应对真实的道路。
他们发现了什么?
研究人员通过两种方式测试了他们的机器人:
1. 它能在虚构数据上猜出强度吗?
可以,而且做得非常好。当在合成数据(其中“正确答案”是已知的)上进行测试时,与没有经过特殊训练的机器人相比,该机器人的误差非常小。它成功学习了虚拟吉他的“个性”。
2. 这对转谱真实的吉他歌曲有帮助吗?
这是最棘手的部分。由于我们没有关于真实吉他强度的“正确答案解析”,他们无法证明机器人猜出的数值是否与真实歌曲的强度完全一致。然而,他们确实发现了一个微小的副作用:
- 拥有“力度训练”的机器人比没有经过该训练的机器人更擅长判断音符开始和停止的时间(时值)。
- 这种提升非常微小(约 0.1%),但确实存在。这就像是在说,“了解球被踢的力量有助于机器人稍微更好地猜出球的路径。”
核心结论
该论文声称他们成功构建了第一个可以预测“力度”(强度)的吉他转谱模型。他们是通过以下方式实现的:
- 创建了一个强度数值已知的虚构数据集。
- 在该虚构数据上训练模型。
- 将学到的知识迁移到使用真实吉他音频训练的模型中。
局限性:
作者坦诚地说明了缺陷。由于吉他的“力度”不像钢琴那样是一个硬性的数值,他们无法证明他们的机器人对真实歌曲的强度预测是 100% 正确的。他们本质上是在根据音符听起来有多响、多亮来进行猜测,这是一种很好的近似,但不是完美的测量。
简而言之,他们通过一个视频游戏模拟器教会了机器人去“感受”吉他的强度,而这种“感觉”让机器人在玩真实的比赛时表现得稍微好了一点点。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。