← 最新论文
💻 computer science

A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores

本文介绍了 OSSQ-OMR,这是首个针对多声部弦乐四重奏乐谱的光学乐谱识别(OMR)数据集与基准测试,其特点是包含超过 122,000 张对齐的图像及其多种格式的转录文本,并提供了通过基准评估来强调编码、分割和模型架构对识别准确率影响的研究。

原作者: Dongmin Kim, Brian Liu, Jose J. Valero-Mas, Dasaem Jeong

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Dongmin Kim, Brian Liu, Jose J. Valero-Mas, Dasaem Jeong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位图书管理员,正试图拯救世界上最美丽的、手写的食谱。但这些食谱不是用墨水和纸张书写的,而是用五线谱上的音符写成的。几十年来,计算机在阅读简单的单行旋律(比如长笛独奏部分)方面已经做得相当出色了。它们可以观察乐谱的图像,并将其转化为计算机可以播放的数字文件。这个领域被称为光学乐谱识别(OMR)。这就像是在教机器人如何阅读一本乐谱,以便它能向你回放旋律,或帮助音乐家练习。

然而,当你试图同时阅读一整个乐队的音乐时,情况就会变得非常混乱。想象一下弦乐四重奏:四种不同的乐器(两把小提琴、一把中提琴和一把大提琴)同时演奏四条不同的旋律线,并且紧凑地排列在同一页上。这是一个视觉谜题,涉及音符的交叉、不同乐器的符号,以及几个世纪前凌乱的手写体。直到现在,计算机在处理这种“多声部”音乐时仍然很吃力,因为它们缺乏一个良好的练习集。这就像是试图教一个学生阅读一部复杂的长篇小说,而他之前只练习过单句闪卡。

就在这时,一个研究团队带着一个名为 OSSQ-OMR 的庞大新工具介入了。他们构建了第一个专门用于这些复杂弦乐四重奏乐谱的专用训练数据集。把它想象成一个巨大且完美组织的图书馆,其中每一页扫描的乐谱都配有其完美的数字孪生体。他们不仅仅是抓取了一些随机图片;他们花费了数百小时手动修复数字版本,使其与旧扫描件完全匹配,精确到每一个微小的点和线。

有了这个新图书馆,研究人员测试了两种不同的“机器人读者”(计算机模型),以观察谁的学习效果更好。他们发现,当机器人被教导一次只读一种乐器的线条,而不是试图一口吞下整页内容时,学习效果最好。他们还发现,音乐被数字化记录的方式比机器人的大脑设计更为重要。表现最好的结果来自于一种叫做 LMXE 的特定格式,该格式在干净的计算机生成图像上实现了仅为 3.6% 的极低错误率,而在真实的扫描页面上则为 5.9%。虽然这证明了教计算机阅读复杂的四重奏音乐是完全可能的,但结果也表明,特别是在处理旧纸张乐谱这种杂乱、不完美的现实情况时,仍有很大的提升空间。

大局观:他们做了什么以及发现了什么

研究人员创建了 OSSQ-OMR,这是第一个专门为帮助计算机识别弦乐四重奏音乐而设计的数据集。在此之前,大多数计算机视觉工具都是针对简单的单行歌曲或钢琴曲进行训练的。弦乐四重奏要难得多,因为它涉及四个独立的声部同时演奏,通常具有复杂的布局、不同的谱号,以及因出版商不同而千差万别的手写风格。

为了构建这个数据集,团队从 116 份现有的弦乐四重奏数字乐谱出发。然后,他们在 IMSLP 库中寻找这些乐谱的原始扫描版本。这里最棘手的部分在于:原始数字文件并不总是与扫描件完美匹配。有时会缺少一个小节,或者某个符号位置不对。作者花费了超过 100 个小时手动编辑数字文件,使它们在视觉上与扫描图像完全一致。他们还将数据分为两个层级:系统级(包含所有四种乐器的整行音乐)和谱表级(仅包含一种乐器的线条)。最后,他们将音乐转换成了三种不同的数字文本格式:LMXEkernABC

这个数据集规模宏大。它包含 24,544 幅系统图像98,172 幅谱表图像,这些图像均源自那 116 份乐谱。大约一半的图像是合成的(干净的、计算机生成的版本),另一半则是从真实的旧书中扫描而来的。

为了测试这个数据集是否真的有效,研究人员设置了一个“基准测试”,这就像是计算机模型的标准化考试。他们测试了两类流行的 AI 模型:

  1. Zeus: 一个基于较旧的序列处理(LSTM)的模型。
  2. SMT: 一种使用 Transformer 架构的新型模型(类似于现代聊天机器人背后的技术)。

他们使用该数据集运行了这些模型,并测试了不同的设置,以观察哪种组合效果最佳。以下是他们的发现:

  • 一次读一行效果更好: 当模型被要求只读取一个乐器的谱表(谱表级),而不是整个页面(系统级)时,表现显著优于后者。尽管阅读整个页面能提供更多的上下文信息(例如看到其他乐器在做什么),但模型似乎并没有利用这些额外的信息来减少错误。事实上,当模型专注于单行线条时,错误率反而更低。
  • 格式比大脑更重要: 研究人员测试了九种不同的将音乐转换为文本标记(即计算机阅读的“单词”)的方法。他们发现,无论使用哪种模型,LMXE 格式始终产生最好的结果。令人惊讶的是,尽管 SMT 最初是为 kern 设计的,但这个较新的 Transformer 模型在 kern 格式上的表现反而不如在 LMXE 上的表现。
  • 压缩并没有帮助: 他们尝试对 ABC 格式使用“字节对编码”(BPE),这是一种通过将常见字符分组来缩短文本的方法。他们原本以为这会有所帮助,但结果反而变差了。随着压缩词汇量的大小增加,错误率也随之上升。
  • 现实世界 vs. 干净数据: 模型在干净的合成图像(错误率低至 3.6%)上的表现远好于杂乱的扫描图像(错误率约为 5.9%)。这是预料之中的,因为扫描图像存在噪声、阴影和油墨不均的问题。然而,旧式的 LSTM 模型(Zeus)比新型的 Transformer 模型(SMT)对这种杂乱情况更具鲁棒性。当从干净数据切换到扫描数据时,Zeus 的性能下降了约 39%,而 SMT 的性能则出现了惊人的 100% 下降。

论文还测试了一个名为 Legato 的外部模型,该模型是在另一个数据集上训练的。当他们尝试在不进行重新训练的情况下,将 Legato 应用于这个新的弦乐四重奏数据时,结果非常糟糕(在合成数据上的错误率超过 36%,在扫描数据上的错误率超过 66%)。这表明,仅仅在通用音乐数据上进行预训练是不够的;你需要针对你想让它阅读的特定类型的音乐进行专门训练。

总之,作者表明,教计算机阅读复杂的弦乐四重奏乐谱是可行的,但这需要正确的数据和正确的数据格式化方式。他们发现的最佳配置在合成数据上实现了 3.6% 的错误率,在扫描数据上实现了 5.9% 的错误率。虽然这是一个伟大的开端,但论文指出,要让这些系统在阅读现实世界中那些杂乱、美丽的乐谱时达到人类水平,仍有很多工作要做。他们还暗示,未来的研究应该探索更大规模的乐团(如全编制管弦乐队),并尝试构建能够直接阅读整个页面而无需先进行切割的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →