← 最新论文
💻 computer science

Towards a foundational model for recognising diastematic Gregorian notation

本文通过将四个此前互不统一的数据集统一到一种通用的 S-GABC 编码中,提出了一种用于识别间距式格列高利圣咏记谱法的基础模型,从而在所有这些数据集上都建立了新的技术标杆。

原作者: Daniel Kurek, Jan Hajič jr

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniel Kurek, Jan Hajič jr

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个庞大的古代音乐手稿库。这些不仅仅是普通的歌曲,它们是格里高利圣咏(Gregorian chants),即天主教会的神圣音乐,书写于一千多年前。这些手稿非常精美,但即便对专家来说也很难辨认。

长期以来,计算机一直试图自动学习如何阅读这些手写页面(这个过程被称为光学乐谱识别,或 OMR)。但出现了一个大问题:计算机们一直在说着不同的语言。

问题所在:同一种语言的四种方言

想象一下,研究人员使用的四个数据集就像四组试图描述同一张图片的不同人群。

  • A组使用一种被称为 GABC 的特定代码来描述图片。
  • B组使用一种略有不同的代码,称为 Pseudo-GABC
  • C组使用 S-GABC
  • D组则使用另一种变体。

尽管他们描述的是完全相同类型的音乐(音符和歌词),但他们描述方式的“拼写”却各不相同。这就像是在教机器人识别一只狗,但一个人称它为“犬科动物”,另一个人称它为“小狗”,还有人用一种秘密代码。因为描述不匹配,研究人员无法将所有数据结合起来教给机器人一个更好的教训。他们被迫训练四个独立的、较小的“大脑”,而不是一个巨大的、聪明的“大脑”。

解决方案:通用翻译机

作者 Daniel Kurek 和 Jan Hajič jr. 决定构建一个通用翻译机

  1. 清理混乱: 首先,他们意识到其中一些数据是“有噪声的”。想象一下,如果你有两张完全相同的歌曲照片,甚至像素都一模一样。如果计算机看到两张完全相同的照片,它会感到困惑。他们使用了一个数字“橡皮擦”来删除这些重复的副本,确保每一条数据都是唯一的。
  2. 共同语言: 他们设计了一种基于 S-GABC 提案的新型共享代码。他们将所有四种不同的数据集都翻译成这种单一的、统一的语言。现在,不再有四种不同的方言,每个人都在说同一种语言。
  3. “基础模型”: 有了所有数据都使用同一种语言后,他们用整个集合同时训练了一个强大的 AI 模型(称为 DAN)。这可以想象成一位大师级厨师,他品尝过来自四个不同地区的食谱,并学会了完美地烹饪所有这些食谱,而不仅仅是其中一种。

结果:新的行业标杆

当他们测试这个新的“大师级厨师”模型时:

  • 它比之前的尝试学得更快、更好。
  • 当他们把这个大师模型拿出来,并针对其中一个困难的数据集进行额外的专门练习(这个过程称为微调)时,它变得更加敏锐。
  • 在几乎所有的测试中,这种新方法都超越了之前的最佳结果。它在识别音符、歌词以及将歌词与正确音符匹配方面的错误更少。

为什么这很重要(根据论文所述)

论文声称,通过统一这些不同的数据集,他们创建了一个基础模型。这意味着他们构建了一个强大的、通用的 AI,它对格里高利圣咏记谱法的理解达到了前所未有的高度。

他们不再需要为每种不同的手稿风格编写不同的计算机程序,而是现在拥有了一个能够处理这些古老歌曲多样化视觉风格的强大工具。这使得数字化和研究仍然存在的数千份手稿变得更加容易,将无法阅读的古代墨迹转化为可搜索的数字音乐。

简而言之: 他们把四组说着不同方言的人聚在一起,教他们说同一种语言,然后基于这个组合后的群体训练了一名超级聪明的学生。结果呢?这位学生阅读古代音乐的能力比以往任何人都更出色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →