想象一下,你拥有一个庞大的古代音乐手稿库。这些不仅仅是普通的歌曲,它们是格里高利圣咏(Gregorian chants),即天主教会的神圣音乐,书写于一千多年前。这些手稿非常精美,但即便对专家来说也很难辨认。
长期以来,计算机一直试图自动学习如何阅读这些手写页面(这个过程被称为光学乐谱识别,或 OMR)。但出现了一个大问题:计算机们一直在说着不同的语言。
问题所在:同一种语言的四种方言
想象一下,研究人员使用的四个数据集就像四组试图描述同一张图片的不同人群。
- A组使用一种被称为 GABC 的特定代码来描述图片。
- B组使用一种略有不同的代码,称为 Pseudo-GABC。
- C组使用 S-GABC。
- D组则使用另一种变体。
尽管他们描述的是完全相同类型的音乐(音符和歌词),但他们描述方式的“拼写”却各不相同。这就像是在教机器人识别一只狗,但一个人称它为“犬科动物”,另一个人称它为“小狗”,还有人用一种秘密代码。因为描述不匹配,研究人员无法将所有数据结合起来教给机器人一个更好的教训。他们被迫训练四个独立的、较小的“大脑”,而不是一个巨大的、聪明的“大脑”。
解决方案:通用翻译机
作者 Daniel Kurek 和 Jan Hajič jr. 决定构建一个通用翻译机。
- 清理混乱: 首先,他们意识到其中一些数据是“有噪声的”。想象一下,如果你有两张完全相同的歌曲照片,甚至像素都一模一样。如果计算机看到两张完全相同的照片,它会感到困惑。他们使用了一个数字“橡皮擦”来删除这些重复的副本,确保每一条数据都是唯一的。
- 共同语言: 他们设计了一种基于 S-GABC 提案的新型共享代码。他们将所有四种不同的数据集都翻译成这种单一的、统一的语言。现在,不再有四种不同的方言,每个人都在说同一种语言。
- “基础模型”: 有了所有数据都使用同一种语言后,他们用整个集合同时训练了一个强大的 AI 模型(称为 DAN)。这可以想象成一位大师级厨师,他品尝过来自四个不同地区的食谱,并学会了完美地烹饪所有这些食谱,而不仅仅是其中一种。
结果:新的行业标杆
当他们测试这个新的“大师级厨师”模型时:
- 它比之前的尝试学得更快、更好。
- 当他们把这个大师模型拿出来,并针对其中一个困难的数据集进行额外的专门练习(这个过程称为微调)时,它变得更加敏锐。
- 在几乎所有的测试中,这种新方法都超越了之前的最佳结果。它在识别音符、歌词以及将歌词与正确音符匹配方面的错误更少。
为什么这很重要(根据论文所述)
论文声称,通过统一这些不同的数据集,他们创建了一个基础模型。这意味着他们构建了一个强大的、通用的 AI,它对格里高利圣咏记谱法的理解达到了前所未有的高度。
他们不再需要为每种不同的手稿风格编写不同的计算机程序,而是现在拥有了一个能够处理这些古老歌曲多样化视觉风格的强大工具。这使得数字化和研究仍然存在的数千份手稿变得更加容易,将无法阅读的古代墨迹转化为可搜索的数字音乐。
简而言之: 他们把四组说着不同方言的人聚在一起,教他们说同一种语言,然后基于这个组合后的群体训练了一名超级聪明的学生。结果呢?这位学生阅读古代音乐的能力比以往任何人都更出色。
技术摘要:迈向识别有谱线格里高利圣咏(diastematic Gregorian notation)的基础模型
问题陈述
针对格里高利圣咏的光学乐谱识别(OMR)通过端到端方法取得了近期进展,但该领域仍受限于数据的碎片化。虽然存在四个用于有谱线(diastematic)记谱法的不同数据集(GregoSynth、Salzinnes、Einsiedeln 和 Solesmes),但它们使用了互不兼容的编码方式(GABC、Pseudo-GABC 和 S-GABC)。这种异构性阻碍了通过整合资源来训练更大、更鲁棒的模型。此外,现有数据集包含“近乎重复”的样本,即尽管图像略有不同或文本字符串相同或极其相似,但其地面真值(ground truth)字符串是相同的,这使得训练/验证集的划分变得复杂,并可能导致性能指标虚高。
方法论
作者提出了一个将这些差异巨大的资源统一到一个单一训练生态系统中的流水线:
数据协调与清洗:
- 去重: 作者实现了一个清洗流水线,用于识别并移除近乎重复的样本。如果两个样本的地面真值字符串之间的编辑距离(Levenshtein distance)≤3,且图像之间的结构相似性指数(SSIM)≥0.97,则将其视为重复样本。这一过程略微减少了总数据集的大小,但确保了训练样本的独特性。
- 统一编码: 核心技术贡献是基于 Systematic GABC (S-GABC) 提案定义了一种通用编码。作者对 Salzinnes 和 Einsiedeln 数据集中未公开文档化的“Pseudo-GABC”进行了逆向工程,并将所有三种输入格式(GABC、S-GABC、Pseudo-GABC)映射到这一共享格式中。
- 转换: 利用 Lark 文法,作者将原始转录文本解析为语法树,并将其转换为通用编码。此过程保留了关于旋律、文本、对齐和符组(neume grouping)的关键信息,同时移除了无关的格式符号并解决了歧义(例如,将水平附注/episema 的位置标准化为 0 和 1)。
模型架构与训练:
- 基础模型: 由于训练速度更快,作者选择了在先前研究中表现出强劲性能的 DAN(深度注意力网络)架构,而非 Sheet Music Transformer。
- 训练策略:
- 共享预训练: 一个共享模型在合并后的协调数据集上进行训练。为了防止大规模合成数据集 GregoSynth 在学习过程中占据主导地位,作者在每个 epoch 中对其进行随机降采样,使其规模与第二大的数据集(Salzinnes)相匹配。
- 梯度累积: 为了解决由于图像比例不一导致的批大小(batch size)为 1 的限制,作者采用了 8 倍梯度累积。
- 微调: 使用共享模型的权重来初始化在单个真实世界数据集(Salzinnes、Einsiedeln、Solesmes)上进行微调的模型,并使用较低的学习率(10−5)。
核心贡献
- 统一数据集: 创建了一个协调后的数据集,将四个此前互不兼容的数据源合并到单一的编码方案中,从而实现了联合训练。
- 基础模型: 训练了一个共享的端到端模型,该模型在所有四个数据集上都建立了新的最先进水平(SOTA),证明了聚合数据可以提高泛化能力。
- 改进的训练协议: 证明了 8 倍梯度累积在处理该领域任务时显著优于标准的批大小为 1 的训练。
- 可复现性: 发布了转换工具(Lark 文法)和清洗后的数据集。
结果
作者使用五项指标评估了性能:旋律错误率(MER)、字符错误率(CER)、音节错误率(SylER)、对齐错误率(ALER)以及综合全指标错误率(AMLER)。
- 共享模型性能: “DAN-shared”模型(在合并数据上训练且未进行微调)在 GregoSynth 和 Salzinnes 上通常优于基准 DAN 模型,但在处理规模较小且多样性较高的 Solesmes 数据集时,表现不如其特定的基准模型。
- 微调影响: 在单个数据集上对共享模型进行微调(DAN-FT)使得模型能够达到或超过 Salzinnes 和 Einsiedeln 之前的最佳结果(SOTA)。
- 梯度累积: 使用 8 倍梯度累积的模型(DAN(8)-shared)在大多数指标和数据集上都优于所有其他配置,包括之前的 SOTA。
- 最终 SOTA: 结合了梯度累积的微调模型(DAN(8)-FT) 在所有数据集上均实现了最低的错误率。例如,在具有挑战性的 Solesmes 数据集上,它将 AMLER 从 23.17%(基准)降低到了 10.81%;在 Einsiedeln 上,它将 AMLER 从 5.14% 降低到了 2.73%。
意义与主张
论文声称,这项工作的核心价值在于实现了共享预训练和微调流水线。通过协调编码,作者证明了通过系统性的编码协调来合并具有相互兼容的记谱原则的数据集,可以产生一个能够处理格里高利记谱法多样化视觉领域的“基础模型”。
作者谦虚地指出,虽然他们的通用编码基于 S-GABC,但包含了特定的修改(例如,重新引入空心音符、移除不确定读法标记)以适应 OMR 任务。他们没有为这种编码命名,暗示应将其视为实现完整 S-GABC 的一步,而非替代品。这项工作证实,只要通过系统的编码协调解决了数据异构性问题,通过 OMR 实现大规模、自动化的格里高利圣咏手稿理解是可行的。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。