A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores
本論文は、122,000枚以上の整列済み画像と複数の形式による転記を特徴とし、エンコーディング、セグメンテーション、およびモデルアーキテクチャが認識精度に与える影響を浮き彫りにするベースライン評価とともに、マルチパートの弦楽四重奏譜の光学式楽譜認識(OMR)のための初のデータセットおよびベンチマークであるOSSQ-OMRを紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、世界で最も美しい手書きのレシピを救おうとしている司書だと想像してください。しかし、インクと紙ではなく、レシピは楽譜上の音符で書かれています。何十年もの間、コンピュータは単純な単一線のメロディ(例えば、フルート奏者のソロパートのようなもの)を読み取ることは得意になってきました。コンピュータは楽譜の画像を見て、それをコンピュータが再生できるデジタルファイルに変換できます。この分野は「光学楽譜認識(OMR)」と呼ばれています。これは、ロボットに楽譜を読ませて、曲を歌い返させたり、ミュージシャンが練習するのを助けたりするように教えるようなものです。
しかし、バンド全体の音楽を一度に読もうとすると、事態は混乱します。弦楽四重奏団を想像してみてください。4つの異なる楽器(2つのバイオリン、ビオラ、チェロ)が、同時に4つの異なるラインを演奏しており、それらが同じページにぎっしりと詰め込まれています。これは、音が交差し、楽器ごとに異なる記号があり、何世紀も前の乱れた筆跡があるという、視覚的なパズルです。これまで、コンピュータはこのような「マルチパート(多声部)」の音楽に苦戦してきました。なぜなら、これらを学習するための優れた練習セットを持っていなかったからです。それは、単一の文章のフラッシュカードだけで練習してきた学生に、複雑な小説を読ませようとするようなものです。
ここで、新しい研究チームが「OSSQ-OMR」という巨大な新しいツールとともに登場します。彼らは、これらの複雑な弦楽四重奏のスコアに特化した、史上初の専用トレーニングデータセットを構築しました。これは、古いスコアのすべてのスキャンされたページが、完璧なデジタルツインとペアになっている、巨大で完璧に整理された図書館のようなものです。彼らはただランダムに画像を集めたのではありません。スキャンされた画像とデジタル版が、あらゆる小さな点や線に至るまで完全に一致するように、数百時間をかけて手動でデジタル版を修正したのです。
この新しいライブラリを手に入れた研究者たちは、コンピュータがどのように学習するかを見るために、2つの異なる「ロボット読者」(コンピュータモデル)をテストしました。彼らは、コンピュータが一度にページ全体を飲み込もうとするのではなく、一度に一つの楽器のラインを読み取るように教えたとき、最もよく学習することを発見しました。また、音楽がデジタルでどのように書き記されているかが、ロボットの脳のデザインよりも重要であることも発見しました。最も優れた結果は、「LMXE」と呼ばれる特定のフォーマットで得られ、クリーンなコンピュータ生成画像でわずか3.6%、実際のスキャンされたページで5.9%という非常に低いエラー率を達成しました。これは、コンピュータに複雑な四重奏の音楽を読ませることが間違いなく可能であることを証明していますが、同時に、古紙のスコアの乱雑で不完全な現実に対処するには、まだ改善の余地が多分にあることも示しています。
大きな構図:彼らが何を行い、何を見出したか
研究者たちは、弦楽四重奏のためのコンピュータ認識を支援するために特別に設計された最初のデータセットであるOSSQ-OMRを作成しました。以前は、ほとんどのコンピュータビジョンツールは、単純な単一ラインの歌やピアノ曲のために訓練されていました。弦楽四重奏は、4つの独立した声部が同時に演奏し、レイアウトが複雑であったり、異なる音部記号を用いたり、出版社によって筆跡が大きく異なったりするため、はるかに困難です。
このデータセットを構築するために、チームは既存の116の弦楽四重奏のデジタルスコアからスタートしました。次に、彼らはIMSLPライブラリから、これらのスコアのオリジナルのスキャン版を探し出しました。ここが難しい点ですが、オリジナルのデジタルファイルがスキャン版と完全に一致しないことがありました。小節が欠けていたり、記号が間違った場所にあったりしたのです。著者たちは、デジタルファイルを視覚的にスキャン画像と同一にするために、100時間以上を手動での編集に費やしました。彼らはまた、データを2つのレベル、すなわちシステムレベル(全4楽器を含む音楽のライン全体)とスタッフレベル(単一の楽器のラインのみ)に整理しました。最後に、音楽をLMXE、kern、ABCという3つの異なるデジタルテキスト形式に変換しました。
このデータセットは膨大です。116のスコアから派生した24,544のシステム画像と98,172のスタッフ画像が含まれています。画像のおよそ半分は合成(クリーンなコンピュータ生成バージョン)であり、もう半分は実物の古い本からスキャンされたものです。
このデータセットが実際に役立つかどうかをテストするために、研究者たちは「ベンチマーク」、つまりコンピュータモデルのための標準化された試験を設定しました。彼らは2つの人気のあるAIモデルをテストしました:
- Zeus: 古い逐次処理(LSTM)に基づいたモデル。
- SMT: モダンなチャットボットの背後にある技術(Transformerアーキテクチャ)を使用した、より新しいモデル。
彼らは、どの組み合わせが最適に機能するかを見るために、さまざまな設定を使用してこれらのモデルをこのデータセットで走らせました。以下にその結果を示します:
- 一度に一行ずつ読む方が優れている: モデルは、ページ全体を一度に読む(システムレベル)よりも、一つの楽器のスタッフだけを読み取る(スタッフレベル)ように求められたとき、大幅に高いパフォーマンスを示しました。ページ全体を読むことでコンピュータはより多くのコンテキスト(他の楽器が何をしているかなど)を得られますが、モデルはその追加情報をミスを減らすために活用できていないようでした。実際には、単一のラインに集中したときの方がエラー率は低くなりました。
- 脳よりもフォーマットが重要: 研究者たちは、音楽をテキストトークン(コンピュータが読む「言葉」)に変換する9つの異なる方法をテストしました。その結果、どのモデルを使用しても、LMXEフォーマットが一貫して最良の結果をもたらすことがわかりました。驚くべきことに、新しいTransformerモデル(SMT)は、もともとkern用に設計されていたにもかかわらず、LMXEよりもkernフォーマットにおいて成績が悪化しました。
- 圧縮は役に立たなかった: 彼らは、共通の文字をグループ化してテキストを短縮する手法である「バイトペアエンコーディング(BPE)」をABCフォーマットに適用しました。これが役立つのではないかと期待しましたが、実際には結果を悪化させました。圧縮の語彙サイズが大きくなるにつれて、エラー率が上昇しました。
- 現実世界 vs クリーンなデータ: モデルは、乱雑なスキャン画像(エラー率約5.9%)よりも、クリーンな合成画像(エラー率わずか3.6%)でる高いパフォーマンスを示しました。これは予想通りであり、スキャン画像にはノイズ、影、インクのムラがあるためです。しかし、古いスタイルのLSTMモデル(Zeus)は、新しいTransformerモデル(SMT)よりも、この乱雑さに対して頑健(ロバスト)でした。クリーンなデータからスキャンされたデータに切り替えたとき、Zeusのパフォーマンスは約39%低下しましたが、SMTのパフォーマンスは、なんと100%低下しました。
論文では、別のデータセットで訓練された外部モデルであるLegatoについてもテストしています。彼らがこの新しい弦楽四重奏のデータに対して、再学習なしでLegatoを使用しようとしたところ、結果は悲惨でした(合成データで36%以上、スキャンデータで66%のエラー率)。これは、モデルを一般的な音楽データで事前学習させるだけでは不十分であり、読ませたい種類の音楽に特化して訓練する必要があることを示唆しています。
結論として、著者たちは、コンピュータに複雑な弦楽四重奏のスコアを読ませることは可能であるが、適切なデータと、そのデータの適切なフォーマット方法が必要であることを示しています。彼らが見出した最良の設定は、合成データで3.6%、スキャンされたデータで**5.9%**のエラー率を達成しました。これは素晴らしいスタートですが、論文は、これらのシステムを、現実世界の、乱雑で美しい混沌とした楽譜を読む上で人間と同じくらい上手くするための作業が、まだ多く残されていることを示唆しています。また、彼らは将来の研究において、さらに大規模なアンサンブル(フルオーケストラなど)を対象とし、分割せずにページ全体を一度に読むことができるモデルを構築すべきであるとも示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。