← 최신 논문
💻 computer science

A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores

이 논문은 다성부 현악 4중주 악보의 광학 악보 인식(OMR)을 위한 최초의 데이터셋이자 벤치마크인 OSSQ-OMR을 소개하며, 이는 인코딩, 세그멘테이션 및 모델 아키텍처가 인식 정확도에 미치는 영향을 강조하는 베이스라인 평가와 함께 다양한 형식의 정렬된 이미지 및 전사 데이터를 122,000개 이상 포함하고 있습니다.

원저자: Dongmin Kim, Brian Liu, Jose J. Valero-Mas, Dasaem Jeong

게시일 2026-08-12
📖 5 분 읽기🧠 심층 분석

원저자: Dongmin Kim, Brian Liu, Jose J. Valero-Mas, Dasaem Jeong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 세상에서 가장 아름다운 손으로 쓴 레시피를 구하려는 사서라고 상상해 보세요. 하지만 종이와 잉크 대신, 이 레시피들은 악보 위의 음표로 기록되어 있습니다. 수십 년 동안 컴퓨터는 단순한 단선 멜로디(예를 들어 독주 플루트 연주자의 파트)를 읽는 데 꽤 능숙해졌습니다. 컴퓨터는 음악 이미지를 보고 이를 컴퓨터가 재생할 수 있는 디지털 파일로 변환할 수 있습니다. 이 분야를 광학 악보 인식(OMR)이라고 부릅니다. 이것은 로봇에게 악보를 읽는 법을 가르쳐서, 로봇이 그 선율을 다시 노래하거나 음악가의 연습을 돕도록 만드는 것과 같습니다.

하지만 여러 악기가 동시에 연주하는 음악을 읽으려고 하면 상황이 복잡해집니다. 현악 4중주를 상상해 보세요. 네 개의 서로 다른 악기(바이올린 두 대, 비올라 하나, 첼로 하나)가 동시에 네 개의 서로 다른 선율을 연주하며 한 페이지에 빽빽하게 담겨 있습니다. 이는 음표들이 서로 교차하고, 악기마다 다른 기호가 사용되며, 수 세기 전의 엉망인 필체가 섞여 있는 시각적인 퍼즐입니다. 그때까지 컴퓨터는 이러한 "다성부(multi-part)" 음악을 처리하는 데 어려움을 겪었습니다. 왜냐하면 제대로 학습할 수 있는 연습 세트가 없었기 때문입니다. 이는 마치 학생에게 복잡한 소설을 읽게 하려는데, 정작 연습은 단문 형태의 플래시카드만으로 시키는 것과 같습니다.

여기서 새로운 연구팀이 OSSQ-OMR이라는 거대한 새로운 도구와 함께 등장합니다. 그들은 현악 4중주의 복잡한 악보를 인식하도록 특별히 설계된 최초의 전용 학습 데이터셋을 구축했습니다. 이것은 마치 아주 잘 정리된 거대한 도서관과 같아서, 스캔된 모든 오래된 악보 페이지가 완벽한 디지털 쌍둥이와 짝을 이루고 있습니다. 그들은 단순히 무작위 사진을 가져온 것이 아닙니다. 그들은 모든 작은 점과 선 하나까지도 오래된 스캔본과 디지털 버전이 정확히 일치하도록 수백 시간을 들여 수동으로 수정했습니다.

이 새로운 도서관을 손에 넣은 연구진은 두 가지 다른 "로봇 독자"(컴퓨터 모델)를 테스트하여 얼마나 잘 학습하는지 확인했습니다. 그들은 로봇이 페이지 전체를 한꺼번에 삼키려 하기보다, 한 번에 하나의 악기 라인을 읽도록 가르쳤을 때 가장 잘 학습한다는 것을 발견했습니다. 또한 음악이 디지털로 기록되는 방식이 로봇의 뇌 구조보다 더 중요하다는 것도 발견했습니다. 가장 좋은 결과는 LMXE라는 특정 형식을 사용했을 때 나타났으며, 이는 깨끗한 컴퓨터 생성 이미지에서 단 3.6%, 실제 스캔 페이지에서 5.9%라는 매우 낮은 오류율을 달ino었습니다. 이는 컴퓨터가 복잡한 4중주 음악을 읽는 것이 확실히 가능하다는 것을 증명하지만, 동시에 특히 오래된 종이 악보의 지저도 있고 불완전한 현실을 다룰 때 개선할 여지가 여전히 많다는 것을 보여줍니다.

큰 그림: 그들이 한 일과 발견한 것

연구진은 현악 4중주를 위한 음악 인식을 돕기 위해 특별히 설계된 최초의 데이터셋인 OSSQ-OMR을 만들었습니다. 이 전에는 대부분의 컴퓨터 비전 도구가 단순한 단선 곡이나 피아노 음악을 위해 훈련되었습니다. 현악 4중주는 네 개의 독립적인 성부가 동시에 연주되고, 복잡한 레이아웃, 서로 다른 음자리표, 그리고 출판사마다 판이하게 다른 필체를 포함하기 때문에 훨씬 더 어렵습니다.

이 데이터셋을 구축하기 위해 팀은 기존의 디지털 현악 4중주 악보 116개를 시작점으로 삼았습니다. 그런 다음 IMSLP 라이브러리에서 이 악보들의 원본 스캔 버전을 찾아냈습니다. 여기서 까다로운 점은 원본 디지털 파일이 스캔본과 항상 완벽하게 일치하지는 않는다는 것이었습니다. 때로는 마디가 누락되기도 하고, 기호가 잘못된 위치에 있기도 했습니다. 저자들은 디지털 파일이 시각적으로 스캔 이미지와 동일하게 보이도록 100시간 이상 수동으로 편집하는 데 시간을 보냈습니다. 또한 데이터를 두 가지 수준으로 구성했습니다: 시스템 수준(네 개의 악기가 모두 포함된 전체 음악 라인)과 스태프 수준(하나의 악기 라인만 포함). 마지막으로, 그들은 음악을 LMXE, kern, ABC라는 세 가지 다른 디지털 텍스트 형식으로 변환했습니다.

이 데이터셋은 방대합니다. 116개의 악보로부터 파생된 24,544개의 시스템 이미지98,172개의 스태프 이미지를 포함하고 있습니다. 이미지의 약 절반은 합성된(깨끗한 컴퓨터 생성 버전) 것이고, 나머지 절반은 실제 오래된 책을 스캔한 것입니다.

이 데이터셋이 실제로 도움이 되는지 테스트하기 위해 연구진은 "벤치마크", 즉 컴퓨터 모델을 위한 표준화된 시험을 설정했습니다. 그들은 두 가지 인기 있는 AI 모델 유형을 테스트했습니다:

  1. Zeus: 오래된 순차적 처리(LSTM) 기반의 모델.
  2. SMT: 현대적인 챗봇 뒤에 있는 기술과 유사한 트랜스포머(Transformer) 아키텍처를 사용하는 최신 모델.

그들은 어떤 조합이 가장 잘 작동하는지 보기 위해 다양한 설정으로 이 모델들을 데이터셋에 실행했습니다. 결과는 다음과 같습니다:

  • 한 번에 한 줄씩 읽는 것이 더 낫다: 모델들은 페이지 전체를 한꺼번에 읽을 때(시스템 수준)보다 하나의 악기 스태프만 읽도록 요청받았을 때(스태프 수준) 성능이 현저히 향상되었습니다. 비록 전체 페이지를 읽는 것이 더 많은 문맥(다른 악기가 무엇을 하는지 보는 것 등)을 제공하지만, 모델들은 이 추가적인 정보를 오류를 줄이는 데 활용하지 못하는 것처럼 보였습니다. 사실, 모델이 단일 라인에 집중했을 때 오류율이 더 낮았습니다.
  • 뇌보다 형식이 더 중요하다: 연구진은 음악을 텍스트 토큰(컴퓨터가 읽는 "단어")으로 변환하는 아홉 가지 다른 방법을 테스트했습니다. 그들은 LMXE 형식이 어떤 모델을 사용하든 일관되게 가장 좋은 결과를 낸다는 것을 발견했습니다. 놀랍게도, 새로운 트랜스포머 모델(SMT)은 원래 kern을 위해 설계되었음에도 불구하고 LMXE보다 kern 형식에서 더 낮은 성능을 보였습니다.
  • 압축은 도움이 되지 않았다: 그들은 ABC 형식에 대해 흔한 문자를 그룹화하여 텍스트를 줄이는 방법인 "바이트 쌍 인코딩(BPE)"을 사용해 보았습니다. 그들은 이것이 도움이 될 것이라 예상했지만, 오히려 결과가 더 나빠졌습니다. 압축을 위한 어휘 크기가 커질수록 오류율은 올라갔습니다.
  • 실제 데이터 vs 깨끗한 데이터: 모델들은 지저분한 스캔 이미지(오류율 약 5.9%)보다 깨끗한 합성 이미지(오류율 최소 3.6%)에서 훨씬 더 좋은 성능을 보였습니다. 이는 스캔 이미지가 노이즈, 그림자, 고르지 못한 잉크를 가지고 있기 때문에 당연한 결과입니다. 그러나 구형 스타일의 LSTM 모델(Zeus)이 최신 트랜스포머 모델(SMT)보다 이러한 지저분함에 더 강건(robust)했습니다. 깨끗한 데이터에서 스캔 데이터로 전환될 때, Zeus의 성능은 약 39% 하락한 반면, SMT의 성능은 무려 100%나 급락했습니다.

연구진은 Legato라는 외부 모델도 테스트했습니다. 다른 데이터셋으로 훈련된 이 모델을 이 새로운 현악 4중주 데이터에 적용했을 때, 재학습 없이 사용하자 결과는 처참했습니다(합성 데이터에서 36% 이상의 오류율, 스캔 데이터에서 66%의 오류율). 이는 일반적인 음악 데이터로 모델을 사전 훈련하는 것만으로는 충분하지 않으며, 읽고자 하는 유형의 음악에 맞춰 특별히 훈련시켜야 한다는 것을 시사합니다.

결론적으로, 저자들은 컴퓨터에게 복잡한 현악 4중주 악보를 읽히는 것이 가능하다는 것을 보여주었지만, 이를 위해서는 적절한 데이터와 데이터를 포맷팅하는 올바른 방법이 필요하다는 것을 보여주었습니다. 그들이 발견한 최상의 설정은 합성 데이터에서 3.6%, 스캔 데이터에서 **5.9%**의 오류율을 달성했습니다. 이는 훌륭한 시작이지만, 논문은 실제 세상의 지저분하고 아름다운 혼돈인 악보를 읽는 데 있어 시스템을 인간만큼 능숙하게 만들기 위해 여전히 많은 작업이 남아 있음을 시사합니다. 또한 그들은 향후 연구가 더 큰 규모의 앙상블(예: 풀 오케스트라)을 다루어야 하며, 먼저 조각내지 않고도 전체 페이지를 한 번에 읽을 수 있는 모델을 구축하는 방향으로 나아가야 한다고 제언합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →