← 최신 논문
💻 computer science

Towards a foundational model for recognising diastematic Gregorian notation

본 논문은 이전에 서로 분리되어 있던 네 가지 데이터셋을 공통된 S-GABC 인코딩으로 통합함으로써, 이들 모두에서 새로운 최우수 성능(state of the art)을 확립하며 디아스테마틱 그레고리안 기보를 인식하기 위한 파운데이션 모델을 제안한다.

원저자: Daniel Kurek, Jan Hajič jr

게시일 2026-07-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Daniel Kurek, Jan Hajič jr

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 거대한 고대 음악 필사본 도서관이 있다고 상상해 보세요. 이것들은 단순한 노래가 아닙니다. 이들은 가톨릭 교회의 신성한 음악인 **그레고리오 성가(Gregorian chants)**이며, 1,000년 전의 기록입니다. 이 필사본들은 아름답지만, 전문가들에게조차 읽기가 매우 까다롭습니다.

오랫동안 컴퓨터는 이 손으로 쓴 페이지들을 자동으로 읽는 법(광학 악보 인식, OMR)을 배우기 위해 노력해 왔습니다. 하지만 큰 문제가 하나 있었습니다. 바로 컴퓨터들이 서로 다른 언어를 말하고 있었다는 점입니다.

문제점: 하나의 언어 속에 존재하는 네 가지 방언

연구진이 사용한 네 가지 데이터셋을 같은 그림을 설명하려고 하는 네 그룹의 사람이라고 생각해 보세요.

  • 그룹 AGABC라고 불리는 특정 코드를 사용하여 그림을 설명합니다.
  • 그룹 B는 약간 다른 코드인 Pseudo-GABC를 사용합니다.
  • 그룹 CS-GABC를 사용합니다.
  • 그룹 D는 또 다른 변형을 사용합니다.

이들은 모두 정확히 같은 종류의 음악(음표와 가사)을 설명하고 있지만, 그 설명의 "철자"는 달랐습니다. 이는 마치 로봇에게 개를 인식하도록 가르치려는데, 한 사람은 "캐닌(canine)"이라 부르고, 다른 사람은 "푸치(pooch)"라 부르며, 또 다른 사람은 비밀 코드를 사용하는 것과 같았습니다. 설명 방식이 일치하지 않았기 때문에, 연구진은 모든 데이터를 결합하여 로봇에게 더 나은 레슨을 제공할 수 없었습니다. 그들은 하나의 거대하고 똑똑한 뇌를 만드는 대신, 네 개의 별개인 작은 뇌를 훈련시키는 데 갇혀 있었습니다.

해결책: 보편적 번역기

다니엘 쿠렉(Daniel Kurek)과 얀 하이칙 주니어(Jan Hajič jr.)는 보편적 번역기를 구축하기로 했습니다.

  1. 엉망이 된 데이터 정리하기: 먼저, 그들은 일부 데이터에 "노이즈"가 있다는 것을 깨달았습니다. 픽셀 단위까지 동일한 두 장의 노래 사진이 있다고 상상해 보세요. 만약 컴퓨터가 똑같은 사진을 두 번 보게 된다면 혼란에 빠질 것입니다. 그들은 디지털 "지우개"를 사용하여 이러한 중복 복사본을 제거하고 모든 데이터가 고유하도록 보장했습니다.
  2. 공통 언어: 그들은 S-GABC라는 제안된 방식을 기반으로 새로운 공유 코드를 설계했습니다. 그들은 네 가지 서로 다른 데이터셋을 모두 이 단일화된 통합 언어로 번역했습니다. 이제 네 가지 서로 다른 방언 대신, 모두가 같은 언어를 말하게 되었습니다.
  3. "파운데이션 모델(Foundational Model)": 모든 데이터가 같은 언어를 사용하게 되자, 그들은 전체 컬렉션에 대해 단 하나의 강력한 AI 모델(DAN)을 훈련시켰습니다. 이것은 네 개의 서로 다른 지역에서 온 레시피를 맛보고 그 모든 것을 완벽하게 요리하는 법을 배운 마스터 셰프와 같습니다. 단순히 한 지역의 요리만 배우는 것이 아닙니다.

결과: 새로운 최고 수준(State of the Art) 달성

그들이 이 새로운 "마스터 셰프" 모델을 테스트했을 때:

  • 이전의 시도들보다 더 빠르고 더 잘 학습했습니다.
  • 이 마스터 모델을 가져와서 특정적으로 어려운 데이터셋에 대해 추가적인 연습(미세 조정, fine-tuning)을 시키자, 모델은 더욱 날카로워졌습니다.
  • 거의 모든 테스트에서, 이 새로운 접근 방식은 이전의 최고 기록들을 경신했습니다. 음표, 가사, 그리고 가사를 알맞은 음표에 매칭하는 과정에서 실수를 훨씬 적게 범했습니다.

이 연구가 중요한 이유 (논문에 따르면)

논문은 이 서로 다른 데이터셋들을 통합함으로써, 자신들이 파운데이션 모델을 만들었다고 주장합니다. 이는 그들이 그레고리오 성가 표기법을 그 어느 때보다 더 잘 이해하는 강력하고 범용적인 AI를 구축했음을 의미합니다.

매번 다른 필사본 양식마다 별도의 컴퓨터 프로그램을 만들 필요 없이, 이제 다양한 시각적 스타일을 처리할 수 있는 하나의 견고한 도구를 갖게 되었습니다. 이는 여전히 존재하는 수천 권의 필사본을 디지털화하고 연구하는 것을 훨씬 쉽게 만들어 주며, 읽을 수 없는 고대의 잉크를 검색 가능한 디지털 음악으로 바꿔줍니다.

요약하자면: 그들은 서로 다른 방언을 사용하는 네 그룹의 사람들을 데려와서, 그들이 모두 같은 언어를 말하도록 가르친 뒤, 그 결합된 집단에 대해 아주 똑똑한 학생을 훈련시킨 것입니다. 그 결과는 무엇일까요? 그 학생은 그 누구보다도 더 잘 고대 음악을 읽을 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →