Genre Classification of Saint Yared Qum Zema Using a Convolutional Neural Network
본 연구는 1,555개의 오디오 세그먼트를 스펙트로그램 이미지로 변환함으로써 성 야레드(Saint Yared)의 에티오피아 성가(Qum Zema) 세 가지 장르를 분류하는 데 있어 ResNet, VGGNet, AlexNet과 같은 기존 아키텍처보다 우수한 성능을 보이며 88%의 테스트 정확도를 달성한 맞춤형 합성곱 신경망(CNN) 모델을 제시한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
음악은 언제나 단순한 소리 그 이상이었습니다. 수 세기 동안 음악은 역사, 신앙, 그리고 정체성을 담는 그릇 역할을 해왔습니다. 현대 과학의 영역에서 연구자들은 컴퓨터에게 듣는 법을 가르치는 방법을 개발해 왔으며, 이 분야를 음악 정보 검색(Music Information Retrieval)이라고 부릅니다. 이 학문은 인간의 귀가 자연스럽게 수행하는 일, 즉 패턴을 인식하고, 악기를 식별하며, 노래를 재즈, 록, 클래식과 같은 범주로 분류하는 일을 기계에게 요구합니다. 컴퓨터는 방대한 서구 음악 라이브러리를 분석하는 데 매우 능숙해졌지만, 오직 인간의 목소리에만 의존하는 독특하고 전통적인 형태에는 종종 어려움을 겪습니다. 악보나 악기 없이 세대를 거쳐 전해 내려온 이 고대의 전통들은 특별한 과제를 안겨줍니다. 그 소리는 미묘하고, 그 변주는 섬세하며, 이를 가르칠 수 있는 사람의 수가 줄어들고 있기에 그 보존이 시급합니다.
에티오피아에서는 에티오피아 정교회 테와헤도(Ethiopian Orthodox Tewahedo) 교회가 제마(Zema)라고 알려진 신성한 음악 전통을 수호하고 있습니다. 이는 6세기에 성스러운 학자이자 당대의 음악 교수 총장으로 추앙받는 성 야레드(Saint Yared)에 의해 구성된 영적 찬양의 한 형태입니다. 성 야레드는 이 찬양들을 기즈(Geez), 에질(Ezil), 아라라이(Araray)라는 세 가지 뚜렷한 양식으로 정리했습니다. 이 찬양들이 어떤 악기도 사용하지 않고 오직 인간의 목소리로만 수행될 때, 이를 쿰 제마(Qum Zema)라고 부릅니다. 수 세기 동안 이 세 가지 양식을 구별하는 지식은 교회 학교 내 소수의 전문 학자들의 마음속에 살아있었습니다. 그러나 전문가의 수가 감소하고 일반 대중이 이 양식들을 구별하는 데 어려움을 겪으면서, 이 미묘한 예술이 상실되거나 오해받을 위험이 있습니다. 연구자들의 과제는 현대 기술이 숙련된 학자만큼 명확하게 이러한 차이를 들을 수 있는지 여부였습니다.
데브레 마르코스 대학교(Debre Markos University)의 연구팀은 성 야레드의 쿰 제마의 세 가지 장르를 인식하도록 설계된 컴퓨터 모델을 구축함으로써 이 질문에 답하기 위해 나섰습니다. 그들은 특정 음표나 리듬과 같은 음악의 규칙을 수동으로 나열하여 컴퓨터를 가르치려 하지 않았습니다. 대신, 그들은 이미지를 보는 방식으로 학습하도록 설계된 시스템인 합성곱 신경망(convolutional neural network)이라는 일종의 인공지능을 사용했습니다. 이를 실행하기 위해 연구자들은 먼저 찬양의 소리를 컴퓨터가 볼 수 있는 무언가로 변환해야 했습니다. 그들은 음성 공연 녹음물을 짧은 10초 단위의 클립으로 나누었습니다. 각 클립은 이후 스펙트로그램(spectrogram)으로 변환되었는데, 이는 소리의 피치(pitch)와 볼륨이 시간에 따라 어떻게 변하는지를 보여주는 시각적 지도입니다. 이 지도에서 가로축은 시간을, 세로축은 피치를 나타내며, 색상의 밝기는 특정 순간에 소리가 얼마나 큰지를 보여줍니다.
연구진은 전통 교회 학교의 학자들로부터 총 1,555개의 이러한 10초 길이 오디오 클립을 수집했습니다. 그들은 배경 소음을 제거하여 녹음 상태를 깨끗하게 유지한 후, 모든 클립을 스펙트로그램 이미지로 변환했습니다. 이 이미지 모음은 그들의 새로운 모델을 위한 학습 데이터가 되었으며, 연구진은 이 모델을 '성 야레드의 쿰 제마 분류기(Saint Yared's Qum Zema Classifier)'라고 명명했습니다. 시스템에는 이 이미지들이 입력되었고, 기즈, 에질, 아라라이 양상에 상응하는 시각적 패턴을 학습하도록 요청되었습니다. 시스템이 실제로 학습하고 있는지 테스트하기 위해, 연구진은 데이터를 분할하여 70%의 이미지는 모델을 가르치는 데 사용하고, 나머지 30%는 모델이 한 번도 본 적 없는 음악에 대해 얼마나 잘 수행하는지 확인하기 위해 남겨두었습니다.
결과는 컴퓨터가 실제로 이 고대 보컬 양식들을 구별하는 법을 배울 수 있음을 보여주었습니다. 모델이 보지 못한 오디오 클립에 대해 테스트했을 때, 88%의 확률로 장르를 정확히 식별해 냈습니다. 세 가지 양식이 서로 매우 유사하고, 청자의 이해를 돕는 악기 도움 없이 노래된다는 점을 고려할 때 이는 상당한 성과였습니다. 연구진은 자신들이 직접 만든 모델을 ResNet, VGGNet, AlexNet과 같이 이미지 인식용으로 설계된 몇몇 유명한 컴퓨터 시스템들과 비교했습니다. 이러한 다른 시스템들은 더 크고 더 많은 컴퓨팅 능력을 필요로 했지만, 이 특정 작업에서는 성능이 더 떨어졌습니다. 커스텀 모델은 다른 시스템들보다 더 높은 정확도를 달면서도 훨씬 작고 빠르게 실행되었습니다.
연구는 또한 컴퓨터 모델 내의 서로 다른 설정이 학습 능력에 어떤 영향을 미치는지 탐구했습니다. 그들은 정보를 처리하는 특정한 방식인 ReLU 활성화 함수(activation function)가 다른 방법들보다 모델이 패턴을 더 효과적으로 학습하도록 돕는다는 것을 발견했습니다. 전체 과정은 소리를 그림으로 바꿈으로써 컴퓨터가 인간에게 규칙을 설명할 필요 없이 각 음악 양식의 고유한 '지문'을 찾을 수 있다는 아이디어에 기반했습니다. 연구진은 데이터셋이 유사성이 높은 보컬 사운드만을 포함하고 있어 작업 자체가 본질적으로 어렵다는 점이 모델의 성능을 제한했다고 언급했지만, 88%의 성공률은 딥러닝이 무형의 문화적 보물을 보존하는 강력한 도구가 될 수 있음을 입증했습니다.
이 연구는 성 야레드의 음악적 유산을 보호하기 위한 실질적인 길을 제시합니다. 이 찬양들을 자동으로 분류할 수 있는 도구를 만듦으로써, 연구진은 새로운 학자들을 교육하고 기즈, 에질, 아라라이 사이의 구분이 시간 속에 사라지지 않도록 지원하는 방법을 제공했습니다. 이 연구는 작업이 복잡할지라도 전통적 지식과 현대적 머신 러닝의 결มี 과거와 미래 사이의 간극을 메울 수 있음을 시사합니다. 연구진은 더 많은 데이터를 수집하고 시스템을 더욱 정확하게 만드는 방법을 탐구하며 이 작업을 계속할 계획이지만, 초기 성공은 컴퓨터가 새로운 종류의 이해를 바탕으로 에티오피아의 신성한 노래를 들을 수 있도록 학습될 수 있음을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.