CultureMERT: Continual Pre-Training for Cross-Cultural Music Representation Learning
이 논문은 다양한 비서구적 전통을 대상으로 한 새로운 2단계 지속 사전 학습 전략을 통해 훈련되어, 서구적 벤치마크의 숙련도를 유지하면서도 교차 문화적 자동 태깅 성능을 유의미하게 향상시키고 태스크 산술(task arithmetic)을 통한 실행 가능한 대안을 제공하는 다문화 적응 음악 파운데이션 모델인 CultureMERT-95M을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
음악은 보편적인 언어이지만, 우리가 음악을 이해하기 위해 사용하는 컴퓨터들은 종종 단 하나의 방언만을 구사합니다. 수년 동안 음악을 듣고 분류하도록 설계된 가장 강력한 인공지능 모델들은 팝, 록, 클래식 교향곡과 같은 서구 양식에 거의 독점적으로 훈련되어 왔습니다. 이러한 시스템은 특정 전통의 패턴을 인식하는 데는 매우 뛰어나게 되었지만, 세계의 다른 다양한 음악 문화와 마주했을 때는 어려움을 겪습니다. 이들은 인도 클래식 음악의 미묘한 선율 구조, 터키 전통 음악의 독특한 리듬 주기, 또는 그리스 민속 음악의 뚜렷한 음계 등을 놓치곤 합니다. 이러한 한계는 자신의 음악적 유산이 서구적 정전(canon)에서 벗어나 있는 수십억 명의 사람들에게, 이 디지털 도구들이 그들의 공동체를 정의하는 예술을 보존하거나 추천하거나 분석할 수 없는 '눈먼' 상태로 남아 있음을 의미합니다.
연구자들은 모델을 처음부터 다시 구축하는—이는 비용이 지나치게 많이 들고 시간이 오래 걸리는 과정입니다—방법 없이, 모델이 더 넓게 들을 수 있도록 가르칠 방법을 오랫동안 모색해 왔습니다. 과제는 이미 한 세트의 규칙을 학습한 모델이 자신이 이미 알고 있던 것을 잊어버리게 만들지 않으면서, 완전히 다른 규칙을 이해하도록 적응시키는 것입니다. 이것이 바로 'CultureMERT'라는 시스템을 소개하는 새로운 연구가 다루는 핵심 문제입니다. 연구진은 주로 서구 음악으로 구성된 천 시간의 오디오 데이터로 훈련된 파운데이션 모델을 가져와서, 그 모델이 원래 알고 있던 서구 양식을 인식하는 능력을 잃지 않도록 보장하면서도 동부 지중해와 인도 아대륙의 음악적 언어를 이해하도록 부드럽게 유도하는 것을 목표로 했습니다.
이를 달려, 연구팀은 '연속 사전 훈련(continual pre-training)'이라고 알려진 전략을 채택했습니다. 기존 모델을 버리고 새로 시작하는 대신, 그들은 모델에게 새롭고 정교하게 균형 잡힌 오디오 데이터라는 식단을 제공했습니다. 이 새로운 데이터셋은 터키의 마캄(makam), 힌두스타니 클래식, 카르나틱 클래식, 그리고 그리스 전통 음악이라는 네 가지 뚜렷한 전통에서 추출한 650시간의 음악을 포함했습니다. 그러나 단순히 이 새로운 데이터를 모델에 주입하는 것만으로는 모델이 비틀거리는 현상, 즉 컴퓨터가 새로운 것을 배우려고 시도할 때 기존 작업에 대한 성능이 급락하는 현상을 초래했습니다. 이를 해결하기 위해 연구진은 2단계 접근 방식을 고안했습니다. 첫 번째 단계에서는 모델의 가장 복잡한 내부 계층들을 고정(frozen)한 채로 새로운 음악의 적은 부분만을 도입하여, 기본적인 소리 처리 부분만이 조정되도록 했습니다. 또한 이 단계에서 모델에게 원래의 훈련 내용을 상기시키기 위해 소량의 서구 음악을 함께 섞었습니다. 두 번째 단계에서는 모델 전체의 잠금을 해제하고 650시간의 전체 데이터셋에 대해 훈련시켜, 모델이 이러한 새로운 문화적 뉘앙스를 완전히 통합할 수 있도록 했습니다.
결과는 놀라웠습니다. 비서구 음악의 악기, 분위기 또는 특정 음악적 양식을 식별하는 작업에 대해 테스트했을 때, 적응된 모델은 기존 버전보다 평균적으로 거의 5% 높은 정확도 향상을 보였습니다. 결정적으로, 이러한 이득은 이전 지식을 희생하며 얻은 것이 아니었습니다. 모델은 서구 음악을 인식하는 능력을 거의 성능 저하 없이 그대로 유지했습니다. 연구는 또한 여러 개의 작은 모델(각각 하나의 문화에 대해 훈련된 모델)의 '지식'을 하나의 통합된 시스템으로 수학적으로 결합하는 '태스크 아리드메틱(task arithmetic)'이라는 다른 방법론을 탐구했습니다. 이 방식은 비서구 작업에서 직접 훈련하는 방식만큼 잘 수행되었으며, 심지어 서구 벤치마크에서는 이를 능가하기도 했는데, 이는 전문화된 모델들을 병합하는 것이 모두를 한꺼번에 재훈련하는 것보다 강력한 대안임을 시사합니다.
연구진은 문화 간 지식 전이 능력이 균일하지 않다는 것을 발견했습니다. 예를 들어, 인도 남부의 카르나틱 음악으로 훈련된 모델은 북인도의 힌두스탄 음악은 물론 터키 전통 음악에도 강력한 일반화 능력을 보여주었는데, 이는 이 시스템들이 멜로디와 리듬의 측면에서 깊은 이론적 뿌리를 공유하기 때문인 것으로 보입니다. 반면, 모델은 그리스 전통 음악으로 지식을 전이하는 데 더 어려움을 겪었는데, 이 음악은 독특하면서도 컴퓨터가 소리를 인코딩하는 방식에 있어 인도 및 터키 데이터셋과는 구조적 유사성을 적게 공유했기 때문입니다. 팀은 모델이 소리를 표현하기 위해 사용하는 디지털 '토큰'을 분석함으로써, 이러한 음악적 전통들 사이의 수학적 거리가 모델이 이를 얼마나 잘 학습할지를 예측한다는 것을 발견했으며, 이는 향-훈련 데이터를 계획하는 새로운 방법을 제시했습니다.
궁극적으로, 이 연구는 인공지능이 핵심 역량을 희생하지 않고도 어떻게 더 포용적으로 만들어질 수 있는지를 보여줍니다. 연구진은 적응된 모델인 CultureMERT를 대중에게 공개하여, 세계의 음악을 훨씬 더 넓은 귀로 들을 수 있는 도구를 제공했습니다. 그들은 자신들의 모델이 중요한 진전이지만 완벽한 해결책은 아니라는 점을 인정합니다. 소리를 디지털 토큰으로 변変換하는 데 사용되는 기초 기술이 여전히 서구 음악을 기반으로 훈련되었기에, 특정 문화적 미묘함을 얼마나 깊이 파악할 수 있는지에 한계가 있을 수 있기 때문입니다. 그럼에도 불구하고, 모델이 이전의 것을 기억하면서 새로운 음악적 언어를 배울 수 있음을 보여줌으로써, 이 연구는 디지털 음악 시스템이 진정으로 글로벌해져서 인간의 음악적 표현의 전체 스펙트럼을 기릴 수 있는 미래를 향한 명확한 경로를 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.