MusPyExpress: Extending MusPy with Enhanced Expression Text Support
MusPyExpress는 MusicXML 데이터셋으로부터 템포 및 다이내믹스와 같은 표현 텍스트를 추출하고 활용할 수 있게 함으로써, 음표-표현 결합 생성 및 표현 조건부 음악 합성과 같은 새로운 생성 작업을 용이하게 하여 상징적 음악 모델링의 간극을 메우는 MusPy 라이브러리의 확장 기능입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
음악은 두 개의 서로 다른 세계에 존재합니다. 하나는 우리가 듣는 소리, 즉 방 안을 채우는 유동적인 파동의 흐름입니다. 다른 하나는 음악가들이 그 소리를 만들기 위해 사용하는 지침서, 즉 악보라고 알려진 정적인 기호의 페이지입니다. 수십 년 동안 컴퓨터는 첫 번째 세계, 즉 오디오를 데이터로 변환하는 일에는 매우 능숙했지만, 두 번째 세계를 다루는 데는 어려움을 겪어 왔습니다. 연구자들이 컴퓨터에게 음악을 이해하거나 창작하도록 가르치려 할 때, 그들은 MIDI라는 디지털 형식을 사용했습니다. 이 형식은 컴퓨터에게 어떤 음을 언제 연주할지 알려주는 데는 탁м 뛰어나지만, 마치 로봇 피아니스트를 위한 정밀한 명령 목록처럼 작동합니다. 그러나 이 목록에는 결정적인 인간적 뉘앙스가 빠져 있습니다. 그것은 기계에게 음을 알려주지만, 인간 연주자가 그 음을 어떻게 느껴야 하는지를 알려주는 감정적 지침은 남겨두지 않습니다.
서양 악보에서 작곡가들은 음 사이의 공간을 연주를 안내하는 단어와 기호들로 채웁니다. 이것들은 단순한 제안이 아니라 속도, 음량, 스타일에 관한 구체적인 명령입니다. 작곡가는 느리게 연주하라는 의미로 "adagio"라고 적거나, 점진적인 음량 증가를 나타내기 위해 "crescendo"라고 적을 수 있습니다. 또한 특정 섹션을 날카롭고 끊어지는 터치로 연주하거나 부드럽고 연결된 흐름으로 연주하도록 표시할 수도 있습니다. '표현 텍스트(expression text)'라고 불리는 이러한 지침들은 음의 배열을 살아 숨 쉬는 예술 작품으로 바꾸는 로드맵입니다. 지금까지 컴퓨터에게 음악을 가르치기 위한 표준 도구들은 대체로 이 로드맵을 무시해 왔으며, 음만을 유일하게 중요한 것으로 취급해 왔습니다. 이러한 간극은 컴퓨터가 멜로디를 생성할 수는 있지만, 음악을 인간답게 느껴지게 만드는 분위기, 긴장감, 또는 역동적인 형태를 쉽게 생성할 수 없음을 의미했습니다.
한 연구팀은 MusPyExpress라는 새로운 도구를 개발하여 이러한 한계를 해결했습니다. 이 소프트웨어는 컴퓨터 과학자들이 음악 데이터를 처리하기 위해 사용하는 기존 라이브러리의 업그레이드 버전입니다. 이 새로운 시스템은 디지털 악보에 사용되는 형식인 MusicXML을 읽도록 설계되었는데, MusicXML은 기존의 MIDI 표준보다 훨씬 더 표현력이 풍부합니다. 이 확장을 구축함으로써, 연구자들은 템포 변화를 조절하는 속도 표시부터 음의 크기를 제어하는 역동성 기호에 이르기까지, 풍부하고 상세한 지침들을 추출하고 이해할 수 있게 되었습니다. 그들은 이러한 지침들을 단순한 주석이 아니라, 저장하고 분석하며 기계가 감정을 담아 작곡하는 법을 가르치는 데 사용할 수 있는 필수적인 데이터 포인트로 취급했습니다.
이 새로운 도구가 실제 음악의 복잡성을 처리할 수 있음을 증명하기 위해, 연구자들은 22만 개 이상의 파일을 포함하는 방대한 양의 퍼블릭 도메인 악보 모음을 활용했습니다. 연구자들은 MusPyExpress를 사용하여 이 라이브 library를 스캔했고, 이 곡들의 대다수인 95% 이상이 이러한 표현적 지침을 포함하고 있다는 것을 발견했습니다. 총 350만 개 이상의 개별적인 표식들이 이 컬렉션에서 식별되었습니다. 분석 결과, 이러한 지침들은 무작위로 흩어져 있는 것이 아니라 음악의 역사 자체를 반영하는 패턴을 따르고 있었습니다. 예를 들어, 연구자들은 19세기에 살았던 낭만주의 시대의 작곡가들이 초기 바로크나 고전주의 시대의 작곡가들보다 이러한 표현적 표식을 훨씬 더 빈번하게 사용했다는 것을 발견했습니다. 이는 낭만주의 작곡가들이 연주자를 안내하기 위해 구체적인 감정적 방향을 자주 작성했던 반면, 초기 작곡가들은 당대의 연주 관습에 더 의존했던 역사적 관행과 일치합니다.
또한 이 연구는 이러한 지침의 밀도가 곡의 진행에 따라 어떻게 달라지는지도 보여주었습니다. 노래를 섹션별로 나누는 연습 기호(rehearsal letters)와 같은 구조적 표식은 덜 자주 나타나며 간격이 넓습니다. 반면, 템포와 음량에 관한 지침은 매우 집중되어 나타날 수 있으며, 멜로디의 즉각적인 흐름을 형성하기 위해 빈번하게 등장합니다. 연구자들은 리스트나 드뷔시와 같은 특정 작곡가들이 악보에 이러한 세부 사항을 빽빽하게 채워 넣은 반면, 다른 이들은 이를 더 절제하여 사용했다는 점도 관찰했습니다. 이러한 표현 텍스트의 상세한 매핑은 표준 디지털 악보 안에 숨겨져 있는 감정적 데이터가 얼마나 많은지를 보여주는 첫 번째 명확한 그림을 제공했으며, 이 데이터는 이전에는 대부분의 컴퓨터 모델이 접근할 수 없었던 것이었습니다.
이 새로운 표현 텍스트를 읽고 이해하는 능력을 통해, 연구자들은 컴퓨터가 이 정보를 사용할 수 있는 세 가지 뚜렷한 방법을 시연했습니다. 첫째, 모델이 인간 작곡가가 악보를 쓰는 방식처럼 음과 표현 지침을 동시에 생성하는 법을 배울 수 있음을 보여주었습니다. 둘째, 특정 감정 지침을 바탕으로 음악을 생성하도록 시스템을 훈련시켜, 사용자가 "느리게, 크게, 그다음은 작게"와 같은 단어 시퀀스를 제공하면 컴퓨터가 그 분위기에 맞는 멜로디를 생성하게 할 수 있습니다. 이는 영화나 비디오 게임의 배경 음악을 만들 때 소리가 특정 서사적 흐름과 일치해야 하는 상황에서 유용할 수 있습니다. 셋째, 감정이 없는 평범한 음의 배열을 받아 적절한 표현 표식을 자동으로 추가하여, 가공되지 않은 멜로디에 결여되었던 감정적 맥락을 주석으로 달 수 있는 시스템을 테스트했습니다.
실험 결과, 컴퓨터가 이러한 표현적 지침을 부여받았을 때 음악을 생성하는 능력이 향상됨을 확인했습니다. 음과 표현 텍스트를 함께 생성하도록 학습하거나 표현 텍스트를 가이드로 사용하는 모델은, 음만을 고려하는 모델보다 인간의 음악적 패턴과 더 일치하는 결과를 만들어냈습니다. 연구자들은 가장 효과적인 접근 방식이 표현 지침을 해당 음을 생성하기 직전에 모델에 입력하는 것이었음을 발견했는데, 이를 통해 컴퓨터가 음악의 감정적 방향을 예측할 수 있게 됩니다. 모델이 인간의 연주가 가진 복잡성을 완벽하게 재현하지는 못했지만, 결과는 이러한 텍스트 지침을 포함하는 것이 컴퓨터가 곡의 구조와 느낌을 이해하는 데 상당한 도움이 된다는 것을 시사했습니다.
이 작업은 인공지능이 완벽한 음악을 만드는 문제를 해결했다고 주장하는 것도 아니며, 기계가 이제 인간 작곡가를 대체할 수 있다고 제안하는 것도 아닙니다. 대신, 이 연구는 컴퓨터가 음악 악보와 상호작나오는 방식에 대한 새로운 토대를 마련합니다. 표현의 층위를 해제함으로써, MusPyExpress는 연구자들이 구성의 전체 맥락을 인식하는 모델을 구축할 수 있게 해줍니다. 연구자들은 이 도구를 사용하여 현재 이러한 감정적 세부 사항이 부족한 기존의 대규모 음악 컬렉션에 주석을 달 계획이며, 이는 방대한 디지털 음악 라이브러리에 새로운 수준의 표현력을 가져올 수 있습니다. 궁극적인 목표는 인간의 손길을 대체하는 것이 아니라, 일련의 음을 하나의 이야기로 바꾸는 미묘한 지침들을 이해하고 재현할 수 있는 어휘를 기계에게 부여하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.