SLEEPING-DISCO 9M: A large-scale pre-training dataset for generative music modeling
본 논문은 생성형 음악 모델링을 위한 기존의 합성 데이터 또는 비대표적 데이터셋의 한계를 극복하기 위해 설계된, 실제 인기 음악과 세계적인 아티스트들로 구성된 새로운 대규모 오픈 소스 데이터셋인 Sleeping-DISCO 9M을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 인간처럼 노래하는 법을 가르치고 싶다고 상상해 보세요. 이를 위해서는 방대한 양의 노래, 가사, 그리고 음악에 관한 이야기들을 로봇에게 학습시켜야 합니다. 오랫동안 '빅 테크' 기업들(Jukebox를 만든 곳들과 같은)은 자신들의 비밀스러운 라이브러리를 금고 속에 꼭 닫아두었고, 소규모 연구자들은 아주 작게 직접 만든 컬렉션이나 가짜 음악으로 버텨야만 했습니다.
Sleeping-DISCO 9M은 저자들이 구축하여 모두가 사용할 수 있도록 공개한 새롭고 거대한 라이브 library입니다. 일상적인 비유를 사용하여 이들이 무엇을 했고 이것이 왜 중요한지 간단히 설명해 드리겠습니다.
1. 문제점: "빈 찬장" vs "비밀 금고"
AI 음악 연구의 세계를 새로운 레시피를 발명하려는 요리사 그룹이라고 생각해 보세요.
- 대형 셰프들 (빅 테크): 이들은 세상에서 가장 유명한 식재료(유명 아티스트들의 인기 곡)가 가득 찬 비밀 찬장을 가지고 있지만, 다른 사람들에게는 보여주지 않습니다.
- 소규모 셰프들 (연구자들): 이들은 인공적인 식재료(합성 음악)나 매우 작고 특정한 컬렉션(예: 중국 팝송만 모아놓은 것)을 가지고 요리하려고 애써왔습니다.
- "무작위" 라이브러리들: 다른 거대한 라이브러리들(DISCO-10M 등)도 있었지만, 그것들은 라벨이 붙지 않은 상자들이 가득한 창고와 같았습니다. 그 안에 음악이 들어있다는 것은 알 수 있었지만, 누가 불렀는지, 어떤 노래인지, 심지어 그 음악이 진짜인지 아니면 그냥 무작위 클립인지조차 알 수 없었습니다. 그것들은 너무 엉망이라 진지한 요리에 사용하기에는 부적합했습니다.
2. 해결책: "초정밀 정리된" 음악 백과사전
저자들은 Sleeping-DISCO 9M을 만들었습니다. 이것을 단순히 MP3 파일의 더미가 아니라, 거대하고 완벽하게 정리된 음악 백과사전이라고 생각하세요.
- 규모: 이 라이브러리는 648,000명 이상의 서로 다른 아티스트로부터 온 거의 900만 곡의 노래를 포함하고 있습니다. 이는 지난 10년 동안의 거의 모든 히트곡을 담고 있는 도서관을 갖는 것과 같습니다.
- 품질: 위에서 언급한 엉망인 창고들과 달리, 이 라이브러리는 체계적으로 정리되어 있습니다. 모든 곡에는 상세한 "신분증"(메타데이터)이 따라붙습니다. 아티스트, 앨범, 출시 연도, 심지어 특정 장르별로 노래를 검색할 수 있습니다.
- 다양성: 단순히 영어 팝송만이 아닙니다. 영어, 일본어부터 스와힐리어, 하우사어에 이르기까지 169개 언어를 아우르는 글로벌한 혼합물입니다. 이는 단 하나의 데이터셋 안에 담긴 세계 여행과 같습니다.
3. 제작 방법: "디지털 사서"
팀은 단순히 무작위 파일을 다운로드한 것이 아닙니다. 그들은 Genius 웹사이트(가사와 음악적 사실로 유명한 사이트)를 방문하는 디지털 로봇 사서(Python 스크레이퍼)를 구축했습니다.
- 로봇은 수백만 개의 페이지를 주의 깊게 읽으며 노래 제목, 아티스트 이름, 앨범 상세 정보, 그리고 가사를 복사했습니다.
- 그 다음, 로봇은 유튜브를 뒤져 실제 영상 링크를 찾아냈는데, 이때 영상 제목이 찾고 있는 노래와 실제로 일치하는지 확인하는 "스마트 매칭" 시스템을 사용했습니다.
- 주의 사항: 저자들은 실제 가사나 심층적인 "주석"(Genius 편집자들이 작성한 재미있는 사실들)은 저작권 문제로 공유할 수 없었습니다. 하지만 그들은 노래로 연결되는 링크와 가사의 "지문"(임베딩)을 공유했습니다. 이는 컴퓨터가 원문 텍스트 없이도 의미를 이해하는 데 도움을 줍니다.
4. 이것이 왜 중요한 일인가
이전에는 연구자가 실제 세계의 음악을 이해하는 AI를 훈련시키고 싶다면, 직접 엉망인 컬렉션을 구축하거나 아주 작고 제한적인 것을 사용해야 했습니다.
- Sleeping-DISCO는 이 정도 규모와 품질(마룬 파이브나 샤키라 같은 실제 유명 아티스트를 포함하는)을 갖춘 데이터셋이 오픈 소스로 공개된 첫 사례입니다.
- 이것은 빅 테크 기업들의 "비밀 금고"와 독립 연구자들의 "작은 주방" 사이의 간극을 메워줍니다.
5. 도서관 이용 규칙
저자들은 이 라이브러리를 특정 규칙(CC-BY-NC-ND 4.0)에 따라 공유합니다.
- 여러분은 이를 사용하여 연구하고 자신만의 음악 모델을 구축할 수 있습니다.
- 여러분은 이 데이터셋 자체를 판매하거나 돈을 벌 목적으로 사용할 수 없습니다.
- 여러분은 데이터셋을 변경하고 그것이 자신의 것이라고 주장할 수 없습니다.
- 가사: 노래의 실제 텍스트는 여전히 잠겨 있습니다(저작권 때문). 하지만 저자들은 엄격하게 과학적 용도로만 사용하겠다고 약속한 대학 및 연구 기관들과는 이를 공유할 것입니다.
요약하자면: 저자들은 연구자들이 AI에게 실제 음악을 이해하고 생성하는 법을 가르치기 위해 마침내 사용할 수 있는, 거대하고 깨끗하며 다양한 음악 라이브러리를 구축하여 수년간 존재했던 공백을 채웠습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.