MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models
이 논문은 대규모 언-모델을 텍스트 제어 방식의 고품질 멀티트랙 MIDI 음악 및 리드 시트를 생성하도록 적응시키는 2단계 학습 프레임워크인 MIDI-LLM을 소개하며, 광범-한 절제 연구와 대규모 실제 블라인드 평가를 통해 기존 베이스라인 모델보다 우수한 성능과 사용자 수용성을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터에게 말을 걸어 나를 위한 노래를 써달라고 요청할 수 있는 세상을 상상해 보세요. 인공지능의 영역에서 이것을 "텍스트-투-뮤직(text-to-music)"이라고 부릅니다. 한동안 이를 수행하는 가장 좋은 방법은 컴퓨터에게 디지털 녹음과 같은 가공되지 않은 음파(raw sound waves)를 생성하도록 요청하는 것이었습니다. 하지만 여기에는 함정이 있습니다. 일단 소리가 만들어지면, 그것은 캔버스 위의 그림과 같습니다. 전체 그림을 망치지 않고 단 하나의 붓터치를 지우거나 드럼 비트의 템포만 바꾸는 것은 쉽지 않습니다. 음악가들에게는 더 유연한 것, 즉 음표 단위로 편집할 수 있는 무언가가 필요합니다. 여기서 "MIDI"가 등장합니다. MIDI를 소리가 아니라, 가상 피아노에게 정확히 어떤 키를 얼마나 세게, 그리고 얼마나 길게 누를지 알려주는 디지털 악보나 일련의 지침이라고 생각하세요. 이것은 완성된 녹음물과 레고 세트의 차이와 같습니다. 레고는 분해해서 새로운 것을 다시 만들 수 있습니다.
이제 초거대 언어 모델(에세이를 쓰고 질문에 답하는 AI)을 가져와서 이 음악적 언어를 말할 수 있도록 가르친다고 상상해 보세요. 그것이 이 새로운 연구 뒤에 숨겨 있는 거대한 아이디어입니다. 과학자들은 텍스트 전문가를 음악 전문가로 바꿀 수 있는지 확인하고 싶었습니다. 사람들이 "빠른 드럼이 있는 슬픈 재즈 곡"과 같은 내용을 입력하면 완벽하게 편집 가능한 음악 악보를 돌려받을 수 있도록 말이죠. 그들은 단순히 예쁜 소음을 만들려는 것이 아니라, 인간 창작자가 AI와 자연스럽고 통제 가능한 방식으로 브레인스토밍하고 협업할 수 있도록 돕는 도구를 만들고자 했습니다.
논문: MIDI-LLM
이 논문의 저자인 MIT, Hooktheory, 카네기 멜론 대학교의 연구팀은 MIDI-LLM이라는 새로운 레시피를 만들어냈습니다. 이것을 표준 대규모 언어 모델(LLM)—이야기를 쓰고 수학 문제를 푸는 종류의 AI—을 음악도 쓸 수 있도록 업그레이드하는 방법이라고 생각하세요.
보통 이러한 AI 모델들은 단어로만 요리할 줄 아는 요리사와 같습니다. 그들은 "사과"와 "파이"는 이해하지만, "C# 음"이 어떻게 들리는지 또는 그것을 어떻게 적는지 모릅니다. 팀의 첫 번째 단계는 AI에게 새로운 어휘를 주는 것이었습니다. 그들은 모델의 사전을 특수 "MIDI 토큰"을 포함하도록 확장했습니다. 모델이 "10초에 시작해서 0.5초 동안 지속하며 높은 C를 연주하라"와 같이 긴 문장으로 쓰는 대신, 이제는 하나의 압축된 기호, 즉 비밀 코드처럼 인식하게 된 것입니다. 이는 요리사에게 "소금을 추가하라"라는 의미를 담은 하나의 단어가 있는 새로운 언어를 가르쳐서 요리 과정을 훨씬 빠르고 효율적으로 만드는 것과 같습니다.
하지만 단순히 모델에게 새로운 사전을 주는 것만으로는 충분하지 않습니다. 모델이 그것을 사용하는 법을 배워야 합니다. 연구팀은 AI를 마치 음악 전공생이 먼저 화성학을 배우고 그다음 밴드에서 연주하는 것처럼 두 가지 뚜렷한 단계로 훈련시켰습니다.
1단계: 솔로 연습 (단일 모드 사전 학습)
먼저, AI가 혼자 연습하게 했습니다. 그들은 두 가지 유형의 데이터를 입력했습니다:
- 음악 관련 텍xt: 음악 이론에 관한 기사, 질문 및 답변(예: "단조 화음이란 무엇인가?").
- 독립적인 MIDI 파일: 텍스트 설명이 없는 수천 개의 가공되지 않은 음악 악보.
이 단계는 AI에게 음악의 "구문(syntax)"을 가르치는 과정이었습니다. AI는 사람의 설명 없이도 음들이 어떻게 어우러지는지, 리듬이 어떻게 작동하는지, 그리고 곡의 구조가 어떠한지를 배웠습니다. 이는 음악가가 조용한 방에서 스케일을 연습하고 악보를 읽는 것과 같습니다.
2단계: 듀엣 (다중 모드 지도 미세 조정)
다음으로, 연구팀은 AI를 파트너와 짝을 지어주었습니다. 그들은 "행복한 팝 송"이라는 프롬프트와 그에 해당하는 MIDI 악보를 바로 이어서 입력했습니다. 이를 통해 AI는 인간의 아이디어를 음악적 지침으로 번역하는 법을 배웠습니다. 만약 "재즈"라고 말하면, AI는 재즈 음표를 쓰는 법을 배웠습니다. 만약 "슬프다"라고 말하면, 느린 단조 화음을 쓰는 법을 배웠습니다. 이것이 바로 AI가 당신의 요청을 듣고 실제로 요청한 대로 연주하는 법을 배우는 순간입니다.
연구 결과
결과는 꽤 인상적이었습니다. 연구팀이 새로운 MIDI-LLM을 최근의 경쟁 모델인 Text2midi와 비교했을 때, 그들의 모델은 두 가지 주요 측면에서 우위를 점했습니다:
- 더 나은 품질: 생성된 음악이 더 사실적으로 들렸고 음악의 규칙을 더 잘 따랐습니다.
- 더 나은 제어력: 텍스트 지침을 더 밀접하게 따랐습니다. 특정 분위기나 장르를 요청하면 실제로 그 결과를 내놓았습니다.
- 속도: Llama 3.2를 기반으로 한 표준 AI 아키텍처를 사용했기 때문에, 기존의 매우 빠른 컴퓨터 도구들을 사용하여 모델을 실행할 수 있었습니다. 그들의 모델은 경쟁 모델보다 약간 더 큼에도 불구하고 7배에서 13배 더 빨랐습니다.
또한 그들은 "인필링(infilling, 중간 채우기)"이라는 특별한 기능을 테스트했습니다. 노래가 절반 정도 완성되었을 때, AI가 중간 부분을 작성해주길 원하는 상황을 상상해 보세요. 연구팀은 AI가 이 작업에 뛰어나다는 것을 발견했지만, 까다로운 균형이 존재한다는 것도 발견했습니다. 만약 AI가 사용자가 입력한 텍스트에 너무 집중하면, 이미 작성된 음악을 무시할 수 있습니다. 반대로 기존 음악에 너무 집중하면, 사용자의 새로운 텍스트 지침을 무시할 수 있습니다. 이를 해결하기 위해, 연구팀은 사용자가 텍스트와 기존 음악 중 어느 쪽에 더 집중할지 조절할 수 있는 "노브(knob)"(Classifier-Free Guidance라고 불림)를 도입했습니다.
실제 환경 테스트: "인-더-와일드(In-the-Wild)" 연구
이것이 실제로 사람들에게 도움이 되는지 확인하기 위해, 연구팀은 단순히 컴퓨터 테스트만 수행한 것이 아니라 실제 세상으로 나갔습니다. 그들은 작곡가들이 음악을 만드는 웹사이트인 Hookpad와 협력했습니다. 그들은 58명의 실제 사용자(이미 구독 중인 사용자들)가 이 새로운 AI 부조종사를 사용해 보도록 했습니다.
사용자들은 처음부터 노래를 만들거나, 노래의 누락된 부분을 채우는 과제를 부여받았습니다. 그들은 세 가지 다른 AI 모델 중 하나를 선택할 수 있었습니다:
- 기존 모델 (텍스트를 무시하고 음악만 고려함).
- 텍스트를 무시하는 버전의 새로운 모델.
- 텍스트를 듣는 전체 새로운 MIDI-LLM.
결과는, 사용자들이 처음부터 노래를 시작할 때("zero-to-one"), 전체 MIDI-LLM이 명확한 승자임을 보여주었습니다. 이 모델은 다른 모델들보다 거의 **두 배 높은 수용률(acceptance rate)**을 보였습니다. 이는 사람들이 새로운 아이디어를 시작하려고 할 때, "90년대 록 스타일로 만들어줘"라고 타이핑할 수 있는 능력이 매우 가치 있다는 것을 시사합니다.
그러나 사용자들이 기존 곡의 작은 틈을 채우고 있을 때는 결과가 더 엇갈렸습니다. 때때로 사용자들은 텍스트를 무시하는 이전 모델을 선호했습니다. 연구진은 이것이 사용자가 이미 곡의 깊은 부분에 들어와 있을 때, 새로운 아이디어를 강요하여 기존 멜로디와 충돌하게 만들기보다는, AI가 그냥 기존의 흐름에 "맞춰주기를" 원하기 때문일 수 있다고 설명합니다.
결론
이 논문은 대규모 언어 모델을 음악에 적응시키는 것이 강력한 레시피라는 결론을 내립니다. 이러한 모델들이 "텍스트"와 "MIDI"를 모두 말할 수 있도록 가르침으로써, 인간과 AI가 더 효과적으로 협업할 수 있는 도구를 만들어냈습니다. 이것은 단순히 소음을 생성하는 것이 아닙니다. 창작자들에게 단순한 문장을 완전한 음악 악보로 바꾸어, 그들이 직접 수정하고 완성할 수 있게 해주는 유연하고 빠르며 지능적인 파트너를 제공하는 것입니다. 연구팀은 이 기술을 더 많은 사용자에게 배포하여, 이것이 미래에 사람들이 음악을 쓰는 방식을 어떻게 변화시킬지 지켜보고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.