← 최신 논문
⚡ electrical engineering

Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation

이 논문은 인간 중심의 협업적 공동 창작 에이전트를 위해 심층적인 음악적 이해와 효율적이고 제어 가능한 생성을 가능하게 하는, 레이블 없이 풍부한 다중 척도 표현을 학습하는 기호 음악용 계층적 자기 지도 세계 모델을 소개한다.

원저자: Scott H. Hawley

게시일 2026-08-06
📖 5 분 읽기🧠 심층 분석

원저자: Scott H. Hawley

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 음악 프로듀서가 되는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇이 단순히 노래를 복사해서 붙여넣거나, 기존의 모든 것과 똑같이 들리는 새로운 히트곡을 써내길 원하는 것이 아닙니다. 당신은 로봇이 협업자가 되기를 원합니다. 당신의 엉성한 음악적 아이디어를 듣고, 그 "분위기(vibe)"를 이해하며, 주도권을 빼앗지 않으면서도 제안을 건넬 수 있는 존재 말이죠. 이것이 바로 과학자들이 음악을 단순한 음파의 흐름이 아니라 음표, 화음, 리듬이라는 구조화된 언어로 "들을" 수 있는 기계를 만들기 위해 노력하고 있는 분야, **AI 음악 공동 창작(AI music co-creation)**의 세계입니다.

이를 위해 연구자들은 흔 часто **월드 모델(World Models)**을 사용합니다. 월드 모델을 마음속의 지도라고 생각해 보세요. 눈을 감고 방을 상상하면, 앞으로 걸어가면 벽이 가까워지고, 왼쪽으로 돌면 문이 나타난다는 것을 알게 됩니다. 월드 모델은 다음에 어떤 일이 일어날지를 예측함으로써 이러한 규칙을 학습합니다. 음악에서 월드 모델은 멜로디를 한 음 높이거나 시간을 앞으로 이동시켰을 때 어떻게 변하는지를 예측하려고 노력합니다. 당신이 읽게 될 이 논문은 구체적인 과제를 다룹니다. 어떻게 하면 음악을 깊이 있게 이해하여 유능한 파트너가 될 수 있으면서도, 거대하고 비싼 슈퍼컴퓨터 없이 일반 컴퓨터에서도 실행될 만큼 단순하게 만들 수 있는가 하는 점입니다. 목표는 인간 예술가를 대체하는 것이 아니라, 악기를 직접 연주하지는 못해도 자신이 무엇을 좋아하는지 알고 이를 명확하게 표현할 수 있는 최고의 "AI 릭 루빈(Rick Rubin)"이 되는 것입니다.


"AI 릭 루빈": 경청하는 음악 파트너

이 논문은 협업적인 음악 파트너가 되도록 설계된 새로운 종류의 AI를 소개합니다. 이 시스템은 당신을 위해 모든 것을 연주해 주는 거장 음악가가 되려고 하는 대신, "잘 듣고" "제안하는" 역할을 하도록 구축되었습니다. 저자는 이 시스템을 "AI 릭 루빈"이라 부르는데, 이는 악기를 거의 연주하지 못하지만 무엇이 좋은 소리인지에 대한 놀라운 귀를 가진 것으로 유명한 전설적인 음악 프로듀서 릭 루빈을 인용한 것입니다. 목표는 인간의 음악적 아이디어를 듣고, 그 구조를 이해하며, 인간이 창작 과정의 주도권을 확실히 쥐고 있는 상태에서 피드백이나 새로운 음악적 조각들을 제공하는 AI를 만드는 것입니다.

"귀": 음악을 느끼는 법 배우기

시스템의 첫 번째 부분은 "귀"입니다. 대부분의 AI 음악 모델은 "이것은 C 메이저 코드이다" 또는 "이것은 슬픈 노래이다"라고 라벨을 붙여 알려주는 교사가 있는 상태에서 시험을 치르는 학생처럼 훈련됩니다. 하지만 저자는 AI가 무엇을 찾아야 할지 알려주는 선생님 없이 스스로 학습하기를 원했습니다.

그들은 **계층적 자기 지도 학습 월드 모델(hierarchical self-supervised world model)**을 구축했습니다. 피아노 롤(음표가 블록 형태로 표시된 시각적 격자)을 보고 있다고 상상해 보세요. AI는 이 격자의 작은 사각형 하나를 봅니다. 그런 다음, 그 사각형을 오른쪽으로 약간 이동시키거나(시간을 앞으로 이동) 위로 이동시키는(음높이를 높임) 상황을 상상합니다. AI의 임무는 이전의 사각형을 바탕으로 새로운 사각형이 어떻게 보일지를 예측하는 것입니다. 이 "변화 예측 게임"을 수백만 번 반복함으로써, AI는 음악의 내부 규칙을 학습합니다. AI는 어떤 코드가 무엇인지 이름을 배우지 않고도, 음표가 시간 속에서 특정 패턴을 따르는 방식과 화음이 음높이에서 가지는 특정한 관계를 학습합니다.

이 모델은 피라미드 형태의 층(layer) 구조로 되어 있습니다. 하위 층은 개별 음표나 연주 속도와 같은 미세한 디테일을 포착합니다. 상위 층은 전체적인 음악적 구절(phrase)의 형태나 곡의 구조와 같은 큰 그림을 봅니다. 연구진은 AI가 자연스럽게 이런 방식으로 조직된다는 것을 발견했습니다. 즉, '미세한(fine)' 층은 음표의 밀도를 포착하는 데 뛰어나고, '거친(coarse)' 층은 음악적 구절이 어디서 시작되고 끝나는지를 이해하는 데 탁월합니다.

AI가 실제로 "듣는" 것

연구팀은 AI가 실제로 무엇을 배웠는지 확인하기 위해 AI의 뇌를 고정시킨 채 간단한 질문을 던지는 테스트를 진행했습니다. 그 결과, AI가 진정한 음악적 "감각"을 발달시켰음을 발견했습니다.

  • 시간과 구조: AI는 짧은 음악적 아이디어와 긴 아이디어의 차이를 자연스럽게 구분할 수 있었으며, 패턴만을 보고도 음악적 구절의 경계를 찾아낼 수 있었습니다.
  • 화성 (까다로운 부분): 흥 nghiệm하게도, AI는 이 예측 게임을 하는 것만으로는 특정 코드(예: "G 메이저")를 자동으로 식별하지 못했습니다. 약간의 도움이 필요했습니다. 연구진이 약간의 감독(몇 가지 코드 예시를 보여주는 것)을 추가하자, 화성을 이해하는 AI의 능력이 급상격했습니다. AI는 코드를 거의 인식하지 못하던 수준에서 매우 잘 인식하는 수준으로 발전했으며, 명시적으로 '조성(key)'이 무엇인지 배우지 않았음에도 불구하고 곡의 '키(key)'를 높은 정확도로 식별해 냈습니다.

이는 AI가 음악의 형태는 스스로 학습할 수 있지만, 코드와 같은 구체적인 음악적 개념의 이름을 배우기 위해서는 약간의 자극이 필요함을 시사합니다.

"입": 제안하기

AI가 음악을 "듣고" 이해했다면, 이제 다시 말을 해야 합니다. 이것이 "입"입니다. 처음부터 완전히 새로운 곡을 쓰는 대신, 이 AI는 빈칸을 채우도록 설계되었습니다. 사람이 피아노 롤의 특정 구간에 마스크를 씌워 "이 부분을 채워줘"라고 말한다고 상상해 보세요. AI는 플로우 매칭(flow matching) 기술을 사용하여 빈 공간에 완벽하게 어울리는 새로운 음표들을 생성합니다.

단계별로 노래를 "꿈꾸듯" 만들어내는 기존의 오래된 AI 모델들과 달리, 이 모델은 노이즈로부터 음악으로 부드럽게 흘러갑니다. 매우 빠릅니다. 표준 컴퓨터 프로세서(CPU)에서 음악적 제안을 생성하는 데 약 2.8초가 걸립니다. 최신 애플 컴퓨터를 사용한다면 단 0.6초면 충분합니다. 이 속도는 매우 중요한데, 이는 인간이 느린 컴퓨터의 응답을 기다릴 필요 없이 즉각적으로 아이디어를 시도하며 AI와 실시간 대화를 나눌 수 있음을 의미하기 때문입니다.

또한 이 시스템은 유연합니다. 화음은 그대로 유지하면서 멜로디만 바꾸라고 지시하거나, 섹션 전체를 다시 쓰도록 할 수 있습니다. AI는 생성 과정 중에 자신의 이해 중 일부를 "떨어뜨림(dropping)"으로써, 사용자가 원하는 바에 따라 더 창의적이거나 혹은 더 엄격하게 작동합니다.

이것이 왜 중요한가

이 논문은 이 시스템이 인간 음악가를 대체하기 위한 것이 아님을 강조합니다. 이 시스템은 값비싼 그래픽 카드가 없는 음악가들도 사용할 수 있도록 접근 가능한 하드웨어(노트북 등)에서 실행되도록 구축되었습니다. 또한 인간의 주체성을 존 Respect 합니다. AI는 제안을 할 뿐이며, 그 제안을 사용할지 여부는 인간이 결정합니다. 저자는 사용자가 피아노 롤에 그림을 그리면 AI가 실시간으로 빈 공간을 채우는 모습을 보여주는 라이브 인터랙티브 데모를 통해 이를 입증합니다.

요약하자면, 이 논문은 AI가 음악을 이해하는 새로운 방법을 제시합니다. 음악이 시간이나 음높이에 따라 어떻게 변하는지를 예측하도록 가르침으로써, 연구진은 음악적 구조를 "느낄" 수 있는 시스템을 만들어냈습니다. 코드 이름을 배우는 데 약간의 도움만 더해지면, 이 시스템은 작곡가들에게 강력하고 빠른 협업 도구가 되어, 잘 듣고 아이디어를 제안하며 최종적인 창의적 결정은 인간의 손에 남겨두는 디지털 프로듀서 역할을 수행하게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →