← 최신 논문
⚡ electrical engineering

MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music

이 논문은 Swin Transformer V2 인코더를 피치 및 시간 이동 등변성(pitch- and time-shift equivariance) 목적 함수와 결합하여, 감정 분류와 같은 다운스트림 작업에서 탁월한 성능을 보이고 고품질 생성 모델링을 가능하게 하는 상징적 음악의 계층적이고 의미론적으로 풍부한 표현을 학습하는 자기지도 학습 프레임워크인 MIDI-RAE-JEPA를 소개한다.

원저자: Scott H. Hawley

게시일 2026-07-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Scott H. Hawley

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 단순히 음파를 듣는 것이 아니라 악보 자체를 읽음으로써 음악을 이해하도록 가르치려 한다고 상상해 보십시오. 인공지능의 세계에서 이것은 컴퓨터에게 음악의 음표 지도를 읽는 법을 가르치는 것과 같습니다. 보통 AI는 수백만 장의 고양이 또는 강아지 사진을 보며, '고양이'가 확대되거나 축소되어도 여전히 고양이라는 것을 학습합니다. 하지만 음악은 다릅니다. 악보를 확대하면 단순히 더 큰 음표가 보이는 것이 아니라, 완전히 다른 리듬이나 다른 피치를 보게 됩니다. 사진에 적용되는 규칙들이 음악에서는 무너지는 것입니다.

이를 해결하기 위해 과학자들은 "자기 지도 학습(self-supervised learning)"이라는 영리한 기술을 사용합니다. 모든 음표에 일일이 라벨을 붙이는 인간 교사를 고용하는 대신, AI에게 "빈칸 채우기" 게임을 시키는 것입니다. 그들은 음악의 일부를 숨기고 AI에게 무엇이 빠졌는지 맞혀보라고 요청합니다. 만약 AI가 정답을 맞힌다면, 그것은 AI가 음악이 어떻게 구성되는지에 대한 숨겨진 규칙을 배웠다는 것을 의미합니다. 이 논문이 다루는 핵심 질문은 이것입니다: 우리는 단 하나의 라벨링된 예시도 보여주지 않고도, AI에게 음악의 구조—즉, 작은 멜로디가 어떻게 하나의 큰 노래 속에 들어가는지—를 가르칠 수 있을까? 그리고 만약 그렇게 할 수 있다면, 그 AI가 스스로 좋은 음악을 작곡할 수 있을까?


새로운 음악적 기호(피아노 롤처럼 디지털 명령어로 작성된 음악)의 비밀 언어를 배우도록 설계된 새로운 AI 시스템인 MIDI-RAE-JEPA를 만나보십시오. 피아노 롤은 거대한 이진 그리드라고 생각하면 됩니다: 모든 가능한 피아노 건반을 위해 128칸의 너비를 가지고, 시간의 흐름을 위해 128칸의 높이를 가집니다. 검은색 칸은 음이 연주되고 있음을 의미하고, 흰색 칸은 침묵을 의미합니다. 이 프로젝트의 목표는 AI가 이 그리드를 보고 음악의 깊은 계층적 관계, 즉 단일 음표가 어떻게 구절(phrase)을 만들고, 구절이 어떻게 섹션을 만들며, 섹션이 어떻게 하나의 전체 곡을 구성하는지를 이해하도록 가이드를 제공하는 것이었습니다.

연구진은 음악 탐정처럼 행동하는 시스템을 구축했습니다. 그들은 Swin Transformer V2라는 특수한 유형의 AI 아키텍처를 사용했는데, 이는 아주 작은 단일 음표부터 전체적인 곡의 구조까지 다양한 수준의 세부 사항을 살펴보는 일련의 돋보기와 같습니다. 하지만 진짜 마법은 그것을 가르치는 방식에 있습니다. 단순히 빠진 음표를 추측하게 하는 대신, 그들은 AI에게 "음악적 번역" 게임을 가르쳤습니다.

멜로디가 있다고 가정해 봅시다. 만약 그 멜로디를 몇 단계 위로 올리거나(피치 시프트), 시간상으로 앞으로 이동시킨다면(타임 시프트), 음표는 달라질지언정 음악의 구조는 그대로 유지됩니다. AI는 이러한 변형된 버전들이 서로 연관되어 있다는 것을 인식하도록 훈련되었습니다. 만약 노래를 한 음 높이면, 그 노래에 대한 AI의 내부 "지문(fingerprint)"은 아주 조금만 이동해야 합니다. 만약 한 옥타브를 높이면, 지문은 훨씬 더 멀리 이동해야 합니다. 이것을 **등변성(equivariance)**이라고 부릅니다. 이는 아이에게 빨간 공이 바닥에 있든 탁자 위에 있든 여전히 빨간 공임을 가르치는 것과 같습니다. AI는 음악적 아이디어가 다른 키(key)나 다른 시간대에 있더라도 여전히 동일한 아이디어라는 것을 배웁니다.

AI가 단순히 정답을 암기하거나 혼란에 빠지지 않도록 하기 위해, 연구진은 몇 가지 안전장치를 추가했습니다. 그들은 "마스크 임베딩 예측기(masked embedding predictor)"를 사용했는데, 이는 악보의 일부를 가리고 나머지 곡을 바탕으로 그 아래에 무엇이 있는지 예측하게 하는 것과 같습니다. 또한 AI가 게을러져서 모든 노래에 대해 똑같은 대답을 내놓는 문제(이를 "붕괴(collapse)"라고 함)를 방지하기 위해 SIGReg라는 특별한 규칙을 추가했습니다.

결과는 놀라울 정도로 성공적이었습니다. 연구진이 AI의 뇌를 동결시키고(새로운 것을 배우지 못하게 하고) 간단한 디코더를 연결했을 때, 시스템은 믿기 힘들 정도로 정확하게 원래의 피아노 롤을 재구성해냈으며, F1 점수 0.995를 기록했습니다. 이는 거의 완벽에 가깝습니다. 즉, AI가 음악의 본질을 내부 메모리에 진정으로 포착했다는 것을 의미합니다.

하지만 진짜 테스트는 생성 단계였습니다. 연구진은 이 내부 "지문" 표현들을 가져와 생성 모델(새로운 것을 만들어내는 유형의 AI)에 입력했습니다. 특정 음악적 발췌문을 조건(condition)으로 주었을 때, AI는 원래의 음악과 음역대(pitch register)(음의 높낮이) 및 리듬 밀도(rhythmic density)(음의 복잡함 혹은 희소함)가 일치하는 새로운 음악을 생성했습니다. 만약 서로 맞지 않는 조건을 주더라도, AI는 여률(plausible)한 음악을 만들어냈지만 원래의 프롬프트와는 관련이 없었습니다. 이는 AI가 단순히 복사하는 것이 아니라, 입력값의 스타일구조를 이해하고 있음을 시사합니다.

또한 논문은 이러한 학습된 표현들이 다른 작업에 도움이 될 수 있는지도 테스트했습니다. 연구진은 AI의 내부 지문을 사용하여 곡의 감정(예: "행복" 또는 "슬픔")을 추측하는 실험을 했습니다. 결과는 이 방법이 기존의 더 단순한 기술들(Haar 스캐터링 변환 등)보다 더 효과적임을 시사했으며, 이는 AI가 감정을 명시적으로 배우지 않고도 음악적으로 유의미한 무언가를 학습했음을 증명합니다.

그러나 저자들은 자신들이 모든 것을 해결했다고 주장하는 데는 신중합니다. 그들은 자신들의 AI의 "미세한(finer)" 단계(작은 세부 사항을 보는 단계)는 특정 음표와 리듬을 포착하는 데 매우 뛰어나지만, "거친(coarser)" 단계(큰 그림을 보는 단계)는 아직 명확하고 해석 가능한 음악적 추상화를 포착하는 법을 완전히 배우지 못했다고 언급합니다. 이 시스템은 등변성(변화에 대한 이해)과 계층적 학습(다양한 규모의 세부 사항 이해)을 결 조합하는 것이 실행 가능한 경로임을 보여주는 강력한 개념 증명입니다. 이는 우리가 음악적 아이디어를 듣고 그 구조를 이해하여 작곡을 보조할 수 있는 AI 어시스턴트를 만들 수 있음을 시사하지만, AI가 교향곡의 웅장하고 추상적인 건축 구조를 완전히 파악하도록 만드는 데는 여전히 과정 중에 있음을 보여줍니다.

요약하자면, 이 논문은 음악적 변화와 규모의 규칙을 존중하도록 AI를 가르침으로써, 음악을 완벽하게 재구성하고 특정 음악적 분위기에 따라 타당한 새로운 음악을 생성할 수 있는 시스템을 만들 수 있음을 보여줍니다. 이는 AI가 단순히 음악을 흉내 내는 것을 넘어, 그 문법을 진정으로 이해하는 단계로 나아가는 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →