LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training
LeVo 2는 계층적 모델링 방식과 미학 중심의 점진적 사후 학습 스케줄을 채택하여 전역적 의미 계획과 트랙별 음향 정밀화 사이의 절충 문제를 해결함으로써, 안정적이고 선율적이며 제어 가능한 전체 길이의 곡 생성을 달성하는 하이브리드 LLM-Diffusion 프레임워크이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
개요: 로봇에게 히트곡 작곡 가르치기
당신이 로봇에게 처음부터 끝까지 완벽한 길이의 노래를 작곡하는 법을 가르치고 싶다고 상상해 보세요. 로봇은 동시에 세 가지 어려운 과제를 수행해야 합니다:
- 노래 계획하기: 멜로디, 리듬, 그리고 보컬과 악기가 어떻게 어우러질지 결정합니다.
- 세부 사항 작성하기: 가수가 인간처럼 들리고 기타 소리가 기계적이지 않고 선명하게 들리도록 만듭니다.
- 지시 따르기: 만약 당신이 "비에 관한 슬픈 포크 송"을 요청한다면, 로봇은 신나는 록 음악이 아니라 실제로 그 느낌이 나도록 만들어야 합니다.
이전의 AI 모델들은 이 모든 것을 하나의 거대하고 무질서한 단계로 처리하려 했기 때문에 어려움을 겪었습니다. 계획은 잘 세웠지만 음질이 형편없거나, 혹은 소리는 훌륭하지만 노래의 구성이 엉망인 경우가 많았습니다.
LeVo 2는 마스터 지휘자와 전문 연주자 팀이 협력하는 방식으로 이 문제를 해결하는 새로운 시스템입니다.
1. 아키텍처: 지휘자와 연주자들
하나의 뇌가 모든 것을 처리하는 대신, LeVo 2는 **장군(General)**과 **특수 부대(Special Forces)**처럼 두 개의 층으로 역할을 나눕니다.
- 장군 (Mixed Semantic LM): 이 부분은 큰 그림을 봅니다. 아직 기타 줄의 미세한 디테일에 신경 쓰지 않습니다. 대신 노래의 "뼈대"를 설계합니다. 멜로디, 템포, 그리고 코러스가 들어갈 위치를 정합니다. 보컬과 악기가 서로 잘 어우러질 수 있도록 "혼합된" 계획을 만듭니다.
- 특수 부대 (Track-Specific LM): 장군이 계획을 세우면, 이 팀이 바통을 이어받습니다. 이들은 계획을 바탕으로 고해상도의 디테일을 채워 넣습니다. 한 그룹은 오직 보컬이 완벽하게 들리는 것에 집중하고, 다른 그룹은 악기 소리를 완벽하게 만드는 데 집중합니다. 이들은 서로 방해하지 않도록 병렬로 작업합니다.
- 사운드 엔지니어 (Music Codec): 마지막으로, 세 번째 구성 요소인 사운드 엔지니어가 장군과 특수 부대의 노트를 가져와 우리가 실제로 들을 수 있는 고품질의 오디오 파형으로 변환합니다.
비유: 집을 짓는 과정을 생각해 보세요. 장군은 청사진(벽이 어디에 들어갈지)을 그립니다. 특수 부대는 페인트칠을 하거나 배선을 하는 등 세부적인 작업을 더하는 화가와 전기 기술자입니다. 사운드 엔지니어는 당신이 실제로 살 수 있도록 집을 실제로 짓는 건설팀입니다.
2. 학습: 음악가를 위한 3단계 학교
저자들은 로봇을 그냥 음악 스튜디오에 던져놓는다고 해서 바로 실력이 좋아질 것이라고 생각하지 않았습니다. 그들은 "자동화된 음악 심사위원"의 지도 아래 3단계 학습 학교를 만들었습니다.
1단계: 음악 이론 수업 (사전 학습)
로봇은 수천 곡의 노래를 듣습니다. 하지만 아무 노래나 듣는 것이 아닙니다. 자동화된 시스템을 사용하여 노래를 채점합니다. 로봇은 먼저 "상위 5%"의 곡들로부터 배웁니다. 음악의 규칙(멜로디, 리듬)을 배우고 무엇이 "좋은 소리"인지 감을 잡습니다. 이는 학생에게 역대 최고의 히트곡들만 보여주며 가르치는 것과 같습니다.2단계: 규율 훈련 (점진적 사후 학습)
이제 로봇은 음악 이론을 알지만, 여전히 가사를 틀리게 부르거나 당신의 지시를 무시하는 등의 실수를 할 수 있습니다.- 먼저, **지도 미세 조정(SFT)**을 연습합니다: 품질을 높이기 위해 오직 최고의 곡들로만 연습합니다.
- 다음으로, 오프라인 DPO를 수행합니다: 이것은 엄격한 코치와 같습니다. 로봇이 많은 버전의 노래를 생성하면, 코치는 가사를 가장 잘 따르고 프롬프트(요청)와 가장 유사한 곡을 골라냅니다. 로봇은 "환각 현상"(가짜 단어를 만들어내는 것)을 멈추고 지시를 따르는 법을 배웁니다.
- 마지막으로, 세미 온라인 DPO를 수행합니다: 로봇은 스스로 새로운 노래를 생성하기 시작하며 자신의 개선 사항으로부터 배웁니다. 이를 통해 규율을 잃지 않으면서도 예술적 창의성을 높입니다.
3단계: 마스터클래스 (모듈형 확장)
이제 계획을 담당하는 장군은 완벽해졌으며, 수정되지 않도록 고정(frozen)됩니다. 특수 부대(디테일 팀)가 추가 훈련을 받습니다. 이들은 거친 스케치를 아주 선명하고 고해상도의 녹음본으로 바꾸는 연습을 합니다. 이를 통해 보컬과 악기 소리가 풍부하고 상세하게 들리도록 보장합니다.
3. "미적 가이드"
이 논문의 핵심 혁신은 자동화된 음악 미적 평가 프레임워크입니다. 로봇 심사위지가 노래를 듣고 "음악성"에 점수를 매긴다고 상상해 보세요.
- 학습 과정에서 이 심사위원은 노래에 "음악성 등급"(예: "최상위", "평균", "낮음")을 태그로 붙입니다.
- 로봇은 "최상위" 태그를 보면 놀라운 결과물을 만들어내야 한다는 것을 배웁니다.
- 이를 통해 로봇은 단순히 무작정 따라 하는 것이 아니라, 왜 어떤 노래가 다른 노래보다 더 좋은지를 이해하게 됩니다.
4. 결과: 얼마나 뛰어난가?
저자들은 LeVo 2를 다른 오픈 소스 모델 및 유명한 상용 시스템(Suno, Mureka 등)과 비교 테스트했습니다.
- 오픈 소스보다 우수함: LeVo 2는 멜로디, 편곡, 음질을 포함한 거의 모든 카테로리에서 다른 모든 오픈 소스 모델을 이겼습니다.
- 전문가 수준에 근접: 비밀리에 운영되는 상위 상용 시스템들의 성능에 매우 근접한 성과를 보여주었습니다.
- 지시 이행 능력: 가사를 정확하게 부르고 요청한 분위기(감정)를 맞추는 데 매우 뛰어났으며, AI가 엉뚱한 단어를 만들어내는 "환각 현상"을 크게 줄였습니다.
요약
LeVo 2는 AI 음악을 만드는 새로운 방식입니다. 하나의 뇌가 모든 것을 한꺼번에 처리하는 대신, 계층적 팀(설계자와 디테일 전문가)과 단계별 학습 학교를 사용합니다. 이 학교는 AI에게 먼저 음악 이론을 이해시키고, 그다음 규칙을 따르는 법을 배우게 하며, 마지막으로 소리를 완벽하게 다듬는 법을 가르칩니다. 그 결과, 놀라울 정도로 인간처럼 들리는, 일관성 있고 고품질의 풀 버전 노래를 생성할 수 있는 시스템이 탄생했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.