← 최신 논문
⚡ electrical engineering

MPEcho: A Melody and Phoneme-Aware Generative Framework for Controllable Cover Song Generation

이 논문은 명시적인 음소 수준의 컨디셔닝과 길이 조절기를 통합하여 이전의 최첨단 모델들과 비교했을 때 가사 정확도를 크게 향상시키고 음소 오류율을 낮춤으로써 제어 가능한 커버 송 생성을 강화하는 생성 프레임워크인 MPEcho를 소개한다.

원저자: Wei-Jaw Lee, Hsuan-Yu Yeh, Ting-Yi Hu, Chih-Pin Tan, Fang-Duo Tsai, Yi-Hsuan Yang

게시일 2026-07-30
📖 5 분 읽기🧠 심층 분석

원저자: Wei-Jaw Lee, Hsuan-Yu Yeh, Ting-Yi Hu, Chih-Pin Tan, Fang-Duo Tsai, Yi-Hsuan Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 가장 좋아하는 노래를 가져와서 즉시 완전히 새로운 스타일로 리믹스할 수 있는 세상을 상상해 보세요. 예를 들어 슬픈 발라드를 경쾌한 록 찬가로 바꾸는 식이죠. 이때 원래의 멜로디와 가사는 완벽하게 유지하면서 말입니다. 이것이 바로 AI가 음악적 카멜레온이 되도록 학습시키려는 '커버 송 생성(Cover Song Generation)'이라는 분야의 꿈입니다. 이를 위해 AI는 두 가지 매우 다른 것을 동시에 이해해야 합니다. 바로 '음악'(선율, 리듬, 음표)과 '단어'('ㅂ'과 'ㅍ'의 차이처럼 언어를 구성하는 구체적인 소리)입니다. 이것은 마치 맛(가사)을 위한 엄격한 레시피를 따르면서 동시에 새로운 장식 스타일(음악)을 즉흥적으로 만들어내는 케이크를 굽는 것과 같습니다. 만약 AI가 장식은 잘 만들었지만 맛을 틀렸다면, 초콜릿 케이크에서 레몬 맛이 나는 결과를 얻게 될 것입니다. 오랫동안 AI는 장식에는 뛰어났지만 맛에는 형편없었습니다. 가사를 너무 심하게 망가뜨려 횡설수설하게 만들곤 했기 때문입니다.

이 논문은 AI에게 단순히 큰 단어가 아니라 '말소리의 아주 작은 구성 요소'를 듣도록 가르침으로써 이 문제를 해결하는 MPEcho라는 새로운 시스템을 소개합니다. 연구진은 가사를 제대로 구현하려면 컴퓨터가 각 개별 소리가 정확히 언제 시작되고 끝나는지를 알아야 한다는 점을 깨달았습니다. 이는 마치 지휘자가 바이올리니스트가 단 하나의 음을 연주해야 할 정확한 타이밍을 아는 것과 같습니다. 이를 위해 그들은 Phonsa라는 특별한 도구를 만들었습니다. 이는 마치 초정밀 기록관처럼 노래하는 사람의 목소리를 듣고 모든 소리의 정확한 타이밍을 기록합니다. 이 정밀한 타이밍을 멜로디와 결래함으로써, MPEcho는 가사가 명확하고 선율은 충실한 새로운 커버 송을 생성할 수 있습니다. 결과에 따르면, 이 접근 방식은 AI가 노래할 때 발생하는 오류 횟수를 획기적으로 줄여, 단어 오류율을 거의 절반에 육박하던 수준에서 5분의 1 미만으로 떨어뜨렸습니다. 이는 소리의 미세한 디테일에 주의를 기울이는 것이 AI가 더 잘 노래하게 만드는 비결임을 증명합니다.

문제점: AI가 노래할 때, 웅얼거린다

커버 송 생성은 까다로운 균형 잡기입니다. 당신은 참조 곡의 핵심 멜로디와 정확한 가사는 유지하면서도 스타일, 악기, 목소리는 바꾸고 싶어 합니다. SongEcho라는 모델을 포함한 이전의 시도들은 AI에게 '피치'(음의 높낮이)와 단순히 "노래 중" 또는 "노래 중 아님"이라고 알려주는 간단한 태그를 입력하는 방식으로 이를 해결하려 했습니다.

친구에게 노래를 불러달라고 부탁하면서 멜로디만 흥얼거리고 "나 지금 노래하고 있어" 또는 "나 지금 노래 안 하고 있어"라고만 말하는 상황을 상상해 보세요. 별로 도움이 되지 않을 것입니다! AI는 멜로디는 흉내 낼 수 있겠지만, 어떤 단어를 노래해야 하는지, 혹은 언제 한 소리에서 다음 소리로 전환해야 하는지는 전혀 알 수 없습니다. 그 결과는 어땠을까요? AI는 종종 맞는 멜로디를 부르면서도 가사를 엉망으로 만들어, "Hello"를 "Helo"나 "Halo"로 바꾸어 버렸습니다. 실제로 기존 방식은 단어의 약 **45.62%**에서 실수를 저질렀습니다. 이는 메뉴판의 절반 정도가 오타로 적혀 있는 것과 같습니다.

해결책: 듣고 노래하는 새로운 방법

Wei-Jaw Lee와 Yi-Hsuan Yang이 이끄는 저자들은 가사를 고치기 위해서는 '가창 합성(Singing Voice Synthesis, SVS)'이라는 다른 분야의 기술을 빌려와야 한다는 것을 깨달았습니다. SVS는 보통 악보로부터 특정 노래를 부르는 로봇을 만드는 데 사용되는데, 이는 각 미세한 소리(음소)의 정확한 타이밍을 알고 있기 때문에 매우 뛰어난 성능을 보입니다.

그들은 '음소 인코더(phoneme encoder)'와 '길이 조절기(length regulator)'를 시스템에 추가한 새로운 프레임워크인 MPEcho를 구축했습니다.

  • 음소 인코더: 이제 AI는 단순히 "노래가 진행 중이다"라고 아는 대신, 모든 개별 소리(예: /h/, /e/, /l/, /o/)와 각 소리가 얼마나 지속되어야 하는지에 대한 목록을 받습니다.
  • 길이 조절기: 이는 단어를 위한 메트로놈 역할을 하며, 소리를 늘리거나 줄여서 음악적 타임라인에 완벽하게 맞도록 합니다.

하지만 문제가 있었습니다. MPEcho를 가르치기 위해서는 모든 소리가 이미 완벽하게 타이밍이 맞춰진 방대한 노래 라이브러리가 필요했습니다. 하지만 그런 데이터는 존재하지 않았습니다. 그래서 그들은 Phona를 만들었습니다.

Phonsa는 마법 같은 번역기입니다. 이는 가수의 녹음본을 가져와 노래 속 모든 소리의 정확한 시작 및 종료 시간을 자동으로 기록합니다. 이는 유명한 음성 인식 도구인 Whisper를 기반으로 하지만, 노래에 특화되도록 수정되었습니다. 또한 "숨소리"와 "경계"를 처리하기 위해 특별한 토큰을 추가하고, "청크형(chunked)" 어텐션 시스템(작고 겹치는 조각 단위로 생각하는 방식)을 사용합니다.

결과: 횡설수설에서 명확한 가사로

팀은 1,427시간 이상의 중국 팝 및 전통 가요 데이터셋을 사용하여 새로운 시스템을 테스트했습니다. 그들은 MPEcho를 기존의 SongEcho 모델 및 다른 변형 모델들과 비교했습니다.

  1. 타이밍의 마법: Phonsa를 사용하여 MPEcho에 정밀한 음소 타이밍을 제공했을 때, 단어 오류(음소 오류율, PER)가 극적으로 감소했습니다.

    • 기존 모델 (SongEcho): 단어의 **45.62%**에서 실수를 저질렀습니다.
    • 새로운 모델 (MPEcho): 단어의 **18.65%**에서만 실수를 저질렀습니다.
    • 이는 웅얼거리는 소리를 이해할 수 있는 수준으로 바꾸어 놓은 엄청난 개선입니다.
  2. 최적의 지점: 그들은 멜로디 사용하는 것은 충분하지 않고(가사가 여전히 엉망임), 음소 타이밍 사용하는 것도 좋지 않다(멜로디가 이상해짐)는 것을 발견했습니다. 하지만 두 가지를 결합하여, 즉 AI에게 선율과 정밀한 소리 타이밍을 모두 제공했을 때 최상의 결과를 얻었습니다. 노래는 음악적이었고, 가사는 명확했습니다.

  3. "Jam" 스타일 vs "SVS" 스타일: 그들은 또한 소리를 조직하는 다른 방식(단어별로 그룹화하는 "Jam-style" 대 개별 소리별로 그룹화하는 "SVS-style")을 테스트했습니다. SVS-style이 훨씬 더 효과적이었습니다. "Jam-style"은 "다음 거리로 가세요"라고 방향을 알려주는 것과 같았다면, "SVS-style"은 "빨간 집에서 좌회전한 뒤, 파란 우체통 앞에서 우회전하세요"라고 말하는 것과 같았습니다. 이 정밀함이 AI가 길을 잃지 않도록 도왔습니다.

  4. 인간의 평가: 마지막으로, 그들은 실제 사람들에게 노래를 들려주고 평가를 요청했습니다. 청취자들은 MPEcho의 노래가 멜로디 일관성, 보컬의 자연스러움, 그리고 전반적인 품질 면에서 더 높은 점수를 주었습니다. 흥미롭게도, 인간 청취자들은 컴퓨터 측정치보다 가사의 명확성을 더 높게 평가했는데, 이는 명확한 가사가 훨씬 더 나은 감상 경험을 만든다는 것을 입증합니다.

이것이 의미하는 바

이 논문은 만약 AI가 인간처럼 들리고 명확하게 노래하는 완전한 곡을 생성하기를 원한다면, 단순히 큰 그림(멜로디와 단어)만 봐서는 안 된다는 것을 시사합니다. 더 깊이 파고들어 소리가 만들어지는 찰나의 세부 사항을 이해해야 합니다. 음악 생성의 장점과 음성 합성의 정밀함을 결합함으로써, MPEcho는 AI가 창의적인 예술가처럼 들리면서도 가사를 정확하게 부를 수 있다는 것을 보여줍니다.

연구진은 이 시스템이 현재 단일 가수와 만다린 중국어에 가장 잘 작동한다는 점을 유의사항으로 밝혔습니다. 그들은 향후 연구를 통해 다수의 가수, 다양한 언어, 그리고 더 풍부한 감정 표현까지 확장할 수 있을 것이라고 제안했습니다. 하지만 현재로서는, 그들은 AI가 단순히 듣기 좋은 것을 넘어 실제로 의미가 통하는 커버 송을 만드는 법을 풀어냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →