← 최신 논문
⚡ electrical engineering

UniVoice: A Unified Model for Speech and Singing Voice Generation

UniVoice는 조건부 플로우 매칭(conditional flow matching)을 기반으로 하며, 컨디셔닝을 콘텐츠, 멜로디, 음색으로 분해하고 학습된 널 멜로디 토큰(null melody token)을 활용하여 노래를 위한 명시적인 멜로디 제어를 가능하게 하는 동시에 음성을 위한 자연스러운 운율 추론을 허용하는 통합 음성 및 가창 생성 프레임워크이다.

원저자: Junjie Zheng, Huixin Xue, Shihong Ren, Chaofan Ding, Hao Liu, Zihao Chen

게시일 2026-06-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Junjie Zheng, Huixin Xue, Shihong Ren, Chaofan Ding, Hao Liu, Zihao Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 하나의 로봇에게 두 가지 매우 다른 직업을 가르치려 한다고 상상해 보세요: 이야기 들려주기(말하기)와 오페라 공연하기(노래하기)입니다.

보통이라면 당신은 두 개의 별도 로봇을 만들 것입니다. 하나는 자연스럽고 대화하듯 소리를 내며 읽고 있는 단어의 리듬을 따라가도록 설계된 로봇이고, 다른 하나는 엄격한 악보를 따르며 모든 음표와 박자를 정확하게 맞추도록 설계된 로봇입니다.

단 하나의 로봇이 이 두 가지 일을 모두 하도록 만드는 데 발생하는 문제는, 두 직업에 대한 지침이 서로 충돌한다는 점입니다.

  • 노래하기를 위해서는, 로봇이 특정 멜로디(마치 선로 위의 기차처럼)를 따르도록 강제해야 합니다.
  • 말하기를 할 때는, 로봇을 선로에 묶어두면 로봇처럼 들리고 부자연스러워집니다. 로봇은 이야기의 감정에 따라 자유롭게 움직일 수 있어야 합니다.

만약 훈련 데이터를 그냥 섞어버리면 로봇은 혼란에 빠집니다. 로봇은 자유로워져야 할 때 선로를 따르려 하고, 선로를 따라야 할 때 자유로워지려 합니다. 그 결과는 보통 두 가지 모두 형편없게 됩니다.

해결책: UniVoice

연구진은 **Factorized Conditioning(요인 분리 조건화)**이라는 영리한 기술을 사용하여 이 문제를 해결하는 새로운 "로봇"(컴퓨터 모델)인 UniVoice를 만들었습니다. 이것을 하나의 크고 엉망인 스위치 대신 세 개의 별도 제어 노브(조절 손잡이)를 사용하는 것이라고 생각해 보세요.

세 가지 노브는 다음과 같이 작동합니다:

  1. 콘텐츠 노브 (무엇을 말하는가): 이는 가사나 텍스트를 읽습니다. 이는 말하기와 노래하기 모두에 동일하게 적용됩니다.
  2. 음색 노브 (누가 말하는가): 이는 사람의 목소리 샘플(예: 5초 분량의 클립)을 듣고, 속삭이든 고음을 내지르든 그 사람 특유의 소리를 복제합니다.
  3. 멜로디 노브 (선율): 이것이 마법 같은 부분입니다.
    • 노래할 때: 특정 음악 악보(MIDI 음표)를 입력합니다. 로봇은 반드시 이 궤적을 따라야 합니다.
    • 말할 때: 음악 트랙 대신 특별한 **"Null Token(널 토큰)"**을 입력합니다. 이것을 멜로디를 위한 "방해 금지" 표지판이라고 생각하세요. 이것은 로봇에게 이렇게 말합니다: "음악 트랙은 무시하고, 단어에 집중해서 스스로 리듬을 찾아내라."

엔진: 공유된 뇌

내부적으로 UniVoice는 **Diffusion Transformer (DiT)**라는 강력한 엔진을 사용합니다. 이것을 무엇이든 그려낼 수 있는 숙련된 화가라고 상상해 보세요.

  • 과거에는 두 명의 서로 다른 화가가 필요했을 수도 있습니다(말하기용과 노래하기용).
  • UniVoice는 세 가지 제어 노브를 아주 잘 듣는 한 명의 화가를 사용합니다.
  • "멜로디 노브"가 "Null Token"으로 설정되면, 화가는 자연스럽게 리듬을 즉흥적으로 연주하는 법을 압니다. 노브가 특정 곡으로 설정되면, 화가는 악보를 완벽하게 따릅니다.

왜 이것이 중요한가 (결과)

연구진은 방대한 양의 데이터(30,000시간의 음성 및 35,000시간의 노래)를 통해 이를 테스트했습니다. 그 결과는 다음과 같습니다:

  • 두 분야 모두의 달인입니다: UniVoice는 최고의 음성 전용 로봇(F5-TTS 등)만큼 말을 잘하며, 이전의 "올인원" 로봇들보다 훨씬 더 노래를 잘합니다.
  • 효율적입니다: 이 모델은 기존의 통합 모델들보다 훨씬 더 크면서도 성능은 더 떨어졌던 것들과 달리, 상대적으로 작은 크기(0.3 billion parameters)로 이 모든 것을 해냅니다.
  • "Null Token"이 효과가 있습니다: 연구진은 이 특별한 "방해 금지" 표지판을 사용하는 것이, 나중에 노래를 할 수 있는 능력을 해치지 않으면서 모델이 멜로디를 무시하게 만드는 수학적으로 올바른 방법임을 증명했습니다.

새로운 테스트: UNISINGING-EVAL

그들의 로봇이 진정으로 뛰어난지 확인하기 위해, 팀은 UNISINGING-EVAL이라는 새로운 테스트를 구축했습니다. 이것을 팝부터 재즈, 힙합까지 12가지 다양한 음악 장르가 있는 오디션 프로그램이라고 상상해 보세요. 그들은 로봇이 동일한 목소리를 유지하면서 말하기와 노래하기를 전환하고 다양한 스타일을 처리할 수 있는지 테스트했습니다.

핵심 요약

UniVoice는 마치 만능 성우와 같습니다. 말하기와 노래하기를 위해 다시 훈련받거나 다른 뇌를 가질 필요가 없습니다. 그저 지침을 확인할 뿐입니다:

  • "여기 텍스트가 있고, 여기 목소리가 있고, 그리고 여기에 노래가 있다" -> 완벽하게 노래합니다.
  • "여기 텍스트가 있고, 여기 목소리가 있고, 그리고 여기에 노래가 없다" -> 자연스럽게 말합니다.

지침을 분리함으로써, 연구진은 로봇이 혼란에 빠지는 것을 막았고, 이를 통해 두 가지 일을 동시에 훌륭하게 수행할 수 있게 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →