← 최신 논문
⚡ electrical engineering

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

X-Voice 는 420 만 시간 규모의 말뭉치로 훈련된 경량 04B 다국어 제로샷 음성 복제 모델로, 혁신적인 2 단계 패러다임과 아키텍처 개선을 통해 오디오 프롬프트에 대한 전사본 없이 30 개 언어에서 고품질 음성 합성을 가능하게 하여 수십억 규모 모델과 견줄 만한 성능을 달성합니다.

원저자: Rixi Xu, Qingyu Liu, Haitao Li, Yushen Chen, Zhikang Niu, Yunting Yang, Jian Zhao, Ke Li, Berrak Sisman, Qinyuan Cheng, Xipeng Qiu, Kai Yu, Xie Chen

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rixi Xu, Qingyu Liu, Haitao Li, Yushen Chen, Zhikang Niu, Yunting Yang, Jian Zhao, Ke Li, Berrak Sisman, Qinyuan Cheng, Xipeng Qiu, Kai Yu, Xie Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

30 가지의 서로 다른 언어를 구사하는 법을 배우고 싶지만, 교사도, 교과서도, 심지어 대본도 없다고 상상해 보세요. 오직 친구의 목소리가 담긴 짧은 녹음 파일만 있을 뿐입니다. X-Voice는 이를 가능하게 하는 새로운 AI 모델입니다. 이는 '목소리 카멜레온'으로, 친구의 목소리를 받아 30 가지 언어 중 어떤 언어로도 말하게 할 수 있으며, 심지어 친구가 그 언어들을 한 번도 말해본 적이 없더라도 가능합니다.

다음은 논문을 바탕으로 X-Voice 를 간단한 개념으로 분해하여 설명한 것입니다:

1. 문제: '대본' 병목 현상

현재 대부분의 음성 클로닝 AI 는 대본이 필요한 엄격한 배우와 같습니다. 음성을 클로닝하려면 보통 다음 두 가지가 필요합니다:

  1. 해당 사람의 짧은 오디오 클립.
  2. 해당 클립에서 그 사람이 정확히 무엇을 말했는지에 대한 전사본(문자화된 텍스트).

이는 전사본을 얻기 쉬운 영어나 중국어에서는 훌륭하게 작동합니다. 하지만 많은 다른 언어들 (특히 희귀한 언어나 방언) 에서는 정확한 전사본을 얻는 것이 어렵거나 불가능합니다. 대본이 없으면 AI 는 혼란을 겪고 음성을 제대로 클로닝하지 못합니다.

2. 해결책: 2 단계 훈련 캠프

연구진은 X-Voice 를 '마스터 셰프가 견습생을 훈련시키는' 것과 같은 교묘한 '2 단계' 훈련 방법으로 구축했습니다.

  • 1 단계: 마스터 셰프 (X-Voice1)
    먼저, 30 가지 다른 언어의 42 만 시간 분량의 음성을 바탕으로 거대한 모델을 훈련시켰습니다. 이는 세상의 모든 레시피와 맛을 알고 있는 '마스터 셰프'라고 생각하시면 됩니다. 이 모델은 말하는 데 매우 능숙하지만, 무엇을 말할지 알기 위해서는 여전히 대본이 필요합니다.

  • 2 단계: 견습생 (X-Voice2)
    여기서 마술 같은 트릭이 등장합니다. 연구진은 '마스터 셰프'를 이용해 1 만 시간 분량의 새로운 오디오를 생성했습니다. 실제 음성 클립을 가져와 마스터 셰프에 입력하고, 다른 텍스트를 말하게 요청했습니다.

    이제 이 새로운 오디오 클립들을 가져와 모델에 새로운 교훈을 가르쳤습니다: "대본을 무시하세요. 오직 목소리에만 집중하세요." 그들은 텍스트를 완전히 숨긴 채 오직 오디오만을 사용하여 원래의 목소리를 재현하도록 모델을 훈련시켰습니다. 이렇게 해서 전사본을 읽을 필요가 전혀 없는 최종 모델인 X-Voice2가 탄생했습니다.

3. 비장의 무기: '이중 수준' 언어 주입

AI 에게 오래된 목소리를 사용해 새로운 언어로 말하게 할 때, 흔히 발생하는 문제는 '악센트 누출'입니다. 예를 들어, 프랑스어 화자에게 일본어로 '안녕하세요'라고 말하게 요청하면, AI 는 실수로 프랑스어 악센트를 섞어 말하게 될 수 있습니다.

이를 해결하기 위해 연구진은 이중 수준 언어 주입 (Dual-Level Language Injection) 시스템을 발명했습니다. AI 가 언어를 제어하는 두 가지 다른 '다이얼'을 가지고 있다고 상상해 보세요:

  • 텍스트 다이얼: AI 에게 무슨 단어를 말해야 하는지 알려줍니다.
  • 시간 다이얼: AI 에게 언제 말해야 하는지 그리고 리듬이 어떠해야 하는지 알려줍니다.

두 다이얼을 동시에 조절함으로써 AI 는 목소리(그 사람의 고유한 소리) 와 악센트(언어의 리듬) 를 완벽하게 분리할 수 있습니다. 이는 그 사람이 자신처럼 들리면서도 새로운 언어를 정확하게 말하도록 보장합니다.

4. 결과: 빠르고, 무료이며, 유창함

해당 논문은 X-Voice 가 '0.4B' 모델이라고 주장합니다. 이는 전체 서버 실을 차지하는 거대 모델에 비해 상대적으로 작고 경량임을 의미합니다.

  • 속도: 한 단어씩 작성하는 것과 같은 느린 단계별 '자기회귀 (autoregressive)' 방식을 사용하지 않기 때문에 매우 빠르게 음성을 생성할 수 있습니다.
  • 품질: 테스트에서 훨씬 더 큰 거대 상업용 모델 (Qwen3-TTS 등) 과同等한 성능을 보였지만, 전사본은 필요하지 않았습니다.
  • 오픈 소스: 팀은 모든 데이터 (42 만 시간 분량의 오디오) 와 코드를 무료로 공개하여 누구나 사용할 수 있도록 했습니다.

요약 비유

X-Voice 를 목소리를 위한 범용 번역기라고 생각하세요.

  • 구형 AI: "이 특정 문장을 나에게 읽어주면, 그리고 그 문장의 문자화된 텍스트를 가지고 있다면 당신의 목소리를 클로닝할 수 있습니다."
  • X-Voice: "당신이 5 초 동안 흥얼거리는 클립만으로 당신의 목소리를 클로닝할 수 있으며, 당신이 흥얼거린 단어가 무엇인지 알 필요 없이 즉시 30 가지 다른 언어로 말하게 할 수 있습니다."

논문의 결론은 이 기술이 다국어 음성 클로닝의 가장 큰 장벽인 전사본의 필요성을 제거한다는 것입니다. 짧은 오디오 샘플만 있다면 누구나 누구의 목소리로든 어떤 언어든 말하게 할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →