← 최신 논문
🤖 AI

PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis

PilotTTS 는 200K 시간의 데이터로만 훈련된 재현 가능한 데이터 파이프라인과 미니멀리스트 아키텍처를 사용하여 음성 클로닝, 감정, 방언 합성에서 최첨단 성능을 달성하는 경량 오픈소스 자기회귀형 텍스트 음성 변환 시스템으로, 훨씬 더 큰 데이터셋으로 훈련된 모델들보다 우수한 성능을 보입니다.

원저자: Bowen Li, Shaotong Guo, Zhen Wang, Yang Xiang, Mingli Jin, Yihang Lin, Jiahui Zhao, Weibo Xiong, Dongrui Li, Keming Chen, Yunze Gao, Yuze Zhou, Zeyang Lin, Yue Liu

게시일 2026-05-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bowen Li, Shaotong Guo, Zhen Wang, Yang Xiang, Mingli Jin, Yihang Lin, Jiahui Zhao, Weibo Xiong, Dongrui Li, Keming Chen, Yunze Gao, Yuze Zhou, Zeyang Lin, Yue Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

세상 최고 수준의 성우를 만들고 싶다고 상상해 보세요. 보통 이를 위해 거대하고 비싼 스튜디오, 수백만 시간 분량의 녹음된 대본, 그리고 초복잡한 기계를 구축할 엔지니어 팀이 필요합니다. 이는 공장에 가득 찬 산업용 오븐과 희귀한 독점 재료를 이용해 미쉐린 스타 케이크를 굽는 것과 같습니다.

PilotTTS는 알리바바의 아만 (Amap) 팀이 내놓은 새로운 레시피로, 다음과 같이 말합니다: "공장이 필요하지 않습니다. 정말 훌륭하고 규율이 잘 잡힌 주방과 가진 것을 현명하게 활용하는 방법만 있으면 됩니다."

그들이 어떻게 했는지 간단히 설명해 드리겠습니다:

1. "깨끗한 주방" (데이터 처리)

대부분의 AI 음성 모델은 인터넷에서 긁어온 지저분한 데이터로 훈련됩니다. 이는 벌레가 섞인 밀가루로 케이크를 굽는 것과 같습니다.

  • 과거의 방식: 팀들은 종종 데이터를 정제하기 위해 비밀스럽고 비싼 도구를 사용하여 다른 연구자들을 배제했습니다.
  • PilotTTS 의 방식: 그들은 무료 오픈소스 도구만을 사용하여 "정제 파이프라인"을 구축했습니다. 이는 모든 오디오 클립을 씻고, 분류하며, 검사하는 컨베이어 벨트라고 생각하시면 됩니다.
    • 오디오가 명확한지 (정전기나 배경 소음이 없는지) 확인합니다.
    • 사람들이 서로 겹쳐서 말하는 부분을 잘라냅니다.
    • 모든 것을 완벽하게 라벨링합니다 (누가 말하는지, 무엇을 말하는지, 그리고 어떻게 말하는지).
    • 결과: 그들은 인터넷의 거대한 더미처럼 지저분한 오디오를 20 만 시간 분량의 깨끗하고 고품질 데이터 라이브러리로 바꿨습니다. 이는 폐허를 완벽하게 정리된 도서관으로 바꾸는 것과 같습니다.

2. "현명한 셰프" (모델 아키텍처)

천 개의 움직이는 부품이 있는 거대하고 복잡한 로봇을 만드는 대신, 그들은 "모듈식" 접근법을 사용했습니다. 기존에 입증된 도구들을 가져와 현명하게 새로운 방식으로 연결한 것입니다.

  • 두뇌: 텍스트를 이해하기 위해 강력한 언어 모델 (Qwen3) 을 두뇌로 사용했습니다.
  • "디커플링 (Decoupling)" 트릭: 이것이 그들의 비결입니다. 보통 AI 가 음성을 모방하려 할 때, 그 사람이 누구인지 (고유한 음색) 와 그들이 어떻게 말하는지 (감정이나 속도) 사이에서 혼란을 겪습니다.
    • PilotTTS 는 두 개의 분리된 "센서"(Q-Former 와 CAMPPlus 인코더) 를 사용합니다. 한 센서는 정체성(음성 자체) 에만 집중하고, 다른 하나는 스타일(감정, 속도, 억양) 에 집중합니다.
    • 비유: 화가를 상상해 보세요. 한 붓은 사람의 얼굴(정체성) 을 그리고, 다른 붓은 장면의 분위기(스타일) 를 그립니다. 붓을 분리해 두면 화가는 사람의 얼굴을 실수로 바꾸지 않고도 분위기 (슬프거나 기쁘게 만들기) 를 바꿀 수 있습니다.

3. 무엇을 할 수 있나요?

"음성"과 "스타일"을 분리했기 때문에 시스템은 놀라울 정도로 유연합니다:

  • 제로샷 클로닝: 낯선 사람의 목소리 5 초만 주면 그 목소리로 어떤 텍스트든 말하게 할 수 있습니다. 이는 훨씬 더 큰 데이터셋으로 훈련된 다른 시스템들보다 더 잘 수행했습니다.
  • 감정 제어: "슬프게", "화나게", 또는 "걱정스러운 어조로" 말하도록 지시할 수 있습니다. 11 가지 다른 감정을 구현할 수 있습니다.
  • 비언어적 요소: 웃음, 울음, 기침, 숨소리 같은 인간의 소리를 추가할 수 있습니다. 심지어 웃기 전이나 후가 아니라, 말하는 동안 웃는 "말하면서 웃음 (wrapped laughter)"도 구현할 수 있습니다.
  • 사투리: 14 가지 중국어 사투리로 말할 수 있습니다. 심지어 표준어 (만다린) 로 프롬프트를 입력해도, 화자의 원래 음성 정체성을 유지한 채 출력을 특정 사투리로 전환할 수 있습니다.

4. 결과

이 시스템을 다른 최상급 음성 모델들과 비교 테스트했습니다.

  • 정확도: 말한 내용에서 실수가 매우 적었습니다 (낮은 오류율).
  • 음성 일치도: 경쟁사들이 수백만 시간을 사용한 반면, 이 시스템은 훨씬 적은 데이터 (20 만 시간) 로 훈련되었음에도 불구하고 테스트된 거의 모든 시스템보다 원본 화자와 더 비슷하게 들렸습니다.
  • 효율성: 독점 데이터나 거대하고 복잡한 아키텍처 없이도 이러한 결과를 달성했습니다.

결론

PilotTTS 는 무한한 자원을 가진 거대 기술 기업이 아니더라도 최상급 AI 음성을 구축할 수 있음을 증명합니다. 데이터 품질에 엄격하고 현명하며 모듈식인 설계(누구와 어떻게를 분리) 를 통해, 그들은 업계의 거대 플레이어들과 경쟁할 수 있는 시스템을 만들었습니다.

그들은 자신의 "레시피"(코드 및 데이터 파이프라인) 를 공개하여 누구나 이 "깨끗한 주방"과 "현명한 셰프"의 자체 버전을 구축할 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →