← 최신 논문
💬 NLP

JaiTTS: A Thai Voice Cloning Model

JaiTTS-v1.0 는 VoxCPM 아키텍처를 기반으로 한 최첨단 태국어 음성 복제 텍스트-음성 변환 모델로, 명시적인 텍스트 정규화 없이 코드스위칭과 숫자를 효과적으로 처리하여 인간 평가에서 상업용 플래그십 모델을 능가하는 우수한 문자 오류율을 달성합니다.

원저자: Jullajak Karnjanaekarin, Pontakorn Trakuekul, Narongkorn Panitsrisit, Sumana Sumanakul, Vichayuth Nitayasomboon, Nithid Guntasin, Thanavin Denkavin, Attapol T. Rutherford

게시일 2026-05-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jullajak Karnjanaekarin, Pontakorn Trakuekul, Narongkorn Panitsrisit, Sumana Sumanakul, Vichayuth Nitayasomboon, Nithid Guntasin, Thanavin Denkavin, Attapol T. Rutherford

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마스터 셰프가 어떤 요리든 만들 수 있지만, 실제로 완벽하게 조리할 수 있는 것은 영어 요리뿐이라고 상상해 보세요. 태국 요리를 부탁하면 향신료를 잘못 섞을 수도 있고, 태국과 영어 재료를 섞은 요리를 부탁하면 혼란스러워할 수도 있습니다.

JaiTTS는 태국 목소리와 이야기로 구성된 방대한 라이브러리를 통해 특별히 훈련된 새로운 전문 태국 셰프와 같습니다. 이 논문이 그들의 새로운 창작물에 대해 설명하는 내용을 간단히 정리해 보겠습니다:

1. 문제: "영어 전용" 셰프

현재 존재하는 최상의 음성 복제 도구 대부분이 바로 그 영어 전용 셰프와 같습니다. 영어에는 훌륭하게 작동하지만 태국어에는 어려움을 겪습니다.

  • 억양 문제: 태국어를 말하려고 할 때, 때로는 어조의 (언어의 음악적인 상승과 하강) 오차를 범합니다.
  • "코드 스위칭"의 어려움: 실제 생활에서 태국 사람들은 태국 문장 안에 영어 단어를 섞어 쓰는 경우가 많습니다 (예: "내 스케줄을 확인해야 해"라고 말하는 것). 기존 태국어 도구들은 이런 혼합을 처리하지 못하거나, 먼저 인간이 텍스트를 정리해야만 작동합니다.
  • 긴 이야기 문제: 일부 태국어 도구는 짧은 문장에는 훌륭하지만, 긴 이야기를 요청하면 로봇처럼 들리거나 작동이 멈춥니다.

2. 해결책: JaiTTS-v1.0

이 팀은 태국어를 위해 특별히 설계된 새로운 음성 모델인 JaiTTS-v1.0을 개발했습니다. 10,000시간 분량의 태국 오디오를 직접 학습한 "슈퍼 셰프"라고 생각하면 됩니다.

작동 원리 (주방 비유):
미리 만들어진 레시피 책 (단어를 조각으로 나누는 "토크나이저"와 같은 것) 을 사용하는 대신, JaiTTS는 듣고 모방함으로써 조리하는 법을 배웁니다.

  • 기획자 (TSLM): 이 부분은 텍스트를 읽고 무엇을 말하고 어떻게 말할지 (감정과 리듬) 결정합니다.
  • 골격 (FSQ): 그림의 스케치처럼 소리의 대략적인 윤곽을 만듭니다.
  • 정제자 (RALM): 이 부분은 음성의 구체적인 질감과 화자의 고유한 개성 같은 세부 사항을 추가합니다.
  • 화가 (LocDiT): 마지막으로 이 부분은 스케치와 세부 사항을 실제 매끄럽고 연속적인 오디오 파형으로 변환합니다.

3. 특별한 기술

  • "사전 정리" 불필요: "500 바트 있다"처럼 숫자가 섞인 지저분한 문장이나 영어/태국어가 혼합된 문장을 입력하면, 인간이 먼저 다시 쓰게 할 필요 없이 즉시 원시 텍스트를 이해합니다.
  • 짧고 긴 이야기: 짧은 문구 (문자 메시지 같은 것) 와 긴 이야기 (팟캐스트 세그먼트 같은 것) 모두에서 테스트되었습니다. 다른 태국어 도구들이 긴 이야기에서 종종 실패하는 반면, 이 모델은 둘 다 잘 처리합니다.

4. 맛보기 (결과)

이 팀은 JaiTTS를 다른 유명한 오픈소스 모델들과 심지어 엘레븐랩스 (ElevenLabs) 와 미니맥스 (MiniMax) 같은 최상급 상업용 음성 생성기와 비교하여 테스트했습니다.

  • 정확도: 컴퓨터가 말한 내용을 전사해 보라는 "청취 테스트"에서 JaiTTS는 모방한 인간 화자 (오류율 1.98%) 보다도 적은 오류 (1.94% 오류율) 를 범했습니다. 그 정도로 정확했습니다!
  • 목소리 유사성: 특정 사람처럼 들리게 하라는 요청에 대해 훌륭한 성과를 냈으며, 원래 목소리와 매우 밀접하게 일치했습니다.
  • 속도: 놀라울 정도로 빠릅니다. 실시간보다 거의 9 배 빠른 속도로 음성을 생성할 수 있습니다. 한 페이지를 읽는 동안 한 권의 책을 타이핑할 수 있는 타자수와 같은 것입니다.
  • 인간 평가: 20 명의 실제 태국 화자가 JaiTTS 와 주요 상업용 경쟁사를 비교해 들었을 때, 70% 의 경우 JaiTTS 를 선호했습니다. 400 회의 직접 비교 투표에서 JaiTTS 는 283 번 승리하고 58 번만 패배했습니다.

요약

JaiTTS는 혼합 언어나 숫자를 이해하는 데 도움이 필요 없는 새로운 고효율 태국어 음성 복제 도구입니다. 다른 오픈소스 옵션들보다 더 자연스럽고 정확하게 들리며, 실제 인간 목소리를 모방하는 능력 면에서 일부 비싼 상업용 시스템보다도 뛰어나고, 번개 같은 속도로 작동합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →