← 최신 논문
⚡ electrical engineering

Praxy Voice: Voice-Prompt Recovery + BUPS for Commercial-Class Indic TTS from a Frozen Non-Indic Base at Zero Commercial-Training-Data Cost

Praxy Voice 는 상업용 텍스트-음성 변환 성능을 달성하기 위해 스크립트 변환을 위한 브라흐미 통일 음소 공간 (BUPS), 라이선스된 데이터로 훈련된 텍스트 전용 LoRA 어댑터, 그리고 특정 음성 프롬프트 샘플링 레시피를 결합하여 상업용 훈련 데이터나 음향 디코더 재훈련 없이 텔루구어, 타밀어, 힌디어에 대해 이를 실현합니다.

원저자: Venkata Pushpak Teja Menta

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Venkata Pushpak Teja Menta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 세계적 수준의 셰프 ( Chatterbox AI) 가 영어, 스페인어, 프랑스어 등 23 개 언어로 맛있는 요리를 할 수 있다고 가정해 봅시다. 하지만 이 셰프는 텔루구어, 타밀어, 힌디어라는 세 가지 특정 지역을 위해 요리해 본 적이 없습니다. 만약 텔루구어 요리를 요청하면, 현지 레시피를 모르기 때문에 거절하거나 재료를 이상하게 섞어 먹지 못할 정도로 엉뚱한 요리를 내놓습니다.

이 논문은 Praxy Voice라는 영리한 "주방 해킹"을 소개합니다. 이는 새로운 셰프를 고용하거나, 새로운 재료 (상업적 학습 데이터) 를 구매하거나, 셰프에게 처음부터 요리하는 법을 가르치지 않고도 동일한 셰프로 텔루구어, 타밀어, 힌디어 요리를 완벽하게 만들 수 있게 해줍니다.

다음은 이를 세 가지 간단한 단계로 나눈 방법입니다:

1. 범용 번역기 (BUPS)

문제: 셰프는 라틴 문자 (A, B, C) 만 이해합니다. 텔루구어 문자 (원과 선처럼 보임) 로 레시피를 작성하면, 셰프는 이를 의미 없는 글자로 인식합니다.
해결: 팀은 BUPS라는 도구를 개발했습니다. 이는 셰프가 레시피를 보기 전에 텔루구어, 타밀어, 힌디어 문자를 즉시 라틴 문자로 변환하는 마법 같은 번역기라고 생각하세요.

  • 유사성: 외국 문자로 쓰인 손편인을 스캔하여 컴퓨터가 즉시 영어로 타이핑해 셰프가 읽을 수 있게 하는 것과 같습니다. 의미와 소리는 그대로 유지되지만, 이제 셰프가 지시를 실제로 처리할 수 있게 됩니다.

2. 전문 부셰프 (LoRA 어댑터)

문제: BUPS 덕분에 셰프가 이제 레시피를 읽을 수는 있지만, 여전히 그것을 어떻게 요리할지는 모릅니다. "카레"라는 단어를 읽더라도 인도 음식을 만들어 본 적이 없기 때문에 스튜처럼 요리할 수 있습니다.
해결: 팀은 셰프의 레시피를 읽는 뇌 부분에 작은 전문 조수 (LoRA 어댑터) 를 추가했습니다.

  • 마법: 이 조수를 약 1,220 시간의 라이선스된 인도 오디오 (퍼블릭 도메인 팟캐스트 및 뉴스 등) 로 훈련시켰습니다.
  • 기교: 셰프가 텔루구어나 타밀어를 모르기 때문에, 팀은 조수에게 레시피를 힌디어인 것처럼 속이라고 지시했습니다 (셰프는 힌디어를 알기 때문입니다). 텔루구어와 힌디어가 발음상 어느 정도 유사하기 때문에, 셰프는 기존 "힌디어 요리 스타일"을 기반으로 사용하고 조수가 이를 텔루구어나 타밀어처럼 들리게 하도록 미세하게 조정합니다.
  • 결과: 이 조수는 매우 작습니다 (셰프의 총 뇌 능력의 1% 미만) 하지만 엄청난 차이를 만듭니다.

3. "맛보기" 레시피 (음성 프롬프트 및 Config B)

문제: 번역기와 조수가 있더라도, 셰프의 목소리는 이러한 새로운 언어를 말할 때 약간 "외국인" 같거나 로봇 같습니다. 이해는 되지만 원어민의 자연스러운 리듬과 억양이 부족합니다.
해결: 팀은 마지막 단계에 대한 특정 "레시피"를 발견했습니다:

  • 음성 프롬프트: 요리하기 전에 원어민의 8~11 초 음성 클립을 셰프에게 들려줍니다. 이는 "이 요리가 정확히 이렇게 들려야 한다"는 셰프에게 알려주는 "맛보기" 역할을 합니다.
  • "Config B" 설정: 팀은 셰프의 오븐에 있는 세 개의 다이얼 (온도, 과장, 필터링) 을 조정했습니다.
    • 유사성: 셰프가 약불로 요리하고 있었다고 상상해 보세요. 팀은 열을 약간 높이고 양념을 조절하여 풍미를 살렸습니다. 이러한 특정 설정 (과장 0.7, 온도 0.6, min_p 0.1) 은 목소리를 자연스럽게 만드는 "최적의 지점"으로 밝혀졌습니다.

"두 가지 분기" 전략

팀은 흥미로운 점을 발견했습니다: 이 전문 조수를 셰프가 이미 요리하는 법을 아는 힌디어에 적용하면, 오히려 요리가 나빠집니다. 조수가 셰프를 혼란스럽게 만들기 때문입니다.

  • 해결: 그들은 스마트한 스위치를 만들었습니다.
    • 입력이 텔루구어나 타밀어인 경우: 번역기 + 조수 + 음성 프롬프트를 사용합니다.
    • 입력이 힌디어인 경우: 조수를 건너뛰고 원래 셰프 + 음성 프롬프트만 사용합니다.
    • 이는 모든 언어에 대해 최고의 품질을 보장합니다.

"혼합 언어" 문제 처리

인도에서는 사람들이 인도어 문장에 영어 단어를 섞어 쓰는 경우가 많습니다 (예: "I sent a WhatsApp message").

  • 문제: 메인 셰프 (Chatterbox) 는 섞인 영어 단어에 혼란을 느껴 이를 묵묵히 삭제해 버립니다.
  • 해결: 이러한 혼합 문장의 경우, 혼합 언어 처리에 더 능숙한 다른 사전 훈련된 셰프 (IndicF5) 를 사용합니다. 하지만 이 셰프도 라틴 문자로 쓰인 영어 단어에는 어려움을 겪습니다.
  • 해킹: 그들은 영어 단어를 발음대로 인도 문자로 다시 쓰도록 하는 작은 AI 도구를 사용하여 (예: "WhatsApp"을 "व्हाट्सऐप"으로 변경), 셰프에게 입력하기 전에 이를 처리합니다. 이렇게 하면 셰프가 단어를 삭제하지 않게 됩니다.

결과

이 시스템을 ElevenLabs 나 Cartesia 같은 최고의 상업적 음성 시스템과 비교하여 테스트했을 때:

  • 텔루구어: 상업적 리더들보다 발음 오류가 적었습니다.
  • 타밀어: 경쟁사보다 특정 어려운 소리 ("zha") 를 훨씬 잘 처리했습니다.
  • 힌디어: 이해도와 명료성 측면에서 최고의 상업적 시스템과 맞먹었습니다.

핵심 결론:
저자들은 인도어에 대해 "상업적 등급"의 음성을 얻기 위해 수백만 달러나 수천 시간의 학습이 필요하지 않음을 증명했습니다. 스마트한 번역기, 작은 전문 조수, 특정 "음성 프롬프트" 레시피를 사용하여 범용 AI 를 무료 (오픈소스 도구와 공개 데이터만 사용) 로 원어민처럼 들리는 인도어 성우로 변모시켰습니다.

그들은 모든 코드와 "조수" 가중치를 누구나 사용할 수 있도록 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →