← 최신 논문
🤖 AI

End-to-End Training for Discrete Token LLM based TTS System

이 논문은 이산 토큰 기반 TTS 구성 요소들을 통합하기 위해 음성 토크나이저, 자기회귀 LLM, 플로우 매칭 모델, 그리고 보상 모델을 공동으로 최적화하는 완전한 엔드 투 엔드 학습 프레임을 제안하며, 이를 통해 기존의 계단식 방식에 비해 현저히 단순해진 파이프라인으로 새로운 최첨단 성능을 달성한다.

원저자: Changfeng Gao, Yong Ren, Jun Yuan, Ye Bai, Zhao You, ShiDong Shang

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Changfeng Gao, Yong Ren, Jun Yuan, Ye Bai, Zhao You, ShiDong Shang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 이어달리기에서 교향곡으로

텍스트 음성 변환(TTS) 시스템(글자를 소리 내어 읽어주는 컴퓨터)을 구축하는 것을 이어달리기 팀을 만드는 것에 비유해 봅시다.

기존 방식 (계단식 파이프라인):
대부분의 현재 시스템에는 세 명의 별도 주자가 있습니다:

  1. 번역가 (토크나이저): 목소리의 소리를 가져와 숫자로 된 비밀 코드(토큰)로 바꿉니다.
  2. 예측가 (LLM): 텍스트를 읽고 그 비밀 코드 속의 다음 숫자를 추측합니다.
  3. 가수 (FM 모델): 추측된 숫자들을 가져와 다시 음파로 바꿉니다.

문제는 무엇일까요? 이 세 명의 주자는 각자 따로 훈련한다는 점입니다. 번역가는 음성 인식(ASR)을 잘하도록 훈련받고, 예측가는 숫자를 맞히도록 훈련받으며, 가수는 소리를 재구성하도록 훈련받습니다. 이들은 연습 기간 동안 서로 대화하지 않습니다. 마침내 함께 경주를 시작할 때, 서로의 스타일을 모르기 때문에 비틀거리게 됩니다. 이는 마치 번역가가 예측가가 이해할 수 없는 방언을 사용하는 것과 같아서, 결국 엉망인 최종 공연으로 이어집니다.

새로운 방식 (엔드 투 엔드 훈련):
이 논문은 이 세 명의 주자(그리고 코치 한 명)를 하나의 거대하고 통합된 연습 세션에서 함께 훈련할 것을 제안합니다. 이들은 같은 언어를 말하는 법을 배우고, 서로의 움직임을 예측하며, 실시간으로 자신의 성과를 조정하는 법을 배웁니다 통합니다.


등장인물

  1. 음성 토크나이저 (번역가):

    • 하는 일: 인간의 목소리를 아주 작은 단위의 불연속적인 "레고 블록"(토큰)으로 쪼갭니다.
    • 기존의 문제: 이 모델은 컴퓨터의 다음 단계를 위해서가 아니라, 인간을 위한 좋은 번역가(음성-텍스트 변환 앱 등)가 되도록 훈련되었습니다.
    • 해결책: 이 새로운 시스템에서 번역가는 예측가와 가수가 사용하기에 특별히 설계된 레고 블록을 만드는 법을 배웁니다.
  2. LLM (예측가):

    • 하는 일: 당신이 입력한 텍스트를 읽고, 그것을 말하는 데 필요한 레고 블록의 순서를 예측합니다.
    • 기존의 문제: "가장 확률이 높은" 블록을 맞히도록 훈련되었는데, 이로 인해 목소리가 단조롭고 지루하거나 "평균적인" 소리로 들리는 경우가 많았습니다.
      এটি 단순히 통계적으로 확률이 높은 것이 아니라, 실제로 소리가 좋은지에 대해 가수와 코치로부터 즉각적인 피드백을 받습니다.
  3. 플로우 매칭 모델 (가수):

    • 하는 일: 레고 블록을 가져와 실제 음성 파형을 만들어냅니다.
    • 기존의 문제: 이 모델은 완벽한 블록(정답 데이터)을 가지고 훈련받았지만, 실제 상황에서는 예측가가 실수를 저지릅니다. 그래서 완벽하지 않은 블록을 받으면 가수는 무너지곤 했습니다.
    • 해결책: 블록이 약간 불완전하더라도 노래할 수 있도록 학습하여, 시스템을 더 견고하게 만듭니다.
  4. 보상 모델 (코치):

    • 하는 일: 이 모델은 새로 추가된 요소입니다. 출력물을 듣고 세 가지를 확인합니다: "제대로 된 단어를 말했는가?" (ASR), "적절한 사람의 목소리인가?" (화자 식별), "감정이 실려 있는가?" (감정).
    • 역할: 심판 역할을 하며 발음과 스타일이 좋은지에 대해 점수를 부여함으로써, 팀 전체가 더 나은 공연을 할 수 있도록 이끌어줍니다.

훈련 방법: 3단계 리허설

저자들은 단순히 모두를 한꺼번에 경기장에 던져 넣은 것이 아니라, 안정성을 유지하기 위해 스마트한 3단계 훈련 파이프라인을 사용했습니다.

1단계: 기초 다지기 (1차 손실 - First-Order Loss)

  • 비유: 번역가, 예측가, 가수가 모두 완벽한 대본과 완벽한 녹음본을 함께 보고 있다고 상상해 보세요.
  • 진행 과정: 이들은 함께 학습합니다. 번역가는 예측가가 맞히기 쉽고 가수가 사용하기 쉬운 블록을 만드는 법을 배웁니다. 코치는 블록이 올바른 의미와 감정을 담고 있는지 감시합니다.
  • 목표: 모두가 같은 선상에 서게 하고, 번역가가 다른 이들을 혼란스럽게 하는 "나쁜" 블록을 만드는 것을 방지합니다.

2단계: 개별 연습 (Independent Practice)

  • 비유: 이제 번역가는 숙련자가 되어 변하지 않습니다. 예측가와 가수는 각자 연습하지만, 서로 다른 데이터셋을 사용할 수 있습니다 (예를 들어, 가수는 노이즈가 있는 녹음본으로 연습하고, 예측가는 깨끗한 녹음본으로 연습할 수 있습니다).
  • 목표: 번역가의 코드를 망가뜨리지 않으면서 가수의 기술과 예측가의 기술을 미세 조정합니다.

3단계: 전체 드레스 리허설 (2차 손실 - Second-Order Loss)

  • 비유: 이것이 바로 본 게임입니다. 이제 예측가는 (완벽한 블록 대신) 블록을 직접 추측하며 실수를 할 수 있습니다. 가수와 코치는 이러한 불완전한 추측을 다뤄야 합니다.
  • 마법 같은 일: 만약 예측가가 틀린 블록을 추측하면, 가수와 코치는 예측가에게 "그 추측 때문에 목소리가 이상해졌으니 다시 해봐"라는 신호를 보냅니다.
  • 목표: 이 과정이 루프를 완성합니다. 예측가는 가수가 실제로 처리할 수 있는 추측을 하는 법을 배우고, 가수는 오류에 대해 견고해지는 법을 배웁니다. 이를 통해 '훈련-테스트 불일치'(시스템이 훈련 때는 잘 작동하지만 실제 환경에서는 실패하는 현상)를 제거합니다.

결과: 왜 중요한가

이 논문은 모두를 함께 훈련함으로써 시스템이 훨씬 더 좋아진다고 주장합니다.

  • 더 높은 정확도: 표준 테스트(Seed-TTS)에서 이들의 시스템은 발음 오류가 매우 적었습니다 (중국어 단어 오류율 0.78%, 영어 1.56%). 이는 새로운 "SOTA(최첨단)" 기록입니다.
  • 더 작은 모델: 이들은 상대적으로 작은 모델(예측가 0.6B, 가수 0.5B 파라미터)을 사용하여 이 성과를 달랐으며, 효율적으로 훈련한다면 거대하고 비대한 시스템 없이도 훌륭한 결과를 얻을 수 있음을 증명했습니다.
  • 풍부한 정보량: 이 시스템이 만든 "레고 블록"(토큰)은 더 똑똑합니다. 이 블록들은 소리와 의미 모두에 대한 유용한 정보를 더 많이 담고 있으며, 사용 가능한 "코드북"(모든 가능한 블록의 집합)을 더 효율적으로 사용하여 시스템이 몇 가지 흔한 블록만 사용하고 나머지는 무시하는 문제를 피합니다.

결론

이 논문은 TTS 시스템을 구축할 때 각 부분을 따로 만들고 그것들이 잘 맞기를 바라는 기존 방식이 비효식적이라고 주장합니다. 전체 시스템을 하나의 거대하고 상호 연결된 유기체로 취급하고 엔드 투 엔드로 훈련함으로써, 더 정확하고, 더 표현력이 풍부하며, 심지어 더 작은 컴퓨터 모델로도 훈련하기 쉬운 목소리를 얻을 수 있습니다. 이는 낯선 사람들이 모여서 곡을 연주하려고 애쓰는 것과, 수개월 동안 모든 음표를 함께 연습한 밴드가 연주하는 것의 차이와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →