← 최신 논문
💬 NLP

FreyaTTS Technical Report

Freya-TTS는 연속적인 잠재 공간에서 비자기회귀적 조건부 플로우 매칭 디퓨전 트랜스포머를 활용하여 더 큰 오픈 소스 시스템들에 비해 우수한 효율성과 정확도로 고품질의 실시간 대화형 합성을 구현하는, 콤팩트하고 토크나이저가 필요 없는 터키어 우선 텍스트 음성 변환 모델입니다.

원저자: Ahmet Erdem Pamuk, Ömer Yentür, Ahmet Tunga Bayrak, Yavuz Alp Sencer Öztürk, Mustafa Yavuz

게시일 2026-07-13
📖 5 분 읽기🧠 심층 분석

원저자: Ahmet Erdem Pamuk, Ömer Yentür, Ahmet Tunga Bayrak, Yavuz Alp Sencer Öztürk, Mustafa Yavuz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 만약 터키어를 말하는 로봇을 만들고 싶다고 상상해 보십시오. 대부분의 사람들은 거대한 소리 사전을 가르치거나, 모든 단어를 아주 작은, 미리 정의된 조각들(마치 레고 블록처럼)로 나누어 왼쪽에서 오른쪽으로 하나씩 쌓아 올리는 방식으로 이 로봇을 만들려고 시입니다. 이것이 현재 많은 "최첨단" 음성 로봇들이 작동하는 방식입니다. 이들은 거대하고, 구축하는 데 시간이 너무 오래 걸리며, 긴 문장에서 한 번이라도 비틀거리면 숫자를 섞거나 순서를 틀리는 등 스스로의 발에 걸려 넘어지곤 합니다.

FreyaTTS 팀은 완전히 다른, 훨씬 더 작고 똑똑한 접근 방식을 시도하기로 했습니다. 그들은 거대한 사전을 만들거나 벽돌을 하나씩 쌓는 방식 대신, 오디오를 듣고 문장 전체를 한꺼번에 추측하는 법을 배우는 1 억 8,320만 파라미터 규모의 "상상 엔진"을 구축했습니다. 이는 마치 악보를 한 음씩 읽는 것이 아니라, 재즈 뮤지션이 악보 없이 즉흥적으로 풀 솔로를 연주하는 것과 같습니다.

그들의 마술 같은 기술이 어떻게 작동하는지 세 가지 간단한 부분으로 나누어 설명하겠습니다.

1. 얼어붙은 청사진 (The "AudioVAE2")

FreyaTTS 팀을 건축가라고 생각해 보십시오. 그들은 스케치를 아름다운 48kHz 사운드 파형으로 변환하는 법을 이미 알고 있는 완벽하게 미리 지어진 집(AudioVAE2)을 발견했습니다. 이 집은 너무나 훌륭해서 팀은 이를 절대로 건드리지 않기로 결정했습니다. 그들은 이를 제자리에 고정(freeze)시켰습니다.

소리 파형을 만드는 법을 가르치는 데 시간을 낭비하지 않았기 때문에, 그들은 100%의 두뇌 에너지를 로봇에게 무엇을 말할지 가르치는 데 사용할 수 있었습니다. 그들은 글자를 소리로 바꾸는 번역기(phonemizer)도 필요 없었고, 단어를 작은 소리 토큰으로 쪼갤 필요도 없었습니다. 그저 로보에게 생생한 터키어 텍스트(ç, ğ, ı, ö, ş, ü와 같은 특수 문자를 포함한 92개 기호)를 입력하고 스스로 발음을 깨우치도록 내버려 두었습니다. 이는 아이에게 음성학 교과서를 주는 대신, 대화를 통해 말을 가르치는 것과 같습니다.

2. "한꺼번에" 하는 마법 (Non-Autoregressive)

대부분의 음성 로봇은 느린 타이피스트와 같습니다. 한 글자를 치고, 그다음 글자를 치고, 그다음 글자를 치는 식입니다. 만약 초기에 실수를 하면 문장 전체가 엉망이 됩니다. 이를 "자기회귀적(autoregressive)" 생성이라고 합니다.

FreyaTTS는 다릅니다. 그것은 전체 캔버스를 보고 한 번에 전체 그림을 그려내는 화가와 같습니다. 이 모델은 **조건부 플로우 매칭 디퓨전 트랜스포머(conditional flow-matching Diffusion Transformer)**를 사용하여 문장 전체의 소리 패턴을 병렬로 예측합니다.

  • 비유: 친구의 목소리를 추측하고 있다고 상 imagine 해보십시오. 한 번에 한 단어씩 추측하는 대신(이 방식은 잘못된 단어를 추측하여 문장을 망칠 수 있습니다), FreyaTTS는 문장 전체의 리듬과 톤을 한꺼번에 추측합니다.
  • 결과: 이를 통해 "왼쪽에서 오른쪽으로 발생하는 오류 누적"을 피할 수 있습니다. 만약 긴 숫자 목록을 말하라고 요청해도, 중간에 혼란에 빠지지 않습니다. 전체 지속 시간과 전체 소리 패턴을 동시에 예측하기 때문입니다.

3. "목소리 잠금" (일관성 유지)

처음 이 로봇을 처음부터 훈련시켰을 때, 로봇은 약간 카멜레온 같았습니다. 당신이 "Hello"라고 말하라고 할 때마다 매번 다른 사람처럼 들렸습니다. 어떤 때는 저음의 남성처럼 들리다가, 다음에는 높은 톤의 아이처럼 들리기도 했습니다. 이는 로봇이 다양한 목소리가 섞인 데이터로부터 학습했기 때문에 고유한 정체성이 없었기 때문입니다.

이를 해결하기 위해 팀은 두 단계의 "목소리 잠금" 과정을 거쳤습니다.

  1. 1단계: 로봇에게 특정한 한 사람(전문 성우 한 명)을 흉내 내도록 가르쳤습니다. 이를 통해 로봇의 목소리 피치 변화를 거친 74.9 Hz에서 안정적인 5.0 Hz로 압축했습니다. 이제 로봇은 매번 동일한 사람처럼 들립니다.
  2. 2단계: 팀은 로봇이 짧은 구절(예: "Yes" 또는 "No")에 취약하다는 것을 깨달았습니다. 그래서 짧은 한 단어 및 두 단어 문장에 대한 추가 연습을 집중적으로 실시했습니다.

결과: 작지만 강력함

팀은 자신들의 로봇을 다른 유명한 오픈 소스 음성 모델들과 테스트했습니다. 결과는 다음과 같습니다.

  • 크기: FreyaTTS는 XTTS-v2(470M)나 F5-TTS(336M) 같은 거인들에 비해 매우 작은 1억 8,320만(183.2M) 파라미터를 가집니다.
  • 정확도: 495개의 터키어 문장을 대상으로 한 테스트에서, FreyaTTS는 더 큰 모델들보다 적은 실수를 기록했습니다. 이 모델은 **8.0%의 단어 오류율(WER)**과 **3.0%의 문자 오류율(CER)**을 달려냈습니다.
    • 참고: 더 큰 모델들은 각각 **11.1%**와 **24.3%**를 기록했습니다.
  • 속도: 다음 단어가 끝나기를 기다릴 필요가 없기 때문에 믿을 수 없을 정도로 빠릅니다. 표준 소비자용 그래픽 카드에서 실시간 계수(real-time factor) 0.11로 실행됩니다. 이는 10초 분량의 오디오를 단 1.1초 만에 생성할 수 있음을 의미합니다.
  • 노트북 성능: 매우 효율적이어서 노트북 CPU(예: Apple M3)에서도 실시간보다 빠르게 실행될 수 있어, 휴대폰이나 소형 기기에 적합합니다.

그들이 명시적으로 밝힌 "아닌 것들"

논문은 FreyaTTS가 무엇이 아닌지를 매우 명확히 밝히고 있습니다.

  • 이 모델은 당신이 제공한 클립을 통해 어떤 목소리든 흉내 낼 수 있는 "제로샷(zero-shot)" 클로닝 모델이 아닙니다. 이것은 단일 목소리(single-voice) 모델입니다. 훈련된 하나의 목소리만을 얻게 됩니다.
  • 이 모델은 50개 이상의 언어를 동시에 말하려고 노력하는 거대한 다국어 기반 모델이 아닙니다. 이것은 터키어에 특화된 터키어 우선(Turkish-first) 모델입니다.
  • 이 모델은 글자를 소리로 변환하는 규칙 기반 시스템인 "포네마이저(phonemizer)"를 사용하지 않습니다. 오디오에서 직접 소리를 학습합니다.
  • 이 모델은 숫자가 쓰여진 형태(예: "1999")를 읽는 데 완벽하지 않습니다. 논문에서는 긴 숫자 배열의 지속 시간 문제로 인해, 모델에 입력하기 전에 숫자를 말하는 형태(예: "천 구백 구십 구")로 확장해 주어야 한다고 언급하고 있습니다.

얼마나 확신하는가?

팀은 단순히 추측한 것이 아니라 모든 것을 측정했기 때문에 이 수치들에 대해 매우 확신하고 있습니다.

  • 그들은 495개의 문장으로 구성된 Freya-TR-Eval이라는 특정 벤치마크를 구축했습니다.
  • 결과가 운이 아니라는 것을 확인하기 위해 "부트스트랩(bootstrap)" 방법을 사용하여 테스트를 10,000번 실행했습니다.
  • 동일한 문장과 동일한 채점 규칙을 사용하여 모델을 비교했습니다(공정한 경쟁을 위해 모두 8kHz로 다운샘플링함).
  • 또한 "목소리 잠금" 안정성을 측정하여, 훈련 단계 이후 피치 변화가 74.9 Hz에서 5.0 Hz로 떨어졌음을 보여주었습니다.

요약하자면, FreyaTTS는 훌륭한 터키어 음성을 만들기 위해 수십억 달러짜리 다국어 괴물이 필요하지 않다는 것을 증명합니다. 노트북에서 실행 가능하고, 일관된 목소리를 내며, 거대 모델들보다 터키어를 더 잘 말하는 작고 전문화된 "한꺼번에" 방식의 엔진을 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →