← 최신 논문
⚡ electrical engineering

dots.tts Technical Report

이 논문은 AudioVAE 학습, 전체 이력 조건화(full-history conditioning), 그리고 보상 없는 자기 수정(reward-free self-correction)의 혁신을 통해 다국어 음성 생성, 목소리 복제, 그리고 감정적 표현력 측면에서 최첨단 성능을 달상하는 20억 개의 파라미터를 가진 연속적 자기회귀(autoregressive) TTS 파운데이션 모델인 dots.tts를 소개하며, 동시에 MeanFlow 증류를 통한 저지연 추론을 제공하고 모든 코드와 체크포인트를 오픈 소스로 공개합니다.

원저자: Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, Kai Yu

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, Kai Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 새로운 종류의 성우

당신이 어떤 언어로든 말하고, 어떤 사람처럼 들리며, 어떤 감정이라도 표현할 수 있는 로봇을 만들고 싶다고 상상해 보세요. 오랫동안 대부분의 음성 로봇은 모스 부호 기계처럼 작동했습니다. 말을 하기 전에 단어를 제한된 목록의 "소리 블록(이산적 토큰)"으로 변환해야 했죠. 이는 효율적이었지만, 로봇이 미세한 숨소리, 독특한 웃음소리, 혹은 노래의 복잡한 선율과 같은 인간 음성의 미묘하고 유동적인 뉘앙스를 포착하는 데는 한계가 있었습니다.

dots.tts는 이러한 "소리 블록"을 과감히 버린 새로운 20억 파라미터 규모의 AI 모델입니다. 대신, 이 모델은 음성을 강물처럼 흐르는 물(연속적인 흐름)처럼 취급합니다. 음성을 조각조각 나누는 대신, 흐르는 물속의 다음 아주 작은 물방울 하나를 예측함으로써 훨씬 더 부드럽고 자연스러우며 표현력이 풍부한 목소리를 만들어냅니다.

작동 원리: 3인조 오케스트라

이 논문은 dots.tts를 유동적인 목소리를 만들기 위해 협력하는 세 팀의 팀워크로 설명합니다.

  1. 번역가 (AudioVAE):
    이것은 고해상도 카메라와 프로젝터라고 생각하면 됩니다. 가공되지 않은 음파를 받아 컴퓨터가 이해할 수 있는 "비밀 언어"(연속적인 잠재 공간)로 압축합니다.

    • 혁신 요소: 보통 이러한 비밀 언어들은 지저분하기 마련입니다. dots.tts 팀은 이 번역기가 감정과 음향적 디테일을 온전히 유지하도록 특별한 "선생님"(WavLM)을 사용하여 훈련시켰으며, 이를 통해 다음 팀이 정보를 읽기 쉽게 만들었습니다.
  2. 스토리텔러 (LLM):
    이것은 텍_AI(Qwen2.5)를 기반으로 한 운영의 두뇌입니다. 당신이 입력한 텍스트를 읽고 무엇을 말해야 할지 계획합니다.

    • 혁신 요소: 스토리텔러에게 가공되지 않은 지저분한 오디오 데이터를 직접 전달하는 대신, 팀은 **시맨틱 인코더(Semantic Encoder)**를 구축했습니다. 이것은 "요약 노트" 역할을 합니다. 이 노트는 스토리텔러에게 "지난 몇 초간의 오디오는 행복하고 컸다"라고 기술적인 노이즈에 압도되지 않으면서도 알려줍니다. 이를 통해 스토리텔러가 의미에 집중하게 하여 긴 문장 동안 혼란을 겪지 않도록 합니다.
  3. 화가 (Flow-Matching Head):
    이것은 실제로 소리를 그려내는 예술가입니다. 스토리텔러의 계획과 과거 오디오의 "요약 노트"를 가져와서, 다음 몇 초간의 소리를 그려냅니다.

    • 혁신 요소: 팀은 화가가 아주 작은 실수라도 하면, 다음 단계가 그 실수를 바탕으로 진행되어 목소리가 경로를 벗어나게 된다는 것(마치 '전화기 게임'처럼)을 깨달았습니다. 이를 해결하기 위해 **전체 이력 조건화(Full-History Conditioning)**를 사용합니다. 화가가 마지막 붓터치만 보는 것이 아니라, 지금까지 그린 전체 캔버스를 바라보며 전체 그림이 일관성을 유지하도록 하는 것을 상상해 보세요.

"드리프트(표류)" 문제 해결: 자기 수정 루프

훌륭한 화가가 있더라도 긴 문장을 처리할 때는 실수가 발생할 수 있습니다. 논문은 **보상 없는 자기 수정(Reward-Free Self-Correction)**이라는 영리한 기술을 소개합니다.

  • 비유: 그림을 배우는 학생을 상상해 보세요. 보통은 선생님이 "그 선이 휘었다"라고 말해줘야 합니다. 하지만 여기서 AI는 스스로의 선생님이 됩니다. AI는 그림을 생성한 후, 즉시 그 그림의 작은 부분을 "되돌리고" 다시 그려봄으로써, 인간의 채점 없이도 자신의 실수로부터 배웁니다. 이 "자기 수정형" 훈련은 목소리를 훨씬 안정적으로 만들고 긴 연설 중에 오류가 발생하는 것을 방지합니다.

속도 높이기: "MeanFlow" 지름길

유동적인 소리를 생성하는 것은 컴퓨터가 결과를 제대로 내기 위해 많은 작은 단계를 거쳐야 하므로 보통 느립니다.

  • 비유: 집에서 공원까지 걷는 것을 상상해 보세요. 예전 방식은 100번의 작고 조심스러운 발걸음을 떼는 것입니다. 새로운 방식(MeanFlow Distillation)은 "거기에 도착하려면 4번의 크고 자신감 있는 걸음을 내디뎌라"라고 알려주는 GPS를 가진 것과 같습니다.
  • 결과: 팀은 이 과정을 압축하여 AI가 수많은 단계 대신 단 2~4단계만으로 생성할 수 있게 했습니다. 이를 통해 AI는 매우 빠르게 말을 시작할 수 있으며—단 54밀리초 만에(사람이 눈을 깜빡이는 것보다 빠른 속도)—실시간 대화에 완벽하게 적합합니다.

달성한 성과 (스코어보드)

팀은 기존의 최고 음성 시스템들(CosyVoice, Seed-TTS 및 상용 제품 등)을 대상으로 여러 도전 과제에서 dots.tts를 테스트했습니다.

  • 정확도: 말하는 내용에 대한 실수가 매우 적었으며(낮은 단어 오류율), 표준 테스트에서 거의 모든 모델을 앞질렀습니다.
  • 목소리 복제: 3초 분량의 클립만 주어지면, 다른 오픈 소스 모델보다 높은 "유사도" 점수를 기록할 정도로 완벽하게 흉내 낼 수 있습니다.
  • 다국어 능력: 24개 언어를 유창하게 구사하며, 언어를 전환할 때도 화자의 목소리를 그대로 유지합니다.
  • 표현력: "소리 블록"에 의존하는 이전 모델들보다 노래, 감정 섞인 대화, 그리고 비언어적 소리(한숨이나 웃음 등)와 같은 복잡한 과업을 더 잘 처리합니다.

결론

dots.tts는 목소리 AI를 만들기 위해 음성을 작고 딱딱한 조각으로 나눌 필요가 없다는 것을 증명했다는 점에서 획기적입니다. 음성을 연속적인 흐름으로 취급하고, AI에게 자기 수정 기능과 "전체적인 그림"을 볼 수 있는 도구를 제공함으로써, 이들은 다음과 같은 시스템을 만들었습니다:

  1. 더 자연스러운 (블록 형태가 아닌 물처럼 유동적인).
  2. 더 안정적인 (긴 대화 중에도 경로를 벗어나지 않는).
  3. 실시간 채팅이 가능할 만큼 빠른.

팀은 모든 코드와 모델을 무료로 공개하여, 누구나 이 "연속적"인 음성 기술 접근 방식을 활용해 발전시킬 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →