← 최신 논문
🤖 machine learning

Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech

이 논문은 유한 스칼라 양자화(FSQ) 토큰화 방식이 범주형 데이터를 생성하는 연속 확산 모델에 최적임을 이론적 및 경험적으로 입증하며, 이는 FSQ가 자기회귀 방식의 거대 언어 모델보다 훨씬 작고 빠르면서도 텍스트 음성 변환 작업에서 이를 능가하는 성능을 보인다는 점을 통해 증명된다.

원저자: Vadim Popov, Wenju Gu, Tasnima Sadekova, Georgii Aparin, Assel Yermekova

게시일 2026-06-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Vadim Popov, Wenju Gu, Tasnima Sadekova, Georgii Aparin, Assel Yermekova

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 말을 가르치는 방법을 상상해 보세요. 이를 위해 로봇은 인간의 음성이 매끄럽고 끝없는 강물이 아니라, 단어나 소리 같은 뚜렷한 구성 요소들의 집합이라는 것을 이해해야 합니다. AI의 세계에서 이러한 블록들을 **토큰(tokens)**이라고 부릅니다.

오랫동안, 로봇에게 이 블록들을 생성하는 법을 가르치는 가장 좋은 방법은 "자기회귀(Autoregression)"라는 방식을 사용하는 것이었습니다. 이는 마치 문장을 한 번에 한 단어씩 써 내려가며, 다음 단어를 결정하기 위해 이전의 모든 단어를 되돌아보는 것과 같습니다. 이 방식은 정확하지만 느리고, 거대한 뇌(거대한 컴퓨터 모델)를 필요로 합니다.

최근 과학자들은 더 빠른 방법인 **확산(Diffusion)**을 발견했습니다. 확산은 조각가가 노이즈와 정전기가 가득한 점토 덩어리에서 시작하여, 완벽한 조각상이 나타날 때까지 노이즈를 조금씩 깎아내는 것과 같습니다. 이 방식은 이미지나 음악처럼 매끄러운 것들을 만드는 데 매우 효과적입니다. 하지만 음성 토큰처럼 "이산적인(discrete)" 것들(마치 매끄러운 점토가 아닌 뚜렷한 레고 블록 같은 것들)에 확산을 적용하는 것은 까다롭습니다. 노이즈가 방해가 되어, 로봇이 어떤 특정한 레고 블록을 골라야 할지 혼란스러워하기 때문입니다.

이 논문은 확산 과정이 완벽하게 작동할 수 있도록 이 레고 블록들을 정리하는 새로운 방법을 소개합니다. 다음은 그 내용의 요약입니다.

1. 문제점: "노이즈가 가득한 방"

당신이 사람들(토큰)로 가득 찬 어두운 방 안에 있다고 상상해 보세요. 당신은 특정한 사람을 찾고 싶지만, 방 안은 안개(노이즈)로 자욱합니다.

  • 기존 방식: 안개가 너무 짙어서 사람들이 무작위로 흩어져 있습니다. 누가 누구인지 구별하기 어렵습니다.
  • 목표: 로봇이 안개 속에서도 누가 어디에 서 있는지 쉽게 추측할 수 있도록 사람들을 배치해야 합니다.

2. 해결책: "완벽한 격자" (FSQ)

저자들은 이 사람들(토큰)을 배치하는 가장 좋은 방법이 **유한 스칼라 양자화(Finite Scalar Quantization, FSQ)**라는 방법임을 발견했습니다.

FSQ를 3D 입방체 안의 완벽하게 조직된 격자라고 생각해보세요.

  • 사람들이 무작위로 서 있는 대신, 이들은 정확하고 균일하게 간격이 떨어진 좌표(예: 자 위의 -1, 0, +1)에 배치됩니다.
  • 이는 모든 토큰이 고유하고 예측 가능한 위치를 갖는 "격자"를 만들어냅니다.
  • 이 논문은 이 특정 격자 배치가 확산 과정을 위한 최적의 레이아웃임을 수학적으로 증명합니다. 이는 마치 레고 블록을 완벽한 상자에 담아두는 것과 같아서, 상자를 아무리 흔들어도(노이즈를 추가해도) 원래의 자리에 다시 쉽게 분류해 넣을 수 있습니다.

3. 증명: 왜 이 격자가 승리하는가

저자들은 단순히 추측한 것이 아니라, 이 격자가 최고라는 것을 증명하기 위해 두 가지를 수행했습니다.

  • 수학적 증명: 그들은 이 격자 배치가 서로 다른 토큰을 찾아가는 경로 사이의 "혼란"(KL 발산으로 측정됨)을 최소화한다는 것을 보여주었습니다. 간단히 말해, "고양이"와 "강아지"를 찾는 경로가 충분히 구별되어 있어, 노이즈가 높을 때도 로봇이 길을 잃지 않습니다.
  • 실험: 그들은 "장난감" 버전의 시스템을 구축하여 무작위 배치 방식과 완벽한 FSQ 격자 방식을 비교 실험했습니다. 결과적으로 FSQ 격자가 훨씬 더 일관되게 승리하며, 올바른 토큰을 훨씬 더 정확하게 예측했습니다.

4. 실전 테스트: 새로운 음성 비서

이것이 실제 세계에서 어떻게 작동하는지 증명하기 위해, 팀은 새로운 텍스트 음성 변환(TTS) 시스템(텍스트를 소리 내어 읽어주는 로봇)을 구축했습니다.

  • 그들은 기존의 강력한 음성 시스템(CosyVoice2)을 가져왔는데, 이 시스템은 문장을 생성하기 위해 거대한 "뇌"(대규모 언어 모델 또는 LLM)를 사용했습니다.
  • 그들은 이 거대한 뇌를 FSQ 격자를 사용하는 그들의 새로운 확산 기반 뇌로 교체했습니다.

결과:

  • 더 나은 품질: 새로운 로봇은 기존 모델보다 더 명확하고 자연스럽게 말했습니다.
  • 더 빠름: 음성을 한 단어씩 써 내려갈 필요가 없기 때문에, 기존보다 5~10배 더 빠릅니다.
  • 더 작음: 새로운 모델은 기존 모델보다 10배 더 작습니다. 이는 마치 슈퍼컴퓨터를 스마트 태블릿으로 교체하면서도 더 나은 결과를 얻는 것과 같습니다.
  • 제로샷 클로닝(Zero-Shot Cloning): 기존 시스템과 마찬가지로 짧은 샘플만으로도 사람의 목소리를 흉내 낼 수 있지만, 훨씬 더 효율적으로 수행했습니다.

요요약

이 논문은 만약 당신이 이산적인 음성 신호(토퀀)를 생성하기 위해 "조각하기"(확산) 방식을 사용하고 싶다면, 음성 블록(토큰)을 완벽하고 균일한 격자(FSQ) 형태로 배치해야 한다고 주장합니다. 이러한 배치는 수학적 계산을 더 잘 작동하게 하고, 학습을 더 안정적으로 만들며, 최종적인 음성 비서를 기존의 거물들보다 더 빠르고, 작고, 명확하게 만들어 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →