DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis
이 논문은 텍스트-음성 합성을 신경 오디오 코덱 토큰에 대한 조건부 블록 이산 확산(conditional block discrete diffusion)으로 정식화하여, 높은 명료도와 순차적 블록 내 병렬 토큰 예측을 통한 0.15의 실시간 계수(real-time factor)를 통해 경쟁력 있는 성능을 달성한 0.6B 파라미터 규모의 프레임워크인 DLLM-TTS를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 노래를 가르치려 한다고 상상해 보세요. 당신에게는 두 가지 주요 방법이 있고, 두 방법 모두 골치 아픈 단점이 있습니다. 첫 번째 방법은 학생이 책을 한 단어씩 소리 내어 읽는 것과 같습니다. 발음은 완벽하고 이야기도 이해가 되지만, 다음 문장을 시작하기 전에 반드시 현재의 문장을 끝마쳐야 합니다. 이는 느립니다. 또한 로봇이 특정 인물처럼 들리게 하려면, 그 기술을 배우기 위해 방대한 양의 도서관(이 경우에는 수많은 시간의 녹음된 음성 데이터)을 입력해 주어야 합니다. 두 번째 방법은 모든 사람이 동시에 자기 파트를 부르는 합창단과 같습니다. 믿을 수 없을 정도로 빠르지만, 종종 가수를 놓치거나, 단어를 건너뛰거나, 말을 반복하곤 합니다. 왜냐하면 그들은 앞사람의 소리를 듣지 않기 때문입니다.
수년 동안 과학자들은 "완벽하지만 느린 방식"과 "빠르지만 엉망인 방식" 사이에서 선택을 해야 하는 딜레마에 빠져 있었습니다. Smallest.ai 팀이 작성한 이 논문은 그 혼란스러운 중간 지점으로 발을 들여놓습니다. 그들은 텍스트 음성 변환(TTS) 분야에서 연구하고 있는데, 이는 쓰인 텍xt를 말소리로 바꾸는 기술입니다. 그들이 다루는 핵심 아이디어는 "이산 확산(discrete diffusion)"입니다. 이것은 마치 역방로로 진행되는 "전화기 놀이(Telephone game)"와 같습니다. 메시지를 줄지어 전달하는 대신, 모든 단어가 물음표 뒤에 숨겨진 문장이 있다고 상상해 보세요. 로봇의 임무는 숨겨진 단어들을 추측하는 것이지만, 단어를 하나씩 추측하는 것이 아닙니다. 로봇은 한 번에 커다란 덩어리의 단어들을 추측하고, 그것들이 말이 되는지 확인한 다음, 다시 정교하게 다듬습니다. 저자들은 이 "추측하고 다듬는" 방식을 통해 "합창단" 방식의 속도와 "학생" 방식의 정확성을 결합할 수 있는지 확인하고자 했습니다.
팀은 DLLM-TTS라는 새로운 프레임워크를 소개합니다. 오디오 신호 전체를 한꺼번에 생성하거나 아주 작은 조각 하나씩 생성하는 대신, 그들은 오디오를 책의 장(chapter)처럼 작은 "블록(blocks)" 단위로 나눕니다. 음성을 긴 기차라고 상상해 보세요. 기존의 빠른 방식들은 기차 전체를 한꺼번에 만들려고 시도했고, 그 과정에서 기차 칸들이 궤도에서 탈선하곤 했습니다. 기존의 느린 방식들은 기차 한 칸이 완성될 때까지 기다렸다가 다음 칸을 만드는 식으로 한 칸씩 만들었습니다. DLLM-TTS는 기차를 "그룹(블록)" 단위로 만듭니다. 각 그룹 안에서 로봇은 모든 칸을 동시에 추측하지만, 다음 그룹을 시작하기 전에는 이전 그룹이 완료될 때까지 기다립니다.
이 "블록" 접근 방식은 로봇이 소리의 여러 부분을 동시에 작업할 수 있게 하여 빠르면서도, 이야기의 순서를 존중하기 때문에 정확성을 유지할 수 있게 해줍니다. 로봇은 학습을 위해 특별한 유형의 "마스킹(masking)"을 사용합니다. 학습 중에 로봇은 일부 단어가 숨겨진 문장을 보여받으며, 텍s트와 모방하고자 하는 목소리의 짧은 샘플을 바탕으로 그 단어들을 찾아내야 합니다. 로봇은 매번 다른 단어들이 숨겨진 동일한 문장을 보기 때문에, 문장을 처음부터 끝까지 단순히 읽기만 할 때보다 훨씬 빠르게 언어의 규칙을 배웁니다. 이는 노래 전체를 계속 반복해서 부르는 대신, 다양한 절(verse)을 무작위 순서로 연습하며 노래를 배우는 것과 같습니다. 즉, 멜로디와 가사를 훨씬 효율적으로 배우게 됩니다.
결과는 매우 유망합니다. 팀은 0.6B(6억 개)의 파라미터(로봇의 뇌 크기를 측정하는 척도)를 가진 모델을 단 20,000시간의 음성 데이터만을 사용하여 학습시켰습니다. 이를 비교해 보자면, 다른 최고 수준의 로봇들은 동일한 기술을 배우기 위해 보통 60,000시간에서 250,000시간 사이의 데이터가 필요합니다. 이처럼 적은 데이터를 사용했음에도 불구하고, 그들의 로봇은 음성의 품질과 특정 인물을 얼마나 잘 모방하는지에 대한 표준 테스트에서 경쟁력 있는 성능을 보여주었습니다. 속도 측면에서 보면, 이 로봇은 0.15의 "실시간 계수(Real-Time Factor, RTF)"로 실시간 음성을 생성할 수 있습니다. 이는 로봇이 1초의 오디오를 생성하는 데 단 0.15초밖에 걸리지 않음을 의미하며, 실시간 대화가 가능할 만큼 빠릅니다.
이 논문은 이러한 블록 기반 접근 방식이 전통적인 방식에 대한 강력한 대안임을 시사합니다. 이는 고품질의 음성을 얻기 위해 반드시 방대한 양의 데이터나 매우 느린 순차적 과정이 필요한 것은 아니라는 점을 보여줍니다. 문제를 관리 가능한 덩어리로 나누고 "추측 및 정교화" 전략을 사용함으로써, 저자들은 데이터 효율적이면서도 빠른 시스템을 만들어냈습니다. 이 논문이 이것이 모든 음성 문제에 대한 절대적인 최종 해결책이라고 주장하는 것은 아니지만, 속도와 정확성을 결 조합하는 이 특정한 방식이 매우 잘 작동한다는 것을 입증하며, 세상의 모든 목소리를 배우기 위해 거대한 도서관이 필요하지 않더라도 자연스럽고 빠르게 말할 수 있는 로봇을 만드는 새로운 길을 제시하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.