← 최신 논문
⚡ electrical engineering

Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens

본 논문은 외부의 사전 학습된 모델에 의존하지 않고 저프레임 레이트의 고차원 연속 토큰을 사용하여 안정적이고 고충실도의 장기 음성 생성을 달성하기 위해, MP-ELD 단일 토큰 자기회귀 플로우 매칭 프레임워크와 결합된 국소 인코딩 코덱인 Locodec을 제안한다.

원저자: Yi Luo, Rongzhi Gu, Jixun Yao

게시일 2026-08-03
📖 5 분 읽기🧠 심층 분석

원저자: Yi Luo, Rongzhi Gu, Jixun Yao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 로봇에게 노래를 가르치려 한다고 상상해 보십시오. 당신은 로봇이 인간과 똑같이, 목소리의 미세한 떨림, 숨 가쁜 휴지기, 그리고 완벽한 음정까지도 재현하기를 원합니다. 하지만 한 가지 제약이 있습니다. 로봇은 마치 학생이 글자를 하나하나 따라 쓰는 것처럼, 한 번에 한 음표씩 학습합니다. 만약 로봇이 첫 글자에서 아주 작은 실수를 한다면, 그 실수는 두 번째 글자로, 세 번째 글자로 이어지며, 곧 전체 단어가 낙서처럼 변해버릴 것입니다. 이것이 바로 "자기회귀적(autoregressive)" AI—즉, 이전의 모든 것을 바탕으로 다음 소리의 조각을 예측하는 종류의 AI—를 만드는 과학자들이 겪는 큰 골칫거리입니다. 그들은 까다로운 삼각형 문제에 직면해 있습니다. 소리를 매우 상세하게(고품질) 만들고 싶지만, 동시에 로봇이 빠르게 배우기를(짧은 시퀀스) 원하며, 몇 분이 지난 후에도 로받이 이상해지지 않고 안정성을 유지하기(장기적 안정성)를 원합니다. 보통은 이 중 두 가지만 선택할 수 있습니다. 로봇이 기억해야 할 정보가 너무 많으면 혼란에 빠져 음정이 틀어지고, 정보를 단순화하면 목소리가 로봇처럼 평면적이고 단조로워집니다.

ByteDance Seed의 연구진이 작성한 이 논문은 대담한 질문을 던집니다. "우리는 두 가지 장점을 모두 갖춘 시스템을 구축할 수 있는가?" 그들은 소리를 "토큰"(데이터 덩어리)으로 패키징하는 새로운 방법—토큰의 수는 적지만 디테일은 거대한 방식—과, 실수가 쌓이는 것을 방지하는 새로운 학습 프레임워크를 제안합니다. 그들은 이 새로운 토크나이저를 "Locodec"이라 부르고, 학습 프레임워크를 "MP-ELD"라고 부릅니다. 이들은 로봇에게 단어의 의미를 가르치기 위해 사전 학습된 전문가 모델에 의존하는 대신, 소리가 존재하는 수학적 "공간" 자체를 예측하기 더 쉬운 형태로 설계했습니다. 그들의 실험에 따르면, 소리 덩어리를 정교하게 조직하고 AI 내부의 서로 다른 "고속도로"를 통해 정보를 전달함으로써, 외부의 거대한 AI 모델 도움 없이도 인간과 같은 품질을 유지하며 몇 분 동안 안정적인 음성을 생성할 수 있다고 합니다.

문제점: 표류하는 로봇

자기회귀적 음성 생성기를, 자신이 방금 그린 선의 마지막 1인치만 볼 수 있는 상태에서 완벽한 원을 그리려는 사람이라고 생각해보십시오. 만약 그가 아주 작은 흔들림을 만든다면, 다음 1인치는 그 흔들림으로부터 시작해야 합니다. 계속해서 흔들린다면, 원은 결국 나선형으로 변하거나 엉망진창이 될 것입니다. AI 오디오의 세계에서 이 "흔들림"을 **오차 누적(error accumulation)**이라고 부릅니다.

오랫동안 과학자들은 AI가 예측하는 "음표"(토큰)를 더 단순하게 만드는 방식으로 이를 해결하려 노력했습니다. 오디오를 작고 빈번한 조각으로 나누되, 각 조각은 매우 단순하게 만드는 식이었죠. 이는 AI의 작업을 쉽게 만들었지만, 결과물인 목소리는 평면적이고 디테일이 부족했습니다. 반대로, 토큰을 복잡하고 상세하게(고차원적으로) 만들면 AI는 과부하가 걸려 실수를 저지르게 되고, 몇 초 만에 목소리가 횡설수설하게 됩니다. 이는 마치 무거운 배낭을 멘 채 외줄 타기를 하는 것과 같습니다. 더 많은 디테일을 짊어질수록 균형을 잡기가 더 어려워집기 때문입니다.

해결책: 놀이터의 형태를 빚다

저자들은 단순히 토큰을 단순하게 만드는 대신, 토큰이 존재하는 '놀이터의 형태'를 바꿀 수 있다는 점을 깨달았습니다. 그들은 이 새로운 시스템을 Locodec이라고 부릅니다.

소리가 존재하는 공간을 거대한 다차원 구체(단순히 상하좌우가 아니라 수백 개의 방향을 가진 공 모양)라고 상상해 보십시오. 보통 이 구체 위에서 움직이려고 하면 길을 잃기 쉽습니다. Locodec은 이 구체를 탐색하기 쉽게 만들기 위해 두 가지 영리한 방법을 사용합니다.

  1. 핵심 매니폴드(The Core Manifold): 그들은 AI가 거대한 구체 내부의 더 작고 단순한 "핵심(core)"을 중심으로 소리를 조직하도록 강제합니다. 산맥을 생각해보십시오. AI는 산의 모든 모래알 하나의 위치를 추측할 필요가 없습니다. 그저 산의 형상 자체를 알면 됩니다. 이는 예측을 훨씬 더 안정적으로 만듭니다.
  2. 에너지 계층 구조(The Energy Hierarchy): 그들은 "포스트픽스 차원 드롭아웃(postfix dimension dropout)"이라는 기법을 사용합니다. 소리가 768개의 전등 스위치로 이루어진 긴 줄이라고 상상해 보십시오. 훈련 과정에서 AI는 때때로 마지막 절반의 스위치를 끄도록 강요받습니다. 이는 AI에게 앞부분의 스위치(prefix)가 가장 중요하며, 소리가 들리기 위해 가장 많은 에너지를 실어야 한다는 것을 가르칩니다. 이는 학생에게 문장의 첫 몇 단어가 의미를 이해하는 데 가장 결정적이라는 것을 가르치는 것과 같습니다. 이를 통해 명확한 중요도의 순서를 만들어 AI가 혼란에 빠지는 것을 훨씬 어렵게 만듭니다.

학습 프레임워크: MP-ELD

더 나은 놀이터가 있더라도, 로봇에게는 여전히 더 나은 학습 방법이 필요합니다. 저자들은 MP-ELD(Multi-Path Encoder-LM-Decoder)라는 새로운 학습 프레임워크를 구축했습니다.

AI가 함께 작동하는 세 가지 다른 "두뇌" 또는 경로를 가지고 있다고 상상해 보십시오:

  • 로컬 두뇌(The Local Brain): 이 두뇌는 다음 음표가 매끄럽게 흐를 수 있도록 바로 직전의 음표만을 봅니다 (리듬을 유지하는 것과 같습니다).
  • 자기 일관성 두뇌(The Self-Consistency Brain): 이 두뇌는 목소리의 스타일(속삭임인지, 외침인지, 특정 인물의 목소리인지)을 기억하고, 전체 문장이 동일한 사람처럼 들리도록 만듭니다.
  • 정렬 두뇌(The Alignment Brain): 이 두뇌는 텍스트나 지시 사항을 살펴보고 로봇이 올바른 단어를 말하고 있는지 확인합니다.

기존 시스템에서는 이 두뇌들이 서로 충돌하여 로봇이 표류하게 만드는 경우가 있었습니다. MP-ELD는 이러한 작업들을 분리하여 서로 간섭하지 않도록 합니다. 또한, 이들은 **분류기 없는 가이드(Classifier-Free Guidance, CFG)**를 볼륨 조절 노브처럼 사용하여 기술을 적용합니다. 연구진은 문장의 너무 이른 시점에 "자기 일관성" 노브를 높이면 로봇이 루프에 빠진다는 것을 발견했습니다. 하지만 문장이 어느 정도 진행된 후에 노브를 높이면, 목소리가 훨씬 더 오랫동안 안정적이고 자연스럽게 유지된다는 것을 찾아냈습니다.

연구 결과

연구팀은 매우 희소하지만(초당 단 8개) 매우 풍부한(각 768차원) 토큰을 사용하여 시스템을 테스트했습니다. 실험 결과는 다음과 같습니다:

  • 안정성: 이 시스템은 음성이 왜곡되거나 무너지지 않고 몇 분 동안 안정적인 음성을 생성할 수 있으며, 이는 몇 초 만에 실패하는 경우가 많은 기존 방식보다 크게 개선된 수치입니다.
  • 품질: 재구성된 음성은 매우 명료합니다. 연구진은 WER(Word Error Rate)과 같은 표준 지표를 사용하여 측정하였으며, 외부의 "전문가" 모델 도움 없이도 이 시스템이 최첨단 모델들과 경쟁할 만한 수준임을 확인했습니다.
  • 트레이드오프(Trade-off): 이 논문은 흥endo한 트레이드오프를 제시합니다. 토큰이 매우 희소하기 때문에(낮은 프레임 레이트), AI는 내용(단어)을 정확하게 파악하는 데는 뛰어나지만, 누가 말하는지에 대한 아주 미세하고 정밀한 디테일(화자 유사성) 측면에서는 더 빈번하고 상세한 토큰을 사용하는 시스템보다 다소 어려움을 겪을 수 있습니다. 이는 포즈는 기가 막히게 잘 그리지만, 아주 작은 점 하나는 놓칠 수 있는 스케치 화가와 같습니다.

결론

이 논문은 안정적인 로봇과 상세한 목소리 사이에서 하나를 선택할 필요가 없다는 점을 시사합니다. 소리가 존재하는 수학적 공간을 정교하게 설계하고, 서로 다른 작업을 수행하는 별도의 "두뇌"를 AI에게 부여함으로써 두 가지를 모두 얻을 수 있습니다. 저자들은 단순히 마법의 버튼을 찾아낸 것이 아니라, 데이터를 올바르게 조직하면 AI가 자연스럽게 더 안정적으로 학습한다는 것을 보여주었습니다. 이 시스템은 목소리를 일정하게 유지하고 단어를 정확하게 전달하는 데 매우 탁고하지만, 특정 인간의 목소리를 얼마나 잘 흉내 내는지에 대해서는 여 still 개선의 여지가 있다고 언급했습니다. 하지만 외부의 도움 없이 처음부터 구축된 시스템으로서, 이는 긴 대화에서도 자연스러운 AI 음성을 만드는 데 있어 거대한 진전입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →