← 최신 논문
⚡ electrical engineering

HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

본 논문은 고품질 오디오를 컴팩트하고 학습 가능한 잠재 공간으로 인코딩하는 연속적 전체 음성 토큰화 모델인 HoliTok 을 소개하며, 이를 통해 추가 최적화 없이 고품질 음성 생성과 인식을 모두 강력하게 수행할 수 있는 통합된 AR+DiT 아키텍처를 가능하게 합니다.

원저자: Bohan Li, Shi Lian, Hankun Wang, Yiwei Guo, Yu Xi, Zhihan Li, Da Zheng, Colin Zhang, Kai Yu

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bohan Li, Shi Lian, Hankun Wang, Yiwei Guo, Yu Xi, Zhihan Li, Da Zheng, Colin Zhang, Kai Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

HoliTok 논문 설명을 일상적인 언어와 창의적인 비유로 번역한 내용입니다.

큰 문제: "통역사" 딜레마

인간이 말하는 것을 듣고(이해) 다시 말해(생성) 줄 수 있는 초지능 로봇을 만들려고 상상해 보세요. 이를 위해 로봇은 소리 파동을 자신이 생각할 수 있는 형태로 변환하고, 다시 그 생각을 소리로 되돌릴 수 있는 공통 언어가 필요합니다.

현재 존재하는 "통역사"(음성 토크나이저) 들은 나쁜 통역사와 같습니다:

  • "고충실도" 통역사: 이 통역사는 단어를 하나하나, 톤 하나하나까지 정확히 반복하는 데는 뛰어나지만, 그 의미를 이해하거나 추론하는 데는 매우 서툴러요. 무슨 말을 하는지 알지 못하는 앵무새처럼 완벽하게 흉내만 낼 뿐입니다.
  • "의미론적" 통역사: 이 통역사는 의미와 감정을 완벽하게 이해하지만, 다시 말하려 할 때 목소리는 로봇 같거나, 오류가 생기거나, 왜곡되어 들립니다. 마치 단어를 제대로 발음하지 못하는 천재 철학자 같습니다.

이런 간극 때문에 엔지니어들은 보통 로봇이 두 가지 작업을 모두 잘 수행하도록 하려면 두 개의 별도 시스템을 구축하거나 복잡하고 messy 한 우회 방법을 사용해야 합니다.

해결책: HoliTok(완벽한 이중언어 통역사)

저자들은 HoliTok을 제안합니다. 이는 "완벽한 이중언어" 통역사가 되도록 설계된 새로운 유형의 음성 토크나이저입니다. HoliTok 은 소리와 의미가 함께 행복하게 공존하는 연속적이고 전체적인(holistic) 공간을 생성합니다.

HoliTok 을 당신의 목소리를 위한 매우 효율적인 압축 앱이라고 생각하세요. AI 가 처리하기 어려운 거대한 원시 오디오 파일로 목소리를 저장하거나, 뉘앙스를 잃어버리는 작은 단단한 레고 블록으로 분해하는 대신, HoliTok 은 당신의 목소리를 "생각 점"이라는 매끄럽고 흐르는 스트림으로 변환합니다.

  • 입력: 초당 48,000 개의 소리 샘플을 받습니다 (매우 상세함).
  • 출력: 이를 초당 단 25 개의 "생각 점"으로 압축합니다. 각 점은 128 차원의 풍부한 숫자입니다.
  • 마법: 이 점들은 AI 가 학습하기 쉽습니다 (자동차가 달리기 좋은 매끄러운 도로처럼). 하지만 여전히 고품질의 인간 같은 음성으로 복호화될 수 있습니다.

어떻게 만들었나: 3 단계 훈련 레시피

로봇에게 한 번에 모든 것을 가르치면 혼란스러워집니다. 저자들은 HoliTok 을 운동선수를 훈련시키듯 3 단계의 점진적인 과정으로 훈련시켰습니다:

  1. 1 단계: "완벽한 모방자"(재구성)
    먼저, 모델이 완벽한 메아리가 되도록 가르쳤습니다. 이 모델의 유일한 임무는 목소리를 듣고 원래 모습 그대로 다시 반복하는 것이었습니다. 이를 통해 "생각 점"에 목소리가 로봇처럼 들리지 않도록 필요한 모든 음향적 세부 사항(피치, 음색, 선명도) 이 포함되었는지 확인했습니다.

  2. 2 단계: "매끄러운 운영자"(변분 정규화)
    다음으로, 모델이 그 점들을 매끄럽고 예측 가능한 패턴으로 조직하도록 가르쳤습니다. 마치 흩어진 모래 더미를 매끄럽게 다져 물처럼 흐르게 만드는 것과 같습니다. 이는 AI 가 시퀀스에서 다음 점을 예측하는 것을 훨씬 쉽게 만들어 주며, 새로운 음성을 생성하는 데 필수적입니다.

  3. 3 단계: "학자"(하류 풍부화)
    마지막으로, 모델이 무엇을 듣고 있는지 이해하도록 가르쳤습니다. 저자들은 다른 똑똑한 AI 모델을 사용하여 지식을 HoliTok 에 "증류"시켰습니다. 이제 "생각 점"은 소리뿐만 아니라 감정, 화자 정체성, 언어적 의미에 대한 정보도 담고 있습니다. 이로 인해 점들은 음성을 이해하는 데도, 생성하는 데도 유용해졌습니다.

검증: "통합" 아키텍처

HoliTok 이 작동함을 증명하기 위해 저자들은 HoliTok 을 두 가지 작업 모두에 사용하는 단일 로봇 뇌(AR+DiT 아키텍처 사용) 를 구축했습니다:

  • 듣기: 로봇은 "생각 점"을 읽고 질문에 답하거나 텍스트를 전사합니다.
  • 말하기: 로봇은 텍스트를 받아 "생각 점"으로 변환한 후, 이를 음성으로 복호화합니다.

결과:

  • 품질: HoliTok 은 기존 최상위 방법만큼 좋은 음성을 생성합니다 (고충실도).
  • 제어: 특정 감정이나 스타일을 가진 음성을 매우 잘 생성할 수 있습니다.
  • "통합" 승리: 이것이 핵심입니다. 다른 방법들을 이 단일 "통합" 로봇 뇌에서 사용하려 했을 때, 로봇은 어려움을 겪었습니다. 목소리가 나쁘거나 이해가 나빴습니다. HoliTok 만이 추가적인 트릭 없이 두 작업을 동시에 강력하게 수행할 수 있는 유일한 방법이었습니다.

요약

HoliTok 은 인간의 음성을 AI 가 처리하기 충분히 작게, 의미와 감정을 이해하기 충분히 풍부하게, 그리고 고품질로 다시 말하기 충분히 명확하게 만드는 디지털 형식으로 변환하는 새로운 방법입니다. 이는 "듣기"와 "말하기" 사이의 간극을 메워, 복잡하고 다단계 시스템이 필요 없이 단일 AI 모델이 두 가지 작업을 효과적으로 수행할 수 있게 합니다.

참고: 논문은 HoliTok 이 오디오를 위해 설계되었지만, 현재 실험은 엄격하게 음성 (인간 목소리) 에만 초점을 맞추고 있음을 명시적으로 언급합니다. 음악이나 환경 소음에 대해서는 아직 테스트하지 않았으며, 이러한 강력한 음성 생성 도구가 목소리 위조와 같은 오용을 방지하기 위해 책임 있게 사용되어야 한다고 경고합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →