← 최신 논문
⚡ electrical engineering

VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation

VoiceDesigner는 하이브리드 데이터 파이프라인과 개선된 디퓨전 트랜스포머를 활용하여, 다양한 실제 및 가공의 목소리를 생성하는 기존의 한계를 극복하는 동시에 강력하고 제어 가능한 음성 편집을 가능하게 하는 통합 프레임워크입니다.

원저자: Jiarui Hai, Karan Thakkar, Ke Chen, Yunyun Wang, Jiaqi Su, Rithesh Kumar, Mounya Elhilali, Zeyu Jin

게시일 2026-08-17
📖 2 분 읽기☕ 가벼운 읽기

원저자: Jiarui Hai, Karan Thakkar, Ke Chen, Yunyun Wang, Jiaqi Su, Rithesh Kumar, Mounya Elhilali, Zeyu Jin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 목소리가 단순히 생물학적인 우연이 아니라, 기타처럼 조율할 수 있는 맞춤형 악기인 세상을 상상해 보십시오. 수십 년 동안 컴퓨터는 텍스트를 소리 내어 읽는 데 뛰어난 능력을 보여왔지만, 실제 사람의 녹음본을 입력하여 복제하지 않는 한 대개 딱딱한 로봇처럼 들리곤 했습니다. 텍스트-음성 변환(T2V)이라고 알려진 이 분야는 이를 변화시키려 노력하고 있습니다. 특정 인물을 단순히 복제하는 대신, 과학자들은 컴퓨터에게 "심술궂은 늙은 마법사"나 "흥분한 외계인"과 같은 묘사를 이해하고 무에서부터 목소리를 만들어내는 법을 가르치고 있습니다. 이는 요리사에게 요리의 사진 대신 글로 된 레시피를 주는 것과 같습니다. 목표는 단지 지침을 읽는 것만으로 정확한 맛, 질감, 향을 불러일으키는 것입니다. 하지만 지금까지 이 디지털 요리사들은 두 가지 큰 문제로 어려움을 겪었습니다. 그들은 주로 "인간"이라는 요리만을 알고 있었으며, 만약 맛을 약간 조절해 달라고(예를 들어 목소리를 더 행복하게 만들기) 요청하면 종종 요리 전체를 망쳐버리곤 했습니다.

여기에 마스터 보이스 아키텍트(Master Voice Architect) 역할을 하는 새로운 시스템, VoiceDesigner가 등장했습니다. 이 프로젝트의 연구진은 기존 시스템들이 표준적인 인간의 목소리를 생성하는 데 머물러 있으며, 드래곤이나 악마 같은 허구의 캐릭터를 만들도록 요청받거나 목소리의 기분을 편집하려 할 때 정체성을 깨뜨리는 문제가 있다는 것을 깨달았습니다. 이를 해결하기 위해, 그들은 목소리 생성과 목소리 편집을 동전의 양면처럼 다루는 통합 프레임워크를 구축했습니다. 이것을 하나의 초스마트 스튜디오라고 생각하십시오. 당신은 텍스트 설명을 사용하여 기초부터 목소리를 구축하거나, 기존의 목소리를 가져와 "더 신비롭게 만들어줘"와 같은 간단한 지시어로 형태를 재구성할 수 있습니다.

VoiceDesigner의 비결은 두 가지 요소의 영리한 조합에 있습니다. 첫째, 그들은 단순히 실제 사람의 녹음에만 의존하지 않았습니다. 대신 디지털 신호 처리(사운드보드의 노브를 돌리는 것과 같은 방식)와 생성형 AI를 사용하여 수천 개의 가짜이지만 현실적인 목소리를 만드는 "보이스 팩토리"를 구축했습니다. 이를 통해 그들은 실제 녹음이 비워둔 빈틈을 채우며 인간의 속삭림부터 괴물의 깊은 울림까지 모든 것을 학습할 수 있었습니다. 둘째, 그들은 시스템의 두뇌인 디퓨전 트랜스포머(Diffusion Transformer)라는 유형의 AI를 업그레이드했습니다. 그들은 도서관 사서가 책, 영화, 음악을 절대 섞이지 않게 정리하는 것처럼, 특수한 3D 위치 지정 시스템을 사용하여 정보가 섞이지 않도록 함으로써 지시 사항, 전사 데이터, 오디오 참조를 동시에 혼동 없이 듣는 새로운 방식을 부여했습니다.

결과는 이 접근 방식이 매우 효과적임을 시사합니다. 테스트에서 VoiceDesigner는 다른 오픈 소스 모델들보다 복잡한 지시를 더 잘 따랐으며, 해적이나 로봇 같은 캐릭터의 목소리를 설명된 그대로 성공적으로 생성해 냈습니다. 또한, 화자의 원래 정체성을 잃지 않으면서도 화자의 감정이나 톤을 변경할 수 있는 숙련된 편집자임을 입증했습니다. 비록 최고 수준의 상용 시스템들과는 여전히 미세한 격차가 존재하지만, 이 논문은 창의적인 데이터 시뮬레이션과 더 스마트한 통합 모델을 결합함으로써, 우리가 키보드에서 바로 상상할 수 있는 어떤 목소리든 설계할 수 있는 미래에 훨씬 가까워지고 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →