← 최신 논문
🤖 machine learning

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

이 논문은 기본 텍ml-to-audio-video 모델에 제로 초기화된 선형 레이어 하나를 추가하는 것이 기존의 텍스트 음성 변환 베이스라인보다 우수한 화자 유사성을 갖춘 고충실도 음성 복제를 가능하게 하는 동시에, 오디오 생성을 비디오 경로로부터 분리함으로써 30배의 추론 속도 향상을 허용한다는 것을 입증한다.

원저자: Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 장면의 설명을 보고 소리가 완비된 비디오 클립을 즉각적으로 만들어낼 수 있는 세상을 상상해 보십시오. 만약 당신이 "공원에서 짖는 개"라고 입력하면, 기계는 공원의 영상과 짖는 소리를 생성합니다. 텍스트-오디오-비디오 생성이라고 알려진 이 기술은 급격히 발전하여, 기계가 단어만으로 전체 장면을 합성할 수 있게 해주었습니다. 그러나 중대한 한계가 지속되어 왔습니다. 컴퓨터가 어떤 소리를 만들지는 결정할 수 있지만, 누가 그 소리를 내는지는 결정할 수 없다는 점입니다. 출력물에서 말하거나 짖는 목소리는 기본적으로 기계가 학습한 방대한 가능성의 풀에서 무작위로 추출된 것이며, 이로 인해 창작자가 특정 캐릭터가 특정 인물의 목소리를 가져야 한다고 지정할 수 없게 만듭니다. 이러한 제어 능력의 부재는 개인화된 이야기, 애니메이션 캐릭터의 더빙, 또는 특정 개인의 목소리를 디지털 아바타에 입히는 데 어려움을 주었습니다.

동시에, 인공지능의 다른 분야는 사람이 몇 초간 말하는 것을 듣는 것만으로도 그 사람의 고유한 톤을 모방할 수 있는 음성 복제 기술을 숙달했습니다. 하지만 이러한 음성 복제 시스템은 엄격하게 오디오에만 국한됩니다. 이들은 동반되는 영상을 생성할 수 없으며, 종종 바닥부터 구축된 전문적이고 복잡한 구조를 필요로 합니다. 연구자들의 과제는 이 두 세계를 결합하는 것이었습니다. 즉, 강력한 비디오 및 사운드 생성기를 가져와서, 기존의 시스템을 완전히 재구축하지 않고도 특정 목소를 복제하도록 가르치는 것이었습니다.

한 연구팀은 이 간극을 메울 수 있는 놀라울 정도로 간단한 방법을 제시했습니다. 그들은 비디오와 사운드를 모두 생성할 수 있는 거대하고 기존에 존재하는 모델이, 오디오 처리 유닛 위에 단 하나의 작고 빈 수학적 연결 계층을 추가함으로써 음성 복제 도구로 변모할 수 있음을 보여주었습니다. 이 새로운 계층은 학습된 정보가 없는 상태로 시작하므로, 모델은 변화 전과 동일하게 동작합니다. 연구진은 특정한 방법을 사용하여 수정된 시스템을 비교적 짧은 기간 동안 학습시켰습니다. 그들은 대상 화자의 짧은 녹음본과 텍스트 설명을 모델에 입력했습니다. 시스템은 그 녹음본을 경청하고 그 고유한 소리의 특성을 사용하여 새로운 오디오를 형성하는 법을 배웠으며, 이 과정에서 비디오 생성 능력은 그대로 유지되었습니다.

이 성공의 핵심은 연구자들이 참조 음성을 기계에 도입하는 방식에 있습니다. 그들은 두 가지 상호 보완적인 신호를 사용했습니다. 첫째, 짧은 참조 녹음의 디지털 표현을 오디오 데이터 스트림의 맨 처음에 배치하여, 모델이 새로운 소리를 생성하는 동안 이를 지속적으로 참조할 수 있도록 했습니다. 둘째, 화자의 목소리를 담은 단 하나의 압축된 요약본을 추출하여 모델이 생성하는 모든 소리의 톤을 부드럽게 유도했습니다. 이 접근 방식은 단 하나의 새로운 선형 계층만을 필요로 했으며, 이 계층은 초기 학습 단계에서 모델을 방해하지 않도록 제로(zero)로 초기화되었습니다. 이러한 신호에 주의를 기울이도록 시스템을 훈련함으로써, 연구자들은 음색, 즉 목소리의 고유한 색깔을 높은 정밀도로 복제할 수 있게 했습니다.

이 접근 방식의 결과는 30명의 화자를 포함한 674개의 고유한 텍스트-음성 쌍을 담은 벤치마크를 통해 다섯 가지의 선도적인 음성 복제 시스템과 비교 테스트되었습니다. 50억 개의 파라미터를 가진 이 새로운 모델은 대상 화자의 목소리를 맞추는 능력에서 다른 모든 시스템을 능가했습니다. 이 모델은 두 목소리가 얼마나 유사한지를 측정하기 위해 설계된 세 가지 독립적인 검증 네트워크에서 가장 높은 점수를 기록했습니다. 연구진은 모델이 단어 선택에서 미세한 오류를 범할 때조차도, 화자의 목소리가 가진 미묘하고 자연스러운 특징, 즉 목소리를 인식 가능하게 만드는 특정 음향적 질감을 포착할 수 있다는 것을 발견했습니다. 이러한 트레이드오프는 모델이 완벽한 텍스트 정확도보다는 화자의 소리를 본질적으로 재구성하는 것을 우선시한다는 것을 시사하며, 이는 더 깔끔하지만 덜 독특한 목소리를 생성하는 다른 시스템들과는 다른 행동입니다.

이 아키텍처의 예상치 못한 이점은 최종 생성 단계에서 비디오와 오디오 부분을 분리할 수 있다는 점입니다. 모델이 오디오와 비디오 스트림이 다르게 처리되지만 서로 연결된 비대칭 구조로 설계되었기 때문에, 연구진은 모델의 오디오 부분만을 단독으로 실행할 수 있음을 발견했습니다. 이를 통해 비디오가 생성될 때까지 기다리지 않고도 음성 복제 오디오를 생성할 수 있었으며, 결과적으로 전체 시스템을 실행할 때보다 약 30배의 속도 향상을 이루었습니다. 전체 컴퓨팅 파워의 일부만을 사용하는 이 변형 모델은 여전히 효과적인 음성 복제 능력을 유지하면서도, 전체 비디오 생성을 결정하기 전에 다양한 목소리를 빠르게 오디션할 수 있는 실용적인 방법을 제공합니다.

결정적으로, 연구진은 음성 복제 기능을 추가하는 것이 모델의 원래 능력을 해치지 않는다는 것을 확인했습니다. 수정된 모델을 참조 음성이 제공되지 않는 작업에 테스트했을 때, 모델은 원래 버전보다 더 나은 성능을 보이며 더 자연스럽고 텍스트 설명과 더 밀접하게 일치하는 오디오를 생성했습니다. 이는 중립적인 상태에서 시작된 새로운 계층이, 기존에 알고 있던 것을 잊게 만들지 않으면서도 시스템을 강화하는 유연한 추가 요소로 작용했음을 나타냅니다. 이 연구는 거대한 재학습이나 복잡한 새로운 설계 없이도, 최소한의 구조적 변화를 통해 고급 비디오-사운드 생성기에 특정 목소리를 모방하는 능력을 갖출 수 있음을 결론지으며, 더 개인화되고 통제된 시청각 콘텐츠 제작의 문을 열었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →