Native Audio-Visual Alignment for Generation
NAVA 는 63 억 개의 파라미터만을 사용하면서도 뛰어난 동기화, 비디오 품질, 그리고 제어 가능한 음성 음색을 달성하기 위해 Align-then-Fuse MMDiT 아키텍처 내에서 네이티브 오디오-비주얼 정렬 전략을 활용하는 오디오-비디오 결합 생성을 위한 새로운 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
한 캐릭터가 자전거를 타면서 대화하는 영화 장면을 만들고 싶다고 상상해 보세요. 자전거가 움직이는 영상과 바람 소리, 그리고 사람의 목소리가 완벽하게 동시에 일어나야 합니다.
오랫동안 컴퓨터는 이 두 가지를 따로 만들어 마지막에 붙여 붙이는 방식을 시도했습니다. 이는 한 예술가가 자전거를 그리고 완전히 다른 예술가가 목소리를 녹음한 뒤, 나중에 이를 맞추려 시도하는 것과 같습니다. 종종 목소리가 입 모양과 약간 어긋나거나, 소리가 그 특정 장면의 일부처럼 느껴지지 않았습니다.
다른 최신 방법들은 예술가, 성우, 감독을 모두 같은 작은 방에 모아 모든 것을 한 번에 작업하게 했습니다. 이는 서로 대화하는 데 도움이 되지만, 혼란을 초래합니다. '감독'(텍스트 지시) 이 '사운드 엔지니어'(소음의 타이밍) 와 혼동되어, 누가 말하는지나 목소리가 어떻게 들리는지 같은 구체적인 세부 사항을 제어하기 어려워집니다.
NAVA 등장: '연습실' 접근법
이 논문은 NAVA(Native Audio-Visual Alignment, 네이티브 오디오 - 비주얼 정렬) 를 소개하며 워크플로우를 변경합니다. 따로 작업하거나 하나의 큰 냄비에서 모든 것이 뒤섞이는 대신, NAVA 는 '정렬 후 융합 (Align-then-Fuse)' 이라고 불리는 교묘한 두 단계 프로세스를 사용합니다.
이를 극장 연습에 비유해 보세요:
- 연습 (정렬): 먼저 배우들 (오디오) 과 무대 스태프 (비디오) 가 전용 '연습실'에서 만납니다. 여기서 그들은 감독이 새로운 대사를 주지 않은 채 함께 연습합니다. 발소리의 소리가 발이 땅에 닿는 시각적 이미지와 어떻게 일치하는지, 또는 기타 스트럼 소리가 손 움직임과 어떻게 일치하는지 정확히 파악합니다. 그들은 소리와 시각 사이에 자연스럽고 본질적인 연결을 구축합니다.
- 공연 (융합): 그들이 함께 움직이고 말하는 법을 익히면, 감독 (텍스트 프롬프트) 이 등장합니다. 감독은 더 이상 동기화를 가르칠 필요가 없습니다. 그저 무엇을 할지 말해줄 뿐입니다. "이제 캐릭터는 불만스러운 목소리로 이 대사를 말해야 합니다." 배우들과 스태프가 이미 동기화된 움직임을 알고 있기 때문에, 타이밍을 잃지 않고 새로운 지시에 즉시 적응할 수 있습니다.
비밀 무기: '맥락 내 음색 (Timbre-in-Context)'
NAVA 는 여러 화자를 처리하기 위한 특별한 트릭도 가지고 있습니다. 어머니와 아이가 대화하는 대본을 상상해 보세요. 어머니의 목소리가 아이의 목소리처럼 들리기를 원하지는 않을 것입니다.
이전 방법들은 장면 전체의 목소리를 바꾸는 별도의 '목소리 전환' 버튼을 가질 수 있었습니다. NAVA 는 더 똑똑합니다. 음색 (Timbre) 을 대본 자체의 일부로 취급합니다. 어머니의 대사에 특정 '목소리 태그'를 붙이고, 아이의 대사에 다른 '목소리 태그'를 붙입니다. 컴퓨터가 장면을 생성할 때, 누가 말하는지에 대한 메모가 포함된 대본을 읽는 감독처럼, 어떤 목소리가 어떤 문장에 속하는지 정확히 알 수 있습니다.
논문의 발견
연구진들은 Verse-Bench(오디오와 비디오의 일치도를 테스트하는 기준) 와 Seed-TTS(목소리 제어 테스트) 라는 벤치마크를 사용하여 NAVA 를 다른 최상위 모델들과 비교 테스트했습니다.
- 더 나은 동기화: NAVA 는 문이 닫히거나 입술이 움직이는 것과 같은 시각적 사건이 발생한 정확한 순간에 소리가 발생하도록 하는 데 가장 뛰어났습니다.
- 고품질: 영상은 훌륭하게 보였고, 오디오는 선명하고 사실적으로 들렸습니다.
- 효율성: 많은 경쟁 모델들보다 작음 (단 63 억 개의 '뇌 세포' 또는 파라미터 사용) 에도 불구하고 훨씬 더 큰 모델들을 능가했습니다.
- 제어: 동일한 장면에서 다른 화자들 사이를 매끄럽게 전환하면서도 목소리를 명확하고 정확하게 유지할 수 있었습니다.
요약
NAVA 는 복잡한 지시를 따르기 전에 소리와 비디오가 함께 움직이는 법을 배울 수 있는 전용 공간을 제공함으로써 소리와 비디오를 만드는 문제를 해결합니다. 이는 안무가가 어떤 노래로 춤을 추라고 말하기 전에 댄스 듀오가 그들의 발걸음을 익히도록 가르치는 것과 같습니다. 그 결과, 소리와 영상이 단순히 붙여진 것이 아니라 함께 태어난 것처럼 느껴지는 영화 장면이 만들어집니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.