UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos
UniSwap는 단일 디퓨전 트랜스포머와 스왑-앤-리컨스트럭트(swap-and-reconstruct) 학습 파이프라인 및 효율적인 샘플링 기술을 활용하여 동기화되고 일관되며 안정적인 장기 생성(long-form generation)을 달성함으로써, 대화하는 영상에서의 최초의 스트리밍 방식의 결합된 오디오-비주얼 정체성 교체를 가능하게 하는 새로운 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 영화를 보고 있는데, 화면 속 배우가 갑자기 다른 목소리로 말하기 시작하면서 완전히 다른 사람의 모습으로 변하는 장면을 상상해 보십시오. 하지만 그들은 여전히 정확히 같은 단어를 말하고 있으며 입 모양도 완벽하게 일치합니다. 이것이 바로 '아이덴티티 스와핑(identity swapping, 신원 교체)'이 구현하고자 하는 꿈입니다. 오랫동안 컴퓨터는 이 기술의 한 부분만을 수행하는 데 뛰어난 능력을 보여왔습니다. 즉, 원래의 목소리는 유지한 채 얼굴만 바꾸거나, 원래의 얼굴은 유지한 채 목소리만 바꾸는 방식입니다. 하지만 이 두 가지를 동시에 수행하는 것은 외발자전거를 타면서 서로 다른 두 개의 공을 저글링하는 것과 같았습니다. 결과는 종종 싱크가 맞지 않아 입 모양이 엉뚱한 단어에 맞춰 움직이거나 목소리가 로봇처럼 들리곤 했습니다. 이 논문은 생성형 AI의 세계를 파고들며, 특히 우리가 어떻게 컴퓨터에게 영상의 끊김이나 오디오 지연 없이 실시간으로 사람의 외형과 목소리를 동시에 교체하도록 가르칠 수 있는지에 주목합니다.
이 프로젝트의 연구진은 UniSwap이라는 새로운 시스템을 구축했는데, 이는 마치 숙련된 인형술사처럼 영상의 시각적 측면과 청각적 측면의 줄을 동시에 조절하는 역할을 합니다. 얼굴을 위한 도구와 목소리를 위한 도구를 따로 사용하는 대신, 그들은 사람의 얼굴이 어떻게 움직이고 목소리가 어떻게 들리는지를 하나의 연결된 경험으로 이해하는 단일한 '두뇌'를 만들었습니다. 이것은 단순히 단어를 번역하는 것을 넘어 화자의 억양과 얼굴 표정까지 즉각적으로 포착하는 이중 언어 통역사와 같습니다.
이 논문은 이 시스템을 가르치는 영리한 방법을 소개합니다. 동일한 사람이 동일한 대사를 말하면서 외모와 목소리는 두 명의 서로 다른 사람인 실제 영상을 찾는 것은 거의 불가능하기 때문에, 팀은 '스와프 앤 리컨스트럭트(swap-and-reconstruct, 교체 및 재구성)' 게임을 발명했습니다. 그들은 실제 영상을 가져와서 그 사람의 얼굴과 목소리를 디지털 방식으로 제거하여 '유령' 버전을 만든 다음, 새로운 얼굴과 목소리를 가이드 삼아 원래의 영상을 다시 구축하도록 AI에게 요청합니다. 이는 요리사에게 빈 캔버스와 레시피를 준 뒤, 특정 요리를 완벽하게 재현해 보라고 요구하는 것과 같습니다. 이러한 수백만 번의 '재구축' 과정을 통해 학습함으로써, AI는 원래의 움직임과 배경을 유지하면서 정체성을 교체하는 법을 배웁니다.
이 기술이 진정으로 특별한 점은 이것이 느린 사전 녹화 영화가 아니라 라이브 스트림처럼 작동한다는 것입니다. 대부분의 비디오 생성기는 첫 번째 프레임을 그리기 전에 전체 클립을 다 봐야 하므로 인터랙티브한 사용에는 너무 느립니다. 그러나 Uni-Swap은 컨베이어 벨트처럼 작은 블록 단위로 영상을 생성하여, 강력한 컴퓨터 칩(NVIDIA H100)에서 초당 약 13.6프레임을 생성할 수 있습니다. 비록 아직 즉각적인 실시간 상호작용을 하기에는 충분히 빠르지는 않지만, 이는 엄청난 도약입니다. 이 시스템은 캐릭터의 얼굴이나 목소리가 시간이 지남에 따라 어긋나거나 왜곡되지 않고 최대 1시간 길이의 긴 영상을 생성할 수 있게 해줍니다. 저자들은 'Feature-RoPE Decomposition'이라는 특수한 '기억 트릭'을 사용하여, AI가 수천 프레임을 생성한 후에도 원래의 정체성을 기억할 수 있으며, 이를 통해 첫 번째 순간부터 마지막 순간까지 캐릭터의 일관성을 유지할 수 있음을 발견했습니다.
요약하자면, UniSwap은 우리가 드디어 말하는 영상에서 외형과 목소리를 모두 높은 동기화와 안정성을 가지고 교체할 수 있는 통합된 시스템을 가질 수 있음을 시사합니다. 현재 버전은 실시간 대화를 하기에는 약간 느리지만(표준 비디오 재생 속도보다 약간 느림), 단일 모델이 두 개의 별도 시스템을 이어 붙이는 것보다 두 가지 작업을 함께 처리하는 데 더 효과적이라는 것을 증명합니다. 결과는 입 모양이 새로운 목소리와 완벽하게 동기화되며, 긴 클립에서도 캐릭터의 정체성이 안정적으로 유지됨을 보여주며, 더욱 자연스럽고 상호작적인 디지털 아바타를 향한 유망한 단계를 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.