Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation
Vorch-IR은 구동 비디오, 참조 이미지, 텍스트 지침을 결합하여 조건화함으로써 장편 비디오에서 선택적인 배경 편집과 함께 유연한 단일 및 이중 인물 정체성 교체를 가능하게 하는 LTX2 기반의 통합 멀티모달 프레임워크로, 자동 합성 파이프라인을 통해 데이터 부족 문제를 극복하고 시간적 중첩 추론 전략을 통해 분 단위 생성으로 확장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 현실을 조절하는 리모컨을 들고 있다고 상상해 보세요. 채널을 바꾸는 대신, 대본, 카메라 각도, 춤 동작은 그대로 유지하면서 영화 속 배우들만 교체하고 싶습니다. 이것이 바로 인공지능 세계의 뜨거운 주제인 '비디오 아이덴티티 리플레이스먼트(video identity replacement, 비디오 정체성 교체)'의 꿈입니다. 오랫동안 AI는 새로운 영상을 처음부터 생성할 수는 있었지만, 기존의 영상을 편집하는 것은 조명이나 움직임을 망치지 않으면서 실사 영화 속 캐릭터의 얼굴을 바꾸는 것만큼이나 어려운 일이었습니다. 초기 시도들은 AI에게 사람이 서 있는 위치를 나타내는 상세한 지도나, 포즈를 나타내는 골격 그림, 또는 얼굴을 가릴 마스크를 전달해주어야 했습니다. 그것은 마치 요리사에게 미리 손질된 재료 목록과 주방 도면을 주어야만 요리를 할 수 있게 요청하는 것과 같았습니다. 이러한 방식들은 경직되어 있었고 사용하기 어려웠습니다. 이제 연구자들이 던지는 핵심적인 질문은 이것입니다. "우리가 AI에게 '왼쪽의 무용수를 이 사진 속 인물로 바꿔줘'라는 간단한 문장을 가르치면, 복잡한 지도나 골격 없이도 그 의미를 바로 이해하게 할 수 있을까?"
여기, 마치 초능력을 가진 마법 같은 영화 편집자처럼 행동하는 새로운 AI 시스템인 Vorch-IR이 등장했습니다. 이것을 스크립트 감독이나 스턴트 코디네이터가 필요 없는 감독이라고 생각해보세요. 당신은 Vorch-IR에 세 가지를 제공합니다: 원본 영상("드라이빙" 영상), 새로 삽입하고 싶은 사람들의 사진 몇 장("참조" 사진), 그리고 AI에게 누가 어디로 가야 하는지 알려주는 간단한 텍스트 메모입니다. 여기서 마법 같은 점은 사진이 영상의 포즈나 위치와 일치할 필요가 없다는 것입니다. 만약 영상 속 인물이 팔을 들고 춤을 추고 있고, 당신의 사진 속 인물은 앉아 있다면, Vorch-IR은 앉아 있는 사람이 어떻게 춤을 추게 만들지 스스로 알아냅니다. 이 모델은 한 명의 인물, 함께 춤추는 두 명의 인물, 심지어 배경 장면을 바꾸는 것까지 하나의 단일 모델로 모두 처리합니다.
Vorch-IR의 연구진은 이 시스템을 강력한 비디오 생성기인 LDTX2 위에 구축했습니다. 그들은 AI가 영상, 사진, 그리고 텍alan 텍스트 지시 사항을 동시에 보도록 가르쳤습니다. 경직된 지도 대신, AI는 '비전-언어(vision-language)' 브레인(이미지와 단어를 모두 이해하는 유형의 AI)을 사용하여 그 연결 고리를 파악합니다. 이는 마치 AI가 당신의 메모를 읽고, 사진을 본 뒤, "아, 이 사람이 왼쪽의 자리를 대신하길 원하는구나"라고 이해한 다음, 내부의 '셀프 어텐션(self-attention)'을 사용하여 새로운 얼굴을 움직이는 몸에 완벽하게 합성하는 것과 같습니다.
이 분야의 가장 큰 장애물 중 하나는 데이터입니다. AI에게 얼굴을 바꾸는 법을 가르치려면 수천 개의 '전'과 '후' 영상 예시가 필요합니다. 현실 세계에는 이런 데이터가 존재하지 않기 때문에, 팀은 이를 만들기 위해 로봇 파이프라인을 구축했습니다. 그들은 실제 영상을 가져와서, 다른 AI 도구들을 사용해 첫 번째 프레임에서 얼굴을 바꾼 뒤, 모션 가이드 로봇을 사용하여 나머지 영상이 새로운 얼굴을 따라가도록 만들었습니다. 그런 다음 AI가 실수로 무용수에게 팔을 세 개 만들어버리는 것과 같은 잘못된 시도들을 걸러내어 완벽한 학습 세트를 만들었습니다. 이를 통해 하나의 모델이 한 명의 인물 교체, 두 명의 인물 교체, 심지어 배경 변경까지 별도의 도구 없이도 모두 수행할 수 있도록 훈련시켰습니다.
그렇다면 영화 한 편을 만드는 것은 어떨까요? 대부분의 AI 비디오 생성기는 몇 초가 지나면 혼란에 빠지거나 화면이 흐릿해집니다. Vorch-IR은 '템포럴 오버래핑 인퍼런스(temporal overlapping inference, 시간적 중첩 추론)'라는 영리한 기술을 사용합니다. 긴 벽화를 그린다고 상상해 보세요. 작은 구역 하나를 칠하고 말린 다음 다음 구역을 칠하는 방식(이 경우 색상이 달라질 수 있음) 대신, Vorch-IR은 겹치는 구간들을 동시에 그리며 매끄럽게 블렌딩합니다. 이를 통해 캐릭터의 얼굴이 변하거나 움직임이 이상해지는 현상 없이, 영상을 한 클립씩 생성할 필요도 없이 1분 길이의 영상을 생성할 수 있습니다.
연구팀은 Vorch-IR을 다른 최상위 AI 모델들과 비교 테스트했습니다. 직접적인 비교 결과, Vorch-IR은 새로운 인물의 얼굴이 사진과 똑같이 보이게 하는 능력(정체성 보존)과 배경의 일관성을 유지하는 능력이 더 뛰어나면서도 움직임이 부드럽다는 것을 보여주었습니다. 인간 대상 테스트에서도 사람들은 특히 새로운 캐릭터가 실제처럼 보이고 물리적으로 타당하게 구현되는 측면에서 Vor way-IR의 결과를 다른 방식보다 선호했습니다. 논문은 일부 오래된 모델들이 매우 특정한 시나리오에서 완벽한 포즈 매칭과 같은 특정 작업에 약간 더 나을 수는 있지만, Vor-IR은 훨씬 더 유연하고 통합된 방식의 비디오 편집을 제공하며, 훌륭한 결과를 얻기 위해 복잡한 지도가 반드시 필요한 것은 아님을 증명한다고 제안합니다. 이는 비디오 편집이 문장 하나를 입력하는 것만큼 쉬워지는 미래를 향한 한 걸음입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.