UniVideo: Unified Understanding, Generation, and Editing for Videos
UniVideo는 비디오 이해, 생성 및 편집을 단일 멀티모달 지시 패러다임 아래 통합하는 다재다능한 듀얼 스트림 프레임워크로, 최첨단 성능을 달성하고 태스크 구성 및 이미지 편집 데이터로부터의 제로샷 전이와 같은 새로운 능력을 가능하게 합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 비디오를 보고 무슨 일이 일어나는지 말해주고, 완전히 새로운 비디오를 처음부터 만들며, 당신의 지시사항을 듣고 기존의 비디오를 편집할 수 있는 세 가지 일을 동시에 수행하는 아주 똑똑한 비서가 있다고 상상해 보세요.
지금까지 대부분의 AI 비서는 전문화된 작업자 같았습니다. 어떤 것은 비디오를 보는 데는 뛰어나지만 만들지는 못했습니다. 또 다른 것은 훌륭한 비디오 감독이지만 복잡한 지시를 이해하지 못했습니다. 세 번째는 숙련된 편집자이지만 모든 작업마다 특정 도구가 필요했습니다.
UniVideo는 이 모든 일을 하나의 패키지에 담아 수행하는 "맥가이버 칼(Swiss Army Knife)" 같은 비서를 고용하는 것과 같습니다. 다음은 쉬운 비유를 사용한 작동 방식입니다.
1. 두 개의 뇌 시스템
논문은 UniVideo가 "이중 스트림(dual-stream)" 설계를 사용한다고 설명하는데, 이는 마치 두 명의 전문화된 뇌가 함께 협력하는 것과 같습니다.
- "이해하는 뇌" (MLLM): 이것은 매우 박식한 사서라고 생각하면 됩니다. 사서는 당신의 지시사항을 읽고, 참조 사진을 보고, 비디오를 시청합니다. 사서는 이야기, 맥락, 그리고 논리를 이해합니다. 무엇이 "햇살 가득한 해변"처럼 보이는지, 그리고 "탐정 모자"가 무엇을 의미하는지 알고 있습니다.
- "창조하는 뇌" (MMDiT): 이것은 숙련된 화가나 특수 효과 아티스트라고 생각하면 됩니다. 이 뇌는 글을 잘 읽지는 못하지만, 원재료를 가져와 움직이는 그림으로 그려내는 데는 매우 뛰어납니다.
마법 같은 연결: "이해하는 뇌"가 요청을 읽고 상세한 계획을 "창조하는 뇌"에게 속삭입니다. 그러면 "창조하는 뇌"는 비디오를 그려내며, 디테일(셔츠의 질감이나 자동차의 움직임 등)이 실제처럼 보이고 일관되게 유지되도록 만듭니다.
2. 무엇을 할 수 있나요?
이 두 뇌가 함께 훈련되었기 때문에, UniVideo는 각기 다른 앱을 사용할 필요 없이 매우 다양한 작업을 처리할 수 있습니다.
- 감독: 당신이 "하와이안 셔츠를 입고 해변에 앉아 있는 남자의 영상을 만들어줘"라고 말하면, 그것이 영상을 생성합니다.
- 편집자: 비디오를 업로드하고 "남자의 셔츠를 초록색으로 바꿔줘" 또는 "남자를 이 사진 속 인물로 교체해줘"라고 말하면, 그것이 수행합니다.
- 스토리텔러: 비디오를 보여주고 "여기서 무슨 일이 일어나고 있나요?"라고 물으면, 장면을 상세하게 설명해 줍니다.
- "사고" 모드: 이것은 특별한 기능입니다. 때때로 당신의 지시사항은 엉성하거나 그림과 함께 올 수 있습니다. 예를 들어, 사진 위에 대략적인 스케치를 하고 "이것이 일어나게 해줘"라고 말할 수 있습니다. "이해하는 뇌"는 당신의 엉성한 그림을 파악하여 "창조하는 뇌"가 따를 수 있는 명확한 계획으로 바꿉니다.
3. "제로샷(Zero-Shot)" 초능력
논문이 주장하는 가장 멋진 것 중 하나는 UniVideo가 명시적으로 배우지 않은 일도 할 수 있다는 점입니다.
아이에게 사진 편집하는 법(공원에서 사막으로 배경을 바꾸는 법)을 가르친다고 상상해 보세요. 그다음, 아이에게 공원 영상을 보여주며 배경을 사막으로 바꾸라고 요청합니다. 설령 당신이 아이에게 비디오를 편집하는 법을 구체적으로 가르치지 않았더라도, 아이는 배경을 바꾸는다는 개념을 이해하기 때문에 스스로 알아낼 수도 있습니다.
UniVideo도 이와 같이 작동합니다. 이 모델은 이미지를 편집하는 데 집중적으로 훈련되었으며, 비디오를 편집하라는 요청을 받았을 때(날씨를 바꾸거나 물체의 재질을 바꾸는 등) 그 지식을 전이합니다. 모든 종류의 편집에 대해 매번 별도의 "비디오 편집" 수업을 들을 필요 없이, 이미지에서 배운 것을 비디오 세계에 적용한 것입니다.
4. 왜 다른가요?
이전의 모델들은 작업에 맞는 도구를 직접 골라야 하는 도구 상자와 같았습니다. 비디오를 편집하고 싶다면 특정 "비디오 편집" 도구가 필요했고, 비디오를 생성하고 싶다면 "생성기" 도구가 필요했습니다.
UniVideo는 유니버설 리모컨과 같습니다. 버튼 하나를 누르면(하나의 지시를 내리면), 장치가 그것이 관찰해야 하는지, 생성해야 하는지, 혹은 편집해야 하는지를 스스로 판단하여 작업을 완벽하게 수행합니다. 논문은 이러한 "유니버설" 접근 방식이 여러 작업을 결합하고자 할 때(예: 캐릭터의 스타일을 바꾸면서 비디오를 편집하는 경우), 특히 전문화된 도구를 사용하는 것보다 더 낫다는 것을 보여줍니다.
요약하자면: UniVideo는 당신의 바람을 이해하는 똑똑한 "독자"와 그것을 실현하는 재능 있는 "예술가"를 사용하여 비디오를 보고, 만들고, 편집할 수 있는 단일 AI 모델이며, 스스로 새로운 기술을 터득할 수 있는 능력을 갖추고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.