← 최신 논문
🤖 AI

Controllable Video Object Insertion via Multi-View Priors

본 논문은 정체성 드리프트(identity drift) 및 경계 아티팩트(boundary artifacts)와 같은 기존 방식의 한계를 극복하기 위해 다각도 객체 사전 정보(multi-view object priors)와 시점 일관적 조건화(view-consistent conditioning)를 활용하는 비디오 객체 삽입 프레임워크를 제안하며, 이를 통해 우수한 시각적 품질, 정체성 일관성, 그리고 매끄러운 전경-배경 통합을 달성한다.

원저자: Qi Xia, Peishan Cong, Yichen Yao, Ziyi Wang, Yaoqin Ye, Yuexin Ma

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Qi Xia, Peishan Cong, Yichen Yao, Ziyi Wang, Yaoqin Ye, Yuexin Ma

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화 세트장에서 감독이라고 상상해 보세요. 하지만 거대한 세트를 짓는 대신, 당신은 컴퓨터 화면 속에서 작업하고 있습니다. 당신에게는 북적이는 거리의 영상이 있고, 당신은 그 교통 흐름 사이를 가로질러 걸어가는 거대한 코끼리 같은 완전히 새로운 캐릭터를 추가하고 싶습니다. 이것이 바로 컴퓨터 비전의 한 분야인 **비디오 객체 삽입(video object insertion)**의 세계입니다. 과학자들은 AI에게 기존 영상 속에 새로운 것을 붙여넣는 법을 가르치고 있습니다. 까다로운 점은 영상은 살아있다는 것입니다. 카메라는 움직이고, 태양 빛은 변하며, 물체들은 회전합니다. 만약 당신이 코끼리의 평면 사진을 움직이는 영상에 그냥 붙여넣기만 한다면, 그것은 어울리지 않는 스티커처럼 보일 것입니다. 코끼리가 고개를 돌릴 때 모습이 이상해 보이거나, 땅 위를 걷는 대신 공중에 떠 있는 것처럼 보일 수도 있습니다. 이를 해결하기 위해 초기 방법들은 코끼리의 사진 한 장이나 단순한 텍text 설명만을 사용하려 했지만, 이는 마치 조각상의 앞모습만 보고 뒷모습을 추측하려는 것과 같습니다. 그 결과는 종-종 형태나 색상이 변하며 흔들리고 결함이 많은 엉망진창인 상태가 됩니다.

하지만 이제, 이 "스티커 문제"를 기발한 트릭으로 해결하기로 결심한 상하이 공과대학교(ShanghaiTech University)의 새로운 연구팀을 만나보세요. 그들은 움직이는 영상 속에서 물체가 실감 나게 보이려면, 단 하나의 각도가 아니라 모든 각도에서 물체가 어떻게 보이는지 알아야 한다는 사실을 깨달았습니다. 그들의 해결책은 AI가 영상을 시도하기도 전에 물체에 대한 360도 투어를 제공하는 것과 같습니다. AI에게 단 한 장의 평면 사진을 보여주는 대신, 그들은 먼저 그 사진을 3D 모델로 변한 뒤 다양한 방향에서 수백 개의 "스냅샷"을 찍습니다. 그들은 이것을 **다중 뷰 사전 정보(Multi-View Priors)**라고 부릅니다. 이것은 화가에게 얼굴 사진 한 장을 건네주는 것과 살아있는 모델을 주어 주변을 걸어 다니며 관찰하게 하는 것의 차이와 같습니다.

하지만 이 모든 추가 사진을 가지고 있는 것만으로는 충분하지 않습니다. AI는 정확히 어느 순간에 어떤 사진을 사용해야 할지 알아야 합니다. 만약 영상 속 코끼리가 왼쪽으로 몸을 돌린다면, AI는 기억 저장소에서 '앞모습'이 아닌 '왼쪽 측면' 사진을 즉시 가져와야 합니다. 연구진은 초지능적인 사서 역할을 하는 특별한 **뷰 일관성 조건화 모듈(View-Consistent Conditioning Module)**을 구축했습니다. 영상 카메라가 움직일 때, 이 사서는 장면과 일치하는 코끼리의 완벽한 각도를 즉시 찾아냅니다. 또한 그들은 "품질 검사" 시스템도 추가했습니다. 때때로 평면 사진을 3D 모델로 변환하는 과정에서 오류가 발생하여 이상하거나 흐릿하거나 부분이 누락된 결과물이 나올 수 있습니다. AI는 이러한 좋지 않은 스냅샷을 무시하고 명확한 스냅샷에만 집중하도록 학습되어, 코끼리가 갑자기 픽셀 덩어리로 변하는 것을 방지합니다.

마지막으로, 코끼리가 공중에 떠 있거나 이상한 후광과 함께 빛나 보이지 않도록 하기 위해, 그들은 **통합 인식 일관성 모듈(Integration-Aware Consistency Module)**을 추가했습니다. 이 시스템의 이 부분은 깊이 감지 탐정처럼 작동합니다. 이 모듈은 배경의 나무나 자동차와 비교하여 코끼리의 깊이가 어느 정도인지 확인하며, 코끼리가 나무 뒤로 걸어갈 때 나무 뒤로 숨겨지게 하고 적절한 그림자를 드리우게 합니다. 또한 코끼리가 프레임 사이에서 깜빡거리거나 떨리지 않도록 규칙을 추가하여, 움직임을 부드럽고 자연스럽게 유지했습니다.

그들이 새로운 프레임워크를 테스트했을 때, 결과는 인상적이었습니다. 실험에서 그들의 방식은 이전의 시도들보다 훨씬 더 사실적인 영상을 만들어냈습니다. 삽입된 물체들은 카메라가 회전하더라도 원래의 모습(정체성 일관성)을 유지했으며, 잘라 붙인 듯한 느낌 없이 배경에 자연스럽게 녹아들었습니다. 예를 들어, 그들이 DAVIS라는 데이터셋을 사용하여 테스트했을 때, 그들의 방식은 이미지 선명도(PSNR)에서 23.22, 구조적 유사도(SSIM)에서 0.9026을 기록하며 다른 최고 수준의 방법들을 앞질렀습니다. 그들은 심지어 텍스트 설명만으로도 시스템이 작동할 수 있음을 보여주었는데, 이는 단어를 3D 모델로, 그리고 다시 영상으로 변환함으로써 항상 완벽한 사진이 있어야 시작할 수 있는 것은 아님을 증명했습니다. 비록 이 시스템이 완벽하지는 않으며 여전히 초기 3D 변환의 품질에 의존하고 있지만, 연구진은 이러한 다중 뷰 "메모리 뱅크"를 사용하는 것이 영상 편집을 결함투성이의 퍼즐이 아닌 마법처럼 느껴지게 만드는 데 있어 중요한 진전이라고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →