← 최신 논문
💻 computer science

UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models

UniWorld-View는 희소한 단안 입력을 바탕으로 고충실도, 기하학적 일관성, 그리고 정밀한 제어가 가능한 대규모 베이스라인의 신규 시점 합성을 달성하기 위해 명시적인 폐색 인지 3D 가이던스와 비디오 확산 모델을 결합한 통합 프레임워크입니다.

원저자: Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan

게시일 2026-08-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

스마트폰을 들고 거실을 돌아다니며 짧은 영상을 찍고 있다고 상상해 보세요. 이제 당신이 찍은 영상을 완전히 다른 각도, 예를 들어 천장 근처에 떠 있거나 한 번도 촬영한 적 없는 창문을 통해 들여다보는 것처럼 순식간에 순간 이동시키는 마술을 상상해 보세요. 그리고 그 새로운 위치에서 방을 완벽한 선명도로 보는 것입니다. 이것이 바로 컴퓨터 과학 분야에서 평면적인 2D 사진으로부터 기계가 어떻게 3D 공간을 이해하도록 가르치려 노력하고 있는 '새로운 시점 합성(novel view synthesis)'의 꿈입니다. 오랫동안 컴퓨터는 이 작업에 매우 서툴렀습니다. 만약 컴퓨터에게 사진 속 의자 뒤에 무엇이 있는지 추측하라고 한다면, 컴퓨터는 종종 틀린 답을 내놓아 이상하게 늘어진 덩어리나 보이지 않는 구멍을 만들어내곤 했습니다. 컴퓨터는 모든 각도에서 찍은 수백 장의 사진이 필요했거나(이는 지루하고 어려운 일입니다), 혹은 누락된 부분을 '환각'을 통해 채우려 시도했는데, 이는 벽이 고무처럼 휘어지는 것과 같은 기하학적 악몽을 초래하곤 했습니다. 하지만 우리가 두 세계의 장점을 결합할 수 있다면 어떨까요? 즉, 벽이 직선을 유지하도록 하는 엄격한 기하학적 규칙과, 누락된 부분이 실제처럼 보이도록 하는 현대 AI의 창의적인 힘을 결합하는 것입니다. 이것이 바로 연구자들이 가상 현실, 게임, 소셜 미디어를 진정으로 몰입감 있게 만들기 위해 해결하고자 하는 핵심 질문입니다.

여기 북경대학교와 Rabbitpre AI의 연구진이 개발한, 이러한 3D 영화를 위한 똑똑한 감독 역할을 하는 새로운 방법인 UniWorld-View가 등장했습니다. 그들이 해결한 핵심 문제는 당신이 촬영한 각도와 매우 다른 각도에서 장면을 바라보려고 할 때 발생하는 문제입니다. 이것은 마치 단 하나의 길모퉁이에서만 본 도시의 지도를 그리려는 것과 같습니다. 건물의 반대편에 무엇이 있는지 추측하려고 할 때, 실수로 건물의 앞문을 뒷벽에 그리거나 나무를 하늘 위로 길게 늘어뜨릴 수도 있습니다. 기존의 AI 방식들은 장면의 어떤 부분이 가려져 있는지(폐쇄되었는지)와 어떤 부분이 보이는지를 구분하지 못했기 때문에 이러한 "찢어짐(tearing)" 오류를 자주 범했습니다.

UniWorld-View는 영리한 2단계 전략을 통해 이 문제를 해결합니다. 먼저, 영상으로부터 거친 3D "포인트 클라우드"(장면을 나타내는 점들의 디지털 구름)를 구축합니다. 하지만 단순히 이 점들을 새로운 화면에 투영하는 대신, "삼중 재투영(triple-reprojection)"이라는 기술을 사용합니다. 그림자를 사진으로 찍고, 그 그림자의 반사된 모습을 다시 사진으로 찍은 다음, 이 둘을 비교하여 물체 뒤에 정확히 무엇이 숨겨져 있는지 알아내는 과정을 상상해 보세요. 이를 통해 AI는 어떤 픽셀이 실제이고 어떤 것이 빈 구멍인지 정확히 알려주는 완벽한 "마스크"를 생성할 수 있습니다. 또한 표면이 향하는 방향인 "법선(normals)"을 확인하여 실수로 벽의 뒷면을 보여주지 않도록 합니다.

AI가 그곳에 무엇이 있어야 하는지에 대한 깨끗하고 기하학적으로 정확한 지도를 갖추고 나면, "비디오 확산 모델(video diffusion model, 노이즈를 선명한 이미지로 서서히 바꾸며 영상을 생성하는 유형의 AI)"을 사용하여 빈 곳을 채웁니다. 하지만 여기서 핵심은 AI가 그냥 추측하는 것이 아니라는 점입니다. 이 모델은 "듀얼 스트림(dual-stream)" 시스템을 사용합니다. 한 스트림은 카메라가 당신이 원하는 곳으로 정확히 움직이도록 기하학적 지도를 살피고, 다른 스트림은 원래의 영상을 살펴 질감과 색상을 복제합니다. 이를 통해 카메라를 새로운 위치로 이동시키더라도 물체가 단단하게 유지되고 조명이 실제처럼 보여, 픽셀의 덩어리로 녹아내리는 현상을 방지합니다.

연구진은 AI가 카메라 움직임을 얼마나 잘 제어하고 3D 장면을 얼마나 일관되게 유지하는지를 테스트하는 까다로운 벤치마크인 "WorldScore"에서 이 모델을 테스트했습니다. UniWorld-View는 "정적(static)" 장면에서 가장 높은 점수(85.53)를 기록했으며, 동적 장면에서도 최고 수준의 모델들을 제치고 2위를 차지했습니다. 또한 이 모델은 특정 장면에 대해 재학습할 필요 없이 단일 영상으로부터 고품질의 새로운 뷰를 생성할 수 있는 "제로샷 학습(zero-shot learning)" 능력을 보여주었습니다. 요컨대, UniWorld-View는 AI가 물리 법칙과 기하학적 규칙을 존중하면서도 커튼 뒤의 모습을 상상할 수 있는 충분한 창의성을 갖도록 가르치며, 원본 영상이 단지 짧은 셀카 영상일지라도 자유롭게 둘러볼 수 있는 더 현실적인 가상 세계를 향한 길을 열어주고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →