Forge4D: Feed-Forward 4D Human Reconstruction and Interpolation from Uncalibrated Sparse-view Videos
Forge4D는 스트리밍 3D 가우시안 재구성(streaming 3D Gaussian reconstruction)을 자기 지도 학습 기반의 밀집 움직임 예측(self-supervised dense motion prediction) 및 폐쇄 고려 융합(occlusion-aware fusion)과 결합하여 최적화함으로써, 보정되지 않은 희소 뷰 비디오로부터 동적인 3D 인간을 효율적이고 즉각적으로 재구성 및 보간할 수 있게 하는 피드포워드 모델이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
방 안에서 움직이는 사람을 포착한 다음, 카메라가 한 번도 보지 못한 각도나 기록되지 않은 시간대의 모습까지 즉각적으로 재현하는 것을 상상해 보십시오. 이것이 바로 4차원 재구성의 꿈입니다. 즉, 공간뿐만 아니라 시간 속에도 존재하는, 살아 숨 쉬는 디지털 트윈을 구축하는 것입니다. 수년 동안 이를 달성하기 위해서는 동기화된 카메라로 가득 찬 스튜디오가 필요하거나, 실시간 상호작용을 불가능하게 만드는 몇 시간의 느리고 컴퓨터 집약적인 프로세싱이 필요했습니다. 목표는 언제나 몇 개의 흩어진 비디오 클립을 통해, 디지털 모델이 무너지거나 흐릿한 덩어리로 보이지 않으면서도 사람이 어디서든, 어느 순간에도 관찰될 수 있는 완전하고 유동적인 3D 세계로 바꾸는 것이었습니다.
연구진은 이제 Forge4D라고 불리는 새로운 시스템을 통해 이 꿈을 현실로 만드는 데 중요한 발걸음을 내디뎠습니다. 움직이는 3D 형상 전체를 한꺼번에 해결하려고 시도하다가 혼란과 오류를 초래하는 대신, 이들은 과업을 두 개의 더 단순하고 연결된 작업으로 나누었습니다. 첫째, 시스템은 몇 개의 미교정 비디오 스트림으로부터 사람과 그 주변 환경의 정적인 3D 모델을 구축합니다. 이것은 장면의 고품질의 '얼어붙은 조각상'을 만드는 것과 같습니다. 둘째, 시스템은 그 조각의 아주 작은 부분들이 다음 초로 넘어갈 때 정확히 어떻게 움직이는지를 예측합니다. 형태와 움직임을 분리함으로써, 연구진은 카메라가 장면을 녹화할 때 완벽하게 정렬되거나 교정되지 않은 상태에서도 이 과정을 실시간으로 활용할 수 있을 만큼 빠르게 만드는 방법을 찾아냈습니다.
그들의 발견의 핵심은 데이터를 다루는 방식에 있습니다. 기존의 방법들은 종종 전체 비디오 시퀀스를 한꺼번에 처리하려고 시도했는데, 이는 컴퓨터 메모리를 과부하시키고 속도를 늦췄습니다. Forge4D는 비디오를 하나의 스트림으로 취급함으로써 다른 접근 방식을 취합니다. 이 시스템은 이전의 모든 역사를 다시 불러올 필요 없이, 특수한 메모리 도구를 사용하여 이전 순간에 일어났던 일을 기억하며 프레임을 차례대로 처리합니다. 이를 통해 시스템은 사람이 움직임에 따라 규모와 위치를 일관되게 유지할 수 있으며, 비디오가 재생되는 동안 디지털 모델이 줄어들거나 커지거나, 혹은 위치를 벗어나지 않도록 보장합니다. 이는 입력 데이터가 희소하고 불완전하더라도 재구성을 안정적이고 효율적으로 유지하는 방법입니다.
시스템이 안정적인 3D 모델을 갖추고 나면, 움직임을 예측해야 하는 과제에 직면합니다. 사람의 몸 위 모든 지점이 실제 세계에서 어떻게 움직이는지에 대한 완벽한 지도가 '교사'로서 존재하지 않기 때문에, 연구진은 컴퓨터를 가르치는 새로운 방법을 발명했습니다. 그들은 시스템에게 움직임을 추측하도록 요청한 다음, 그 추측을 바탕으로 3D 모델을 시간의 흐름에 따라 변형(warp)시켜 보았습니다. 만약 변형된 모델이 실제 다음 비디오 프레임과 일치한다면 그 추측은 좋은 것이었습니다. 만약 잘못되었다면, 시스템은 움직임에 대한 이해를 조정했습니다. 이러한 자기 수정 루프는 빛과 그림자가 보통 어떻게 행동하는지에 대한 검사와 결합되어, 컴퓨터가 미리 작성된 대본 없이도 인간 움직임의 복잡한 춤을 학습할 수 있게 해주었습니다. 또한, 신체의 가려진 부분을 처리하는 방법도 개발하여, 사람이 몸을 돌리거나 물체가 시야를 가릴 때도 디지털 모델이 견고함을 유지하고 깜빡거리거나 글리치 현상이 발생하지 않도록 했습니다.
이러한 접근 방식의 결과는 놀랍습니다. 사람과 사물이 상호작용하는 복잡한 장면을 포함한 다양한 데이터셋에서 테스트했을 때, 이 시스템은 기존 방식보다 더 선명하고 사실적인 이미지를 생성했습니다. 시스템은 촬영된 적 없는 각도에서 장면의 새로운 뷰를 만들어낼 수 있었고, 기록되지 않은 시간대에 대해서도 매끄럽고 자연스러운 움직임을 생성할 수 있었습니다. 테스트에서 이 시스템은 프레임당 0.25초 미만의 속도로 고품질 이미지를 생성할 수 있었는데, 이 속도는 가상 현실, 라이브 방송, 몰입형 통신과 같은 인터랙티브 애플 applications의 문을 열어줍니다. 연구진은 시스템이 일반적인 움직임에는 매우 잘 작동하지만, 움직임이 극도로 빠르거나 프레임 사이의 시간 간격이 너무 클 경우에는 어려움을 겪을 수 있다고 언급하며, 부드럽고 연속적인 움직임이라는 가정이 한계가 있음을 시사했습니다.
궁극적으로, 이 연구는 단순하고 미교정된 비디오로부터 역동적인 인간 장면을 이전에는 도달할 수 없었던 속도와 품질로 재구성하는 것이 가능하다는 것을 보여줍니다. 문제를 관리 가능한 단계로 단순화하고 컴퓨터가 스스로의 예측으로부터 학습하도록 가르침으로써, 연구진은 디지털 아바타가 즉각적으로 생성되어 실시간으로 상호작용할 수 있는 미래에 한 걸음 더 다가가는 도구를 만들어냈습니다. 이 시스템은 단순히 한 순간을 포착하는 것이 아니라, 그 순간 속의 시간의 흐름을 이해함으로써 우리가 비디오 속으로 걸어 들어가 마치 그곳에 실제로 있는 것처럼 둘러볼 수 있게 해줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.