← 최신 논문
💻 computer science

OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields

OmniX는 압축된 동적 토큰을 사용하여 동적 모션 모델링과 정적 기하 구조를 분리함으로써 큰 카메라 움직임이 있는 비디오에 대해 조밀한 3D 포인트 궤적을 예측하고, 훈련을 위해 새롭게 도입된 대규모 합성 데이터셋에 의해 지원되는 피드포워드 4D 재구성 프레임워크이다.

원저자: Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo

게시일 2026-07-14
📖 5 분 읽기🧠 심층 분석

원저자: Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 비디오 게임 속에 북적이는 도시 광장을 재현하려고 한다고 상상해 보세요. 하지만 당신에게 있는 것이라고는 사람들이 걷고, 자동차가 질주하며, 태양이 하늘을 가로질러 움직이는 모습을 담은, 흔들리는 핸드헬드 카메라 영상뿐입니다. 카메라는 거칠게 흔들리고, 줌인되고, 이리저리 점프합니다. 이런 종류의 비디오로부터 3D 모델을 구축하려 했던 이전의 시도 대부분은 마치 눈가리개를 한 채 퍼즐을 맞추려는 것과 같았습니다. 즉, 움직이는 사람들을 고정시켜 버리거나(동작을 무시하거나), 카메라가 너무 많이 움직이면 혼란에 빠져 흐릿하고 깨진 결과물을 만들어냈습니다.

여기에, 드디어 이러한 역동적인 장면을 4D로 재구성할 수 있게 해주는 새로운 "피드포워드(feed-forward)" 프레임워크(쉽게 말해, 매우 빠른 원샷 레시피)인 OmniX가 등장했습니다. 이는 3D 형태뿐만 아니라, 시간이 지남에 따라 모든 지점이 어떻게 움직이는지까지 포착한다는 것을 의미합니다. 카메라가 미친 듯이 움직이는 상황에서도 말이죠.

마법의 기술: 정적인 것과 회전하는 것의 분리

이 논문은 이전 방식들이 배경의 형태와 사람의 춤 동작을 분리하지 않고 동시에 파악하려 했기 때문에 실패했다고 주장합니다. 이는 마치 믹서기를 사용하여 트랙을 분리하지 않은 채, 드럼 솔로가 연주되는 동안 바이올린 솔로를 들으려고 노력하는 것과 같습니다.

OmniX는 이 두 가지를 명시적으로 **분리(disentangling)**함으로써 이 문제를 해결합니다. 즉, 배경(정적 기하 구조)과 전경(동적 움직임)을 서로 다른 재료로 취급합니다.

  • 정적 부분: 벽과 바닥이 어디에 있는지 파악합니다.
  • 동적 부분: 모든 픽셀의 움직임을 개별적으로 추적하는 대신(이는 느리고 계산 집약적입니다), OmniX는 영리한 트릭을 사용합니다. 이 모델은 아주 작고 희소한(sparse) "동적 토큰(dynamic tokens)" 세트를 식별합니다. 이들을 군중 전체의 움직임을 지도화하기 위해 파견된 몇 명의 **초정밀 정찰병(super-scouts)**이라고 생각하십시오. 3D 움직임은 본질적으로 희소하고 조직적(low-rank)이기 때문에, 이 소수의 정찰병은 모든 각도와 모든 시간대에서 비디오의 모든 픽셀이 어떻게 움직여야 하는지를 나타내는 "궤적 필드(trajectory field)"를 생성할 수 있습니다.

"원 패스(One-Pass)"의 초능력

과거의 방법들은 종종 느릿느릿한 탐정처럼 작동했습니다. 프레임 단위로 확인하며 "이 점이 어디로 갔지?"라고 묻고, 다시 "그다음엔 어디로 갔지?"라고 반복해서 물었습니다. 이것을 "반복적(iterative)" 방식이라고 하며, 매우 느립니다.

OmniX는 다릅니다. 이 모델은 단 한 번의 과정으로 모든 점의 전체 경로를 예측합니다. 이는 영화를 보면서 일일이 일시 정지하고 되감지 않아도, 모든 등장인물의 미래 경로를 즉각적으로 알아내는 것과 같습니다. 이것은 **희소 시공간 주의 집중(Sparse Spatiotemporal Attention, SSA)**이라는 새로운 메커니즘을 통해 가능해졌습니다. SSA는 가장 중요한 "동적 토큰"을 선택하고, 이를 시간 축으로 확장하며, 이들이 모든 이미지 데이터와 "대화"하여 움직임을 파악하도록 합니다. 그런 다음, **변형 가능한 궤적 샘플링 헤드(Deformable Trajectory Sampling Head)**가 이러한 희소한 단서들을 가져와 빈틈을 채움으로써, 전체 장면에 대해 조밀하고 픽셀 단위로 완벽한 궤적을 제공합니다.

훈련 체육관 구축: UE5 엔진

춤추는 법을 한 번도 본 적 없는 로봇에게 춤을 가르칠 수는 없습니다. 저자들은 이토록 야심 찬 모델을 훈련시키기 위해 "큰 카메라 움직임"과 완벽한 3D 라벨이 포함된 실제 데이터가 부족하다는 것을 깨달았습니다. 그래서 그들은 자신들만의 자동 데이터 엔진인 "체육관"을 직접 만들었습니다.

**언리얼 엔진 5(UE5)**를 사용하여, 그들은 자동 데이터 엔진을 구축했습니다. 정적인 환경을 만든 뒤, 그 안에 움직이는 자동차나 사람 같은 동적 객체들을 투입하고, 커스텀 카메라 시스템을 이용해 카메라가 격렬하게 휘둘러지는 영상을 촬영했습니다.

  • 결과: 그들은 80,000개의 장면128만 개의 멀티뷰 비디오로 구성된 방대한 데이터셋을 생성했습니다.
  • 주석(Annotation): 모든 비디오에는 정확한 깊이(depth), 카메라 포즈, 그리고 조밀한 3D 점 궤적이라는 완벽한 "그라운드 트루스(ground truth)" 라벨이 포함되어 있습니다. 이 합성 데이터 덕분에 OmniX는 이전 모델들을 혼란에 빠뜨렸던 180도에 달하는 격렬한 카메라 스윙을 처리하는 법을 배울 수 있었습니다.

결과: 얼마나 뛰어난가?

논문은 OmniX를 여러 과제에 대해 테스트했으며, 수치는 이 모델이 해당 분야의 새로운 리더임을 보여줍니다.

  • 조밀한 3D 점 궤적(Dense 3D Point Trajectory): 자체 검증 세트에서 OmniX는 이전의 최고 방법들(VDPM 및 TraceAnything 등)을 상당한 차이로 앞질렀습니다. 예를 들어, "분리된 비디오 쌍(Disjoint Video Pairs, 시간적으로 겹치지 않는 두 개의 별개 비디오 클립)"에서 OmniX는 모든 점에 대해 0.444APD3D(평균 점 거리)를 기록했는데, 이는 차점자인 VDPM의 0.306과 비교됩니다. (참고: 이 특정 지표에서 높은 APD3D는 더 나은 성능을 의미합니다.) 또한 오차율도 크게 감소하여, 일부 설정에서 OmniX는 0.101EPE(종단 오차)를 달성하며 VDPM의 0.306을 압도했습니다.
  • 3D 점 추적(3D Point Tracking): TAPVid-3D 벤치마크에서 OmniX는 세 가지 데이터셋(ADT, DriveTrack, PStudio)에서 최첨단(state-of-the-art) 결과를 달성했습니다. 예를 들어, ADT 데이터셋에서 OmniX는 0.367APD3D에 도달하여, 다음 순위인 VDPM(0.266)을 큰 차이로 제쳤습니다. 여기서도 높은 APD3D가 더 좋은 성능을 의미하므로, 이는 상당한 수준의 정확도 향상을 나타냅전합니다.
  • 기타 작업: 또한 비디오 깊이 추정 및 카메라 포즈 추정에서도 뛰어난 성능을 보였으며, KITTISintel과 같은 데이터셋에서 최고 경쟁자들과 대등하거나 그들을 능가했습니다.

무엇이 작동하지 않는가 (그리고 무엇을 배제했는가)

논문은 실험을 바탕으로 무엇이 효과가 없는지에 대해서도 매우 명확하게 밝히고 있습니다.

  • 정찰병을 위한 "자기 주의 집중(Self-Attention)": 저자들은 SSA 모듈 내에서 동적 토큰들이 서로 대화하게 만드는 "자기 주의 집중" 레이어를 추가해 보았습니다. 결과는 어떠했을까요? 거의 차이가 없었습니다. 논문은 이를 불필요한 것으로 명시적으로 배제하여 계산 자원을 절약했습니다.
  • 반복적인 추측: 논문은 점을 "반복적으로 쿼리"하는 기존 방식에 반대합니다. 이들의 "원 패스" 접근 방식은 조밀한 예측을 위해 더 빠르고 정확하다는 것이 입증되었습니다.
  • "작은 카메라 움직임"의 제한: 조밀한 궤적을 예측하던 이전 방식들은 카메라가 거의 움직이지 않는 비디오로 제한되었습니다. 반면 OmniX는 큰 카메라 움직임(최대 180도)과 심지어 시간적으로 분리된 입력(시간적으로 겹치지 않는 비디오)에서도 작동함을 명시적으로 증명했습니다.

결론

OmniX는 "무엇이 움직이는가"와 "무엇이 멈춰 있는가"를 분리하고, 8만 개의 장면으로 구성된 방대한 합성 데이터셋으로 훈련함으로써, 마침내 단 한 번의 효율적인 과정(one-pass)으로 혼란스러운 핸드헬드 비디오로부터 역동적인 4D 세계를 재구성할 수 있음을 시사합니다. 이는 단순한 개선이 아닙니다. 저자들은 이 모델이 모든 점의 움직임을 예측하는 데 있어 새로운 최첨단(state-of-the-art) 기준을 세웠음을 보여주며, 자율 주행이나 AR/VR 콘텐츠 제작과 같은 분야를 위한 강력한 도구가 될 것임을 입증했습니다.

논문은 이것이 우주의 모든 가능한 시나리오에 대한 해결책이라고 주장하는 것은 아니지만, 8만 개의 장면과 128만 개의 비디오를 통한 증거는 이것이 현재 우리가 가진, 거대하고 복잡한 카메라 움직임을 처리하기 위한 가장 견고한 방법임을 강력하게 뒷받침합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →