← 최신 논문
💻 computer science

RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video

RiGS는 정적, 강체, 그리고 일시적인 가우스 원소로 장면을 분해하여 단일 단안 비디오에서 동적 3D 장면을 재구성함으로써 장기적인 부드러운 변환과 단기적인 복잡한 변형을 동시에 포착하고 새로운 뷰 합성에서 최첨단 성능을 달성하는 새로운 4D 가우스 스플래팅 프레임워크입니다.

원저자: Chenyu Wu, Wanhua Li, Zhu-Tian Chen, Hanspeter Pfister

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chenyu Wu, Wanhua Li, Zhu-Tian Chen, Hanspeter Pfister

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

단일 스마트폰 카메라로 촬영한 영상 하나만을 사용하여 움직이는 3D 세계 (예: 춤추는 사람이나 주행하는 자동차) 를 재현해 보라고 상상해 보세요. 이는 컴퓨터에게 거대한 퍼즐과 같습니다. 이 논문은 이러한 퍼즐을 해결하기 위한 새로운 솔루션인 RiGS(Rigid-aware 4D Gaussian Splatting) 를 소개합니다.

다음은 간단한 비유를 통해 설명한 작동 원리입니다:

문제: 한 가지 크기가 모두에게 맞지 않음

이전 방법들은 영상의 모든 움직이는 부분을 설명하기 위해 동일한 "도구"를 사용하려 했습니다.

  • 일부 도구는 느리고 부드러운 움직임(예: 직선 도로를 주행하는 자동차) 을 설명하는 데는 뛰어났지만, 사물이 빠르게 움직이거나 모양이 급격히 변할 때 (예: 꼬리를 흔드는 개) 는 실패했습니다.
  • 다른 도구들은 빠르고 혼란스러운 움직임에는 좋았지만, 시간이 지남에 따라 영상이 떨리고 불안정하게 보이게 만들었습니다.

저자들은 실제 세계의 움직임이 두 개의 봉우리를 가진 산맥과 같다는 점을 깨달았습니다. 하나는 길고 부드러운 움직임을 위한 봉우리이고, 다른 하나는 짧고 빠르며 복잡한 움직임을 위한 날카로운 봉우리입니다. 하나의 도구로 두 개의 봉우리를 모두 오르는 것은 효과가 없습니다.

해결책: 세 가지 도구가 있는 키트

RiGS 는 영상에서 일어나는 상황에 따라 3D 장면을 구축하기 위해 세 가지 다른 유형의 "디지털 빌딩 블록"(가우시안 프리미티브라고 함) 을 사용하여 이 문제를 해결합니다.

  1. 정적 블록 (배경):
    이들을 방의 벽이라고 생각하세요. 절대 움직이지 않습니다. 영상의 시작이든 끝이든, 이 블록들은 바닥, 벽, 또는 하늘을 표현하기 위해 정확히 제자리에 머뭅니다.

  2. 강체 블록 (부드러운 댄서):
    강체 로봇 팔이나 단단한 나무 상자를 상상해 보세요. 이 블록들은 하나의 단위로 함께 움직입니다. 모양을 변형시키지 않고 부드럽게 미끄러지거나 회전하거나 주행하는 사물에 적합합니다. 이들은 "장기적"인 부드러운 움직임을 처리합니다.

  3. 일시적 블록 (불꽃놀이):
    이들은 불꽃놀이벌떼와 같습니다. 매우 짧은 시간 동안 나타나고, 미친 듯이 다양한 방향으로 움직인 뒤 사라지도록 설계되었습니다. 이들은 강체 블록이 처리할 수 없는 "단기적"인 빠르고 복잡하거나 흔들리는 움직임 (예: 펄럭이는 깃발이나 흔들리는 개의 꼬리) 을 처리합니다.

마법 같은 트릭: 역할 전환

RiGS 의 교묘한 점은 컴퓨터가 학습하는 동안 이 블록들이 역할을 바꿀 수 있다는 것입니다.

  • 만약 "강체 블록"(부드러운 댄서) 이 너무 빠르거나 너무 흔들리는 움직임을 모델링하려다 어려움을 겪는다고 깨닫습니다.
  • 시스템은 "좋아, 너는 더 이상 부드러운 댄서가 아니야; 너는 불꽃놀이야!"라고 말하며 일시적 블록으로 변환합니다.
  • 이를 통해 시스템이 영상의 모든 단일 부분에 대해 어떤 도구가 가장 적합한지 자동으로 결정하여 결과가 매끄럽고 동시에 디테일하게 유지되도록 합니다.

"객체" 규칙

컴퓨터가 혼란에 빠지지 않도록 하기 위해 RiGS 는 **객체 단위 동적 마스크 (Object-Wise Dynamic Mask)**라는 특별한 규칙을 사용합니다.

  • 옛 방식: 컴퓨터는 개별 픽셀을 보았습니다. 만약 개의 꼬리가 흔들리지만 개 몸통은 정지해 있다면, 혼란을 겪어 전체 개가 반은 움직이고 반은 정지해 있다고 생각할 수 있었습니다.
  • RiGS 방식: 컴퓨터는 전체 객체(전체 개) 를 봅니다. 개의 어떤 부분이 움직이면, 컴퓨터는 전체 개를 움직이는 객체로 취급합니다. 이렇게 하면 3D 모델이 일관성을 유지하고 영상이 깨지거나 고장 난 것처럼 보이지 않도록 방지합니다.

결과

이러한 믹스 앤 매치 방식을 사용하여 RiGS 는 단일 영상을 고화질 3D 장면으로 변환하여 어떤 각도에서도 볼 수 있게 합니다.

  • 흐릿하게 만들지 않고 부드럽고 긴 움직임(예: 걷는 사람) 을 포착합니다.
  • 영상이 떨리게 하지 않고 빠르고 디테일한 움직임(예: 표정이나 펄럭이는 옷) 을 포착합니다.

간단히 말해, RiGS 는 단일 영상 파일에서 완벽한 3D 영화를 만들기 위해 언제 고정된 크레인을, 언제 유연한 로봇 팔을, 언제 드론 떼를 사용해야 할지 정확히 아는 스마트한 건설 팀과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →