← 최신 논문
💻 computer science

Difix3D-W: Distractor-Free Few-Shot 3D Gaussian Splatting in the Wild

Difix3D-W는 재설계된 확산 모델을 통한 참조 가이드 뷰 정제, 희소성 인지 가우시안 복제 전략, 그리고 LoRA 기반 정규화를 활용하여 방해 요소, 폐쇄 및 희소한 시점을 효과적으로 처리하면서 고품질 렌더링을 달나 달성하도록 설계되어 제약 없는 실제 환경을 위해 고안된 새로운 퓨샷(few-shot) 3D 가우시안 스플래팅 프레임워크입니다.

원저자: Wongi Park, Jordan A. James, Myeongseok Nam, Minjae Lee, Soomok Lee, Sang-Hyun Lee, William J. Beksi

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wongi Park, Jordan A. James, Myeongseok Nam, Minjae Lee, Soomok Lee, Sang-Hyun Lee, William J. Beksi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 완벽한 3D 홀로그램으로 번화한 도시의 거리를 만들고 싶다고 상상해 보세요. 하지만 당신에게 있는 것은 관광객들이 찍은 몇 장의 흐릿하고 무작위적인 스냅샷뿐입니다. 어떤 사진에는 사람들이 카메라 앞을 지나가고, 어떤 사진에는 자동차가 지나가며, 조명 또한 사진마다 제각각입니다.

이것이 바로 Difix3D-W가 해결하고자 하는 문제입니다. 이 프로그램은 아주 적은 양의, 엉망인 실제 사진들을 고품질의 3D 가상 장면으로 바꿀 수 있는 새로운 컴퓨터 프로그램입니다. 심지어 그 사진들이 "방해 요소"(움직이는 사람이나 자동차 등)로 가득 차 있더라도 말이죠.

이 프로그램이 어떻게 작동하는지 쉬운 개념으로 나누어 설명해 드리겠습니다.

1. 문제점: 조각이 빠진 "직소 퍼즐"

보통 3D 모델을 만들려면 모든 각도에서 촬영된 수백 장의 사진이 필요합니다. 만약 사진이 몇 장뿐이라면(희소한 세트), 컴퓨터는 혼란에 빠집니다. 물체 뒤에 무엇이 있는지 알 수 없고, 장면의 형태를 파악하는 데 어려움을 겪습니다.

게다가 실제 세계의 사진은 지저집적입니다. 움직이거나 변하는 방해 요소(distractors), 즉 프레임을 가로지르는 보행자나 날아가는 새와 같은 것들이 있습니다. 만약 컴퓨터가 이러한 움직이는 것들을 3D 모델에 포함하려고 하면, 결과물은 글리치(glitch)가 생기거나 깨진 것처럼 보이게 됩니다.

2. 해결책: "매직 에디터"와 "복사-붙여넣기" 전략

저자들은 이 문제들을 해결하기 위해 두 가지 주요 기술을 사용하는 Difix3D-W를 개발했습니다.

기술 A: "참조 가이드 에디터" (글리치 수정하기)

공원에 그림을 그리려고 하는데, 붓질을 할 때마다 캔버스를 가로지르는 새 때문에 그림이 번진다고 상상해 보세요.

  • 기존 방식: 새를 덧칠해 지우려 하지만, 새 아래에 원래 공원이 어떤 모습이었는지 모르기 때문에 그냥 추측해서 그립니다.
  • Difix3D-W 방식: 이 프로그램은 스마트한 편집기처럼 작동합니다. 엉망이 된 그림(3D 렌더링)을 보고, 새가 없는 약간 다른 각도에서 찍은 "참조(reference)" 사진과 비교합니다.
  • 마스크(The Mask): 이 프로그램은 "과도 마스크(transient mask)"라고 불리는 특수한 도구를 사용하여 새가 있는 위치를 정확히 강조합니다. 그런 다음 이렇게 명령합니다. "좋아, 이 부분의 새는 무시해. 참조 사진을 보고 새 뒤에 진짜로 있는 나무가 어떻게 생겼는지 확인한 다음, 그 내용을 네 그림에 복사해 넣어."
  • 결과: 이 과정은 전체 시스템을 처음부터 다시 학습시킬 필요 없이, 움직이는 사람들을 제거하고 빈 공간을 올바른 배경 디테일로 채워 넣어 3D 모델을 즉각적으로 깨끗하게 만듭니다.

기술 B: "희소성 인지 복사-붙여넣기" (구멍 채우기)

당신이 벽돌(컴퓨터는 이를 "가우시안(Gaussians)"이라고 부릅니다)로 벽을 쌓고 있는데, 벽돌이 몇 개 없어 벽에 커다란 구멍이 뚫려 있다고 상상해 보세요.

  • 기존 방식: 컴퓨터는 가진 몇 안 되는 벽돌을 넓게 늘려서 전체 벽을 덮으려고 합니다. 이로 인해 벽은 흐릿하고 약해 보입니다.
  • Difix3D-W 방식: 프로그램은 벽을 살펴보고 빈 공간을 찾아냅니다. 기존의 벽돌을 단순히 늘리는 대신, 지능적으로 벽돌을 복제합니다.
  • 비법(The Secret Sauce): 단순히 무작위로 복사하는 것이 아닙니다. 현재 벽돌이 얼마나 "불투명(opaque)"한지를 살핍니다. 만약 특정 영역이 투명하다면(희소하다면), 그곳에 더 많은 벽돌을 추가하여 벽을 단단하게 만듭니다. 이를 통해 원래 사진이 매우 적은 각도에서 촬영되었더라도 3D 모델이 조밀하고 상세하게 만들어지도록 보장합니다.

3. 일관성 유지하기

움직이는 부분이 많은 3D 모델을 수정할 때는 컴퓨터가 혼란을 느껴 장면이 이상하게 보이기(예: 얼굴이 녹아내리는 듯한 현상) 쉽습니다.

  • 저자들은 LoRA(Low-Rank Adaptation)라고 불리는 기술을 사용합니다. 이것은 "미세 조정(fine-tuning)" 노브(knob)라고 생각하면 됩니다. 이 기술은 컴퓨터가 3D 모델을 미세하고 정밀하게 조정할 수 있게 하여, 건물의 왼쪽 부분이 오른쪽 부분과 일치하도록 만들고 전체 장면을 안정적이고 사실적으로 유지해 줍니다.

이것이 왜 중요한가 (논문에 따르면)

논문에 따르면, 기존 방식들은 수백 장의 사진이 필요하거나(수집하는 데 시간이 너무 오래 걸림), 실제 세계의 방해 요소가 있을 경우 완전히 실패했습니다.

Difix3D-W는 희소한(sparse) 동시에 제약이 없는(unconstrained, 즉 현실의 무질서한) 사진들을 가져와 고품질의 3D 장면으로 만드는 최초의 방법입니다. 이 방식은 이전 방법들보다 더 빠르고 훨씬 더 선명한 결과를 만들어내며, 결과적으로 단 몇 장의 스냅샷만으로도, 설령 사진 속에 사람이나 자동차가 움직이고 있더라도 3D 세계를 구축할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →