← 최신 논문
💻 computer science

Mixed Neural Rendering: Interactive Mixed Reality Capture and Curation for Neural 3D Reconstruction

이 논문은 전통적인 획득의 한계를 극복하고 강건한 객체 중심 신경 3D 재구성을 가능하게 하기 위해 실시간 캡처, 인시투(in-situ) 검사, 그리고 프롬프트 기반 세그멘테이션을 통합하는 홀로렌즈 2 기반의 인터랙티브 혼합 현실 파이프라인인 MiNeR(Mixed Neural Rendering)을 소개한다.

원저자: Alessio Paolucci, Lorenzo Stacchio, Emanuele Balloni, Pasquale Cascarano, Primo Zingaretti

게시일 2026-07-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alessio Paolucci, Lorenzo Stacchio, Emanuele Balloni, Pasquale Cascarano, Primo Zingaretti

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 가장 좋아하는 장난감의 완벽하고 사실적인 3D 복사본을 카메라로 만들려고 노력하고 있다고 상상해 보세요. 보통은 사진을 수없이 찍어서 슈퍼컴퓨터로 보낸 뒤, 컴퓨터가 각 사진을 찍을 때 당신이 어디에 서 있었는지 알아내기 위해 몇 시간 동안 기다려야 합니다. 만약 특정 지점을 놓쳤거나 사진이 흐릿하게 찍혔다면, 컴퓨터는 작동을 멈출 수도 있고, 당신은 너무 늦기 전까지는 그 사실을 알 수 없습니다. 이는 마치 케이크를 굽고 나서야 달걀을 넣는 것을 깜빡했다는 사실을 오븐에 넣은 후에야 깨닫는 것과 같습니다.

이러한 "베이킹 재앙" 문제를 해결하기 위해 설계된 새로운 시스템인 MiNeR(Mixed Neural Rendering)가 등장했습니다. 연구팀은 홀로렌즈 2(HoloLens 2)라는 특별한 헤드셋을 사용하여 사진을 촬영하는 동안에도 사진을 캡처하고, 확인하고, 수정할 수 있는 워크플로우를 구축했습니다.

"마법 안경" 워크플로우

HoloLens 2를 단순한 카메라가 아니라 세상을 3D로 보는 마법 안경이라고 생각하세요. 이 안경을 쓰고 사진을 찍으면, 안경은 당신이 정확히 어디에 서 있고 어디를 보고 있는지 즉시 알 수 있습니다.

기존 방식에서는 사진을 찍어 집으로 돌아간 뒤 컴퓨터가 각도를 계산해주기를 기도해야 했습니다. 하지만 MiNeR를 사용하면, 물체 주위를 걸어 다니는 동안 시야에 당신이 사진을 찍은 위치를 보여주는 작은 떠 있는 "유령 카메라"들이 보입니다.

  • 문제점: 만약 사진을 찍지 않은 빈 공간이나 흐릿한 사진이 떠 있는 것을 발견한다면, 그 자리에서 바로 삭제할 수 있습니다.
  • 해결책: 당신은 그 빈 곳으로 걸어가서 즉시 새 사진을 찍을 수 있습니다. 당신은 컴퓨터가 작업을 시작하기도 전에 스스로 데이터셋을 관리하는 인간 편집자 역할을 수행하게 됩니다.

세 가지 주요 실험

연구진은 단순히 시스템을 구축한 것에 그치지 않고, 이를 아홉 가지의 서로 다른 실제 사물(물병, 배낭, 선풍기 등)을 통해 엄격한 "맛 테스트"를 거쳤습니다. 그들은 어떤 요소가 최상의 3D 복사본을 만드는지 확인하기 위해 세 가지 변수를 테스트했습니다.

  1. "GPS" (포즈 소스): 헤드셋의 내장 트래킹(Direct)을 사용할 것인가, 아니면 각도를 파악하기 위해 COLMAP이라는 강력한 오프라인 컴퓨터 프로그램(SfM)을 사용할 것인가?
  2. "마스크" (세그멘테이션): AI 도구(SAM 2)를 사용하여 배경을 잘라내고 물체에만 집중할 것인가, 아니면 배경의 혼란스러움을 그대로 둘 것인가?
  3. "엔진" (렌더러): 기존의 "NeRF" 방식을 사용할 것인가, 아니면 더 새로운 "3D 가우시안 스플래팅(3DGS)" 방식을 사용하여 3D 모델을 구축할 것인가?

결과 (성적표)

1. "골드 스탠다드" (최고 품질)
모든 것이 완벽하게 진행되었을 때, 최고의 결과는 다음 세 가지를 결합했을 때 나타났습니다.

  • 각도를 파악하기 위해 COLMAP 컴퓨터 프로그램을 사용함.
  • 배경을 마스킹하기 위해 SAM 2 AI를 사용함.
  • 3D 가우시안 스플래팅(3DGS) 엔진을 사용함.

이 조합은 가장 높은 품질의 이미지를 생성했으며, PSNR 31.78, SSIM 0.964, LPIPS 0.050을 기록했습니다. (PSNR을 선명도 점수라고 생각한다면, 31.78은 매우 날카롭고 선명한 수치입니다.)

2. "플랜 B" (신뢰성)
여기 반전이 있습니다. "골드 스탠다드"(COLMAP)는 취약합니다. 테스트 결과, 이 방식은 9개 중 4개의 물체에서 작동에 실패했습니다(성공률 55%). 이는 마치 길이 조금만 울퉁불퉁해도 고장 나는 고급 스포츠카와 같습니다.

하지만 "Direct" 방식(헤드셋 자체 트래킹 사용)은 절대 실패하지 않았습니다. 이 방식은 9개 중 9개 모든 물체에서 100% 성공했습니다.

  • 트레이드오프: Direct 방식은 단독으로 사용했을 때 (마스킹 없이) 더 낮은 품질의 이미지(PSNR 약 13.27 ~ 13.36)를 생성했습니다. 하지만 절대 멈추지 않았습니다. 저자들은 이것이 필수적인 "백업" 옵션이라고 제안합니다. 만약 화려한 컴퓨터 프로그램이 작동하지 않더라도, 헤드셋의 자체 트래킹이 프로세스를 계속 유지해 주기 때문입니다.

3. "마스크"의 힘
어떤 방식을 사용하든, AI 마스크로 배경을 잘라내는 것은 엄청난 차이를 만들었습니다.

  • 3DGS 엔진의 경우, 마스킹을 사용하면 COLMAP 사용 시 품질 점수가 +12.37 포인트 향상되었고, Direct 헤드셋 포즈를 사용할 때도 +10.04 포인트 향상되었습니다.
  • 기본적으로, 컴퓨터에게 "지저한 방은 무시하고 의자만 봐"라고 말하는 것이 배경의 혼란스러움 때문에 컴퓨터가 혼동하는 것을 막아주었습니다.

4. 엔진의 승자
새로운 3D 가우시안 스플래팅(3DGS) 방식은 거의 모든 테스트에서 기존의 NeRF 방식을 일관되적으로 압도했습니다. 이 방식은 더 빨랐고, "Direct" 포즈를 더 잘 처리했으며, 더 선명한 결과를 만들어냈습니다.

결론

이 논문은 MiNeR가 인간을 과정에 참여시킴으로써 일반적인 사진으로 3D 모델을 만드는 방식의 게임 체인저가 될 수 있음을 시사합니다. 이 시스템이 헤드셋의 트래킹이 완벽하다고 약속하는 것은 아닙니다(헤드셋의 각도가 컴퓨터보다 "흔들리거나" 덜 정확할 수 있음을 인정합니다). 대신, 안전망을 제공합니다. 컴퓨터가 제대로 작동한다면 최고 품질을 얻을 수 있지만, 헤드셋의 자체 트래킹과 AI 마스킹을 사용한다면 언제나 사용 가능한 결과를 얻을 수 있습니다.

이것은 모든 문제를 즉시 해결하는 마법 지팡이는 아닙니다. 저자들은 자신들의 테스트 규모가 작았으며(방 안의 9개 물체 대상), 자를 사용하여 정확한 기하학적 정밀도를 측정하지 않았다는 점을 인정합니다. 하지만 현재로서는 인간의 큐레이션과 AI 마스킹, 그리고 적절한 3D 엔진을 결럽하는 것이 지저분한 방을 깔끔하고 재사용 가능한 3D 자산으로 만드는 가장 신뢰할 수 있는 방법임을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →