3D Densification for Multi-Map Monocular VSLAM in Endoscopy
본 논문은 내시경용 희소 다중 맵 모노큘러 VSLAM 을 밀도화하고 정제하기 위해 LMedS 를 사용하여 NN LightDepth 예측값과 CudaSIFT 서브맵을 정렬함으로써 이상치를 효과적으로 제거하고 스케일 모호성을 완화하여 4.15 mm RMS 정확도의 신뢰할 수 있는 3D 맵을 생성하는 방법을 제안한다.
원저자:X. Anadón, Javier Rodríguez-Puigvert, J. M. M. Montiel
어두운 구불구불한 동굴 (대장의 내부) 을 지팡이에 달린 단일 카메라만으로 3D 모델로 구축한다고 상상해 보세요. 이것이 내시경 검사 중 의사가 수행하는 작업입니다. 문제는 동굴이 미끄럽고 조명이 끊임없이 변하며, 때로는 카메라가 물에 덮이거나 안개로 흐려진다는 점입니다.
구식 방법: 성가신 스케치 이전까지 이 작업을 위한 최상의 컴퓨터 시스템은 벽의 위치를 표시하기 위해 점만 그리는 매우 빠르고 매우 신중한 지도 제작자와 같았습니다. 이 시스템 (CudaSIFT-SLAM 이라고 함) 은 카메라가 길을 잃고 다시 길을 찾아야 하더라도 카메라가 어디로 이동했는지 아는 데 탁월했습니다. 그러나 이 시스템이 생성한 지도는 흩어진 잡음 점들로 이루어진 스케치와 같았습니다.
문제: 점들은 종종 잘못된 위치에 있었고 (이상치), 벽의 실제 모양을 볼 수 있을 만큼 충분히 많지 않았습니다. 작은 병변을 보거나 용종을 측정하려는 의사가 사용하기에는 너무 '희박'했습니다.
새로운 해결책: 빈칸 채우기 이 논문의 저자들은 그 성가신 점 지도를 견고하고 매끄러운 3D 표면으로 바꾸기 위한 교묘한 2 단계 팀워크를 제안합니다.
"추측"하는 예술가 (LightDepth): 그들은 LightDepth라는 현대적인 AI 도구를 사용합니다. 이 AI 를 단일 사진을 보고 빛이 어떻게 희미해지는지에 기반하여 모든 사물의 거리를 추측하는 예술가로 생각하세요 (카메라와 빛이 같은 지팡이에 있으므로 사물이 멀어질수록 어두워집니다). 이 AI 는 전체 그림에 깊이 정보를 채울 수 있지만, 결함이 하나 있습니다: 진짜 크기를 모른다는 점입니다. 방이 10 피트 넓이인지 100 피트 넓이인지 알지 못합니다. 단지 모양은 정확하지만 규모는 틀렸다는 것만 알 뿐입니다.
"진실" 탐정 (LMedS): 여기서 마법이 일어납니다. 시스템은 "추측" 예술가의 전체 그림과 "지도 제작자"의 흩어진 점들을 결합합니다. 전체 그림을 점들에 맞춰야 합니다.
점들이 잡음 (일부는 잘못됨) 이기 때문에 단순히 평균을 낼 수 없습니다.
대신 시스템은 LMedS(Least Median of Squares, 최소 제곱 중앙값) 라는 수학적 트릭을 사용합니다. 건물의 높이를 추측하는 사람들이 많다고 상상해 보세요. 대부분은 근접하지만 소수는 미친 숫자를 외치고 있습니다. LMedS 는 미친 외침을 무시하고 가장 많은 사람에게 맞는 "중간 지점"을 찾습니다.
이를 통해 시스템은 올바른 규모를 파악하고, 더 중요하게는 새로운 더 밀집된 그림에 맞지 않는 나쁜 점들 (이상치) 을 버릴 수 있습니다.
결과: 매끄럽고 정확한 모델 시스템이 "추측"과 "진실"을 정렬하고 잡음을 제거하면, Marching Cubes 라는 방법을 사용하여 모든 것을 매끄럽고 밀집된 3D 표면으로 융합합니다.
그들이 증명한 것:
속도: 그들은 프레임당 200 밀리초 미만의 시간으로 이를 수행했습니다. 이는 의료 절차에서 "실시간"으로 간주될 만큼 빠릅니다.
정확도: 그들은 정확한 모양을 알고 있는 가짜 대장 (팬텀) 에서 이를 테스트했습니다. 이전 점 지도는 큰 오차를 보였습니다 (어떤 경우 평균 99mm 오프). 새로운 방법은 그 오차를 약 4.15mm까지 줄였습니다.
견고성: 카메라가 물에 덮이거나 추적을 잃는 실제 내시경 검사 비디오에서 이를 테스트했습니다. 시스템은 더러운 데이터를 성공적으로 정리하고 모든 특정 병원이나 카메라에 대해 재학습할 필요 없이 신뢰할 수 있는 3D 지도를 구축했습니다.
한 줄 요약: 이 논문은 흩어진 점으로 이루어진 흔들리고 불완전한 3D 지도를 가져와 AI 깊이 추측기로 빈칸을 채우는 방법을 설명합니다. 그런 다음 스마트한 수학적 필터가 실수를 정리하고 크기를 수정하여 카메라가 움직이는 동안에도 대장 내부의 매끄럽고 정확한 3D 모델을 생성합니다.
기술 요약: 내시경용 다중 지도 단안 VSLAM 을 위한 3D 밀도화
문제 제기 내시경에 적용된 단안 시각 동시 위치 추정 및 매핑 (VSLAM) 은 특히 CudaSIFT-SLAM 과 같은 다중 지도 접근법을 사용할 경우 견고한 카메라 추적을 위해 효과적으로 입증되었습니다. 이러한 시스템은 모션 블러, 시간적 가림, 도구 간섭, 또는 물줄기로 인해 빈번하게 발생하는 추적 손실 후에도 추적을 성공적으로 복구합니다. 그러나 결과적으로 생성된 3D 표현은 희소하며 노이즈가 많고, 부정확한 점과 이상치가 높은 비율로 포함되어 있습니다. 따라서 이러한 희소 지도는 병변 크기 평가, 완전한 점막 커버리지 확보, 또는 중요한 영역 놓침 위험 최소화와 같은 밀집된 환경 표현이 필요한 임상 응용에는 부적합합니다. 또한, 표준 특징 기반 시스템은 내시경 환경에서 흔히 발생하는 저질감 영역에서 어려움을 겪는 반면, 직접적 방법은 추적 실패로부터 복구하는 데 필요한 루프 클로저 및 다중 매핑 기능이 종종 부족합니다.
방법론 저자들은 특징 기반 SLAM 시스템의 견고한 카메라 추적과 단일 뷰 자기지도 학습 네트워크의 밀집 깊이 예측을 통합하는 후처리 밀도화 방법을 제안합니다. 시스템은 다음과 같이 작동합니다:
입력 시스템: 파이프라인은 희소 다중 지도 (3D 점과 키프레임으로 정의된 서브맵) 생성을 위해 CudaSIFT-SLAM을, 조명 감소에 기반한 자기지도 학습 네트워크인 LightDepth를 사용하여 스케일 보정 밀집 깊이 지도 예측을 위해 활용합니다.
스케일 정렬 및 이상치 필터링: 단안 SLAM 은 스케일 모호성을 겪으며 희소 점들이 노이즈가 많으므로, 이 방법은 **최소 제곱 중위수 (LMedS)**를 사용하여 밀집 깊이 예측을 희소 3D 점 구름에 정렬합니다.
각 키프레임에 대해 시스템은 밀집 깊이 지도를 사용하여 픽셀을 역투영함으로써 희소 지도 점마다 스케일 제안을 계산합니다.
LMedS 는 견고한 스케일과 이상치와 허위 이상치를 구분하기 위한 동적 거리 임계값을 결정하는 데 사용됩니다. 이는 스케일이 알려져 있지 않으며 3D 점 오차가 깊이에 비선형적으로 의존하기 때문에 RANSAC 보다 선호됩니다.
내부 점 (inlier) 이 식별되며, 견고한 영향 함수를 사용한 비선형 최적화를 통해 최종 스케일이 정제됩니다.
밀집 융합: 밀집 깊이 지도가 스케일 조정되어 희소 지도 점과 정렬되면, 시스템은 **절단 부호 거리 함수 (TSDF)**를 사용하여 스케일 조정된 RGB-D 관측치를 융합합니다.
표면 추출: TSDF 에서 글로벌 표면은 Marching Cubes 알고리즘을 사용하여 명시적으로 추출됩니다.
주요 기여
밀집 3D 표면 재구성: 이 방법은 키프레임당 200ms 미만의 밀집 재구성을 달성하여 실시간 응용에 적합합니다.
견고한 이상치 제거: LMedS 를 활용함으로써 시스템은 사전 정의된 고정 거리 임계값이 필요 없이 희소 SLAM 지도에 내재된 허위 점들을 효과적으로 필터링합니다.
도메인 중립성: 시스템 구성 요소가 특정 도메인 사양에 중립적이므로 도메인 적응이 필요하지 않습니다.
검증: 이 방법은 C3VD 팬텀 대장 데이터셋(짧은 시퀀스와 스크리닝 시퀀스 포함) 에서 실험적으로 검증되었으며, Endomapper 데이터셋의 실제 대장내시경 기록에 대해 정성적으로 테스트되었습니다.
실험 결과
정확도: C3VD 데이터셋에서 제안된 방법은 RMS 정확도 4.15mm와 중앙값 절대 (MedA) 정확도 2.60mm 를 달성합니다. 이는 MedA 가 2.01mm 였음에도 불구하고 RMS 정확도가 99.07mm 였던 (높은 양의 이상치를 나타냄) 원시 CudaSIFT-SLAM 출력에 비해 상당한 개선을 보여줍니다.
밀도: 밀도화 과정은 원래 희소 지도에 비해 맵 점의 수를 60 배 이상 증가시킵니다.
비교: 이 방법은 LightNeus(최첨단 신경 렌더링 접근법) 와 비교할 만한 정확도의 지도를 생성하지만, 계산 비용은 그 일부이며 학습이나 정렬을 위한 ground truth 카메라 포즈가 필요하지 않습니다.
성능: 키프레임당 총 처리 시간은 약 186ms 입니다 (LightDepth 추론: 22ms, LMedS 정렬: 138ms, TSDF 통합: 26ms, Marching Cubes: 117ms), 이는 사용 가능한 200ms 예산 내에 적합합니다.
추적: 빈번한 추적 실패가 있는 스크리닝 시퀀스에서, 기반이 되는 CudaSIFT-SLAM 은 3.09mm 의 카메라 궤적 RMS ATE 를 유지하며 프레임의 83.32% 를 성공적으로 위치시켰습니다.
의의 및 주장 본 논문은 CudaSIFT-SLAM 과 LightDepth 의 제안된 결합이 허위 점으로 인한 희소 다중 지도를 정화하고 밀도화하여 실제 내시경 절차에서 견고한 카메라 추적을 가능하게 한다고 주장합니다. 저자들은 이 접근법이 희소 지도의 단일 스케일에 밀집 예측을 견고하게 정렬함으로써 단안 깊이 추정 네트워크의 고유한 스케일 모호성을 해결한다고 강조합니다. 그들은 이 방법이 추가적인 깊이 센싱 하드웨어나 명시적인 ground truth 깊이 주석이 필요 없이 실시간 제약 내에서 작동하면서도 최첨단 기술과 경쟁력 있는 정확도를 달성한다고 주장합니다. 향후 작업은 이러한 NN 깊이 추정을 초기화, 재위치, 번들 조정 (bundle adjustment) 을 위해 순차적 실시간 V-SLAM 파이프라인에 직접 통합하는 것으로 식별됩니다.