Point Tracking in Surgery--The 2025 Surgical Tattoos in Infrared Challenge (STIRC2025)
본 논문은 세그멘테이션 및 3D 재구성(3D reconstruction)과 같은 수술적 응용 분야를 발전시키기 위해 STIR 데이터셋을 사용하여 7개 팀의 포인트 트래킹 정확도와 추론 효율성을 평가한 MICCAI EndoVis 2025에서 개최된 2025 Surgical Tattoos in Infrared Challenge (STIRC2025)의 결과와 참가자 방법론을 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 지금 고도의 긴장감이 흐르는 비디오 게임을 보고 있다고 상상해 보세요. 캐릭터들은 말랑말랑하고 출렁거리는 젤리로 만들어져 있고, 카메라는 미친 듯이 회전하며 줌 인과 줌 아웃을 반복합니다. 당신의 임무는 무엇일까요? 그 젤리 위에 있는 일곱 개의 특정 글리터(반짝이) 조각에 손가락을 딱 붙여 놓는 것입니다. 조직이 늘어나거나 뒤틀리고, 거대한 손이 가려더라도 말이죠. 단 하나의 조각이라도 놓치면 게임은 끝납니다.
이것이 바로 2025 STIR 챌린지(Surgical Tattoos in Infrared, 적외선 기반 수술용 타투)가 직면한 도전 과제입니다. 이 대회는 컴퓨터 과학자들이 수술 중 움직이는 조직 위의 아주 작은 점들을 추적할 수 있는 "디지털 손가락"을 만들기 위해 경쟁하는 장입니다. 목표는 단순히 점을 보는 것이 아니라, 조직이 젖은 국수처럼 꿈틀거리며 움직일 때도 그 점들이 3D 공간의 정확히 어디에 있는지 알아내는 것입니다.
설정: 투명한 잉크와 투명한 눈
공정성을 기하기 위해 주최 측은 STIRC2025라는 특별한 데이터셋을 만들었습니다. 단순히 무작위 영상을 사용한 것이 아니라, "수술용 타투" 기술을 사용했습니다. 이는 마치 (생체 테스트를 위해) 돼지 피부 위에 특수 잉크로 작은 점을 그리는 것과 같습니다. 이 잉크는 적외선 아래에서 빛을 내지만 육안으로는 보이지 않습니다.
데이터 작동 방식은 다음과 같습니다:
- 시작: 카메라는 적외선 모드에서 빛나는 점들을 포착합니다.
- 액션: 카메라는 일반 백색광 모드로 전환되고, 외과의(또는 로봇)가 조직을 움직입니다.
- 종료: 카메라는 다시 적외선 모드로 전환되어 점들이 최종적으로 어디에 위치했는지 확인합니다.
챌린지는 팀들에게 총 234개의 점이 포함된 32개의 영상 클립(평균 약 7.7초)을 제공했습니다. 팀들은 이 점들을 프레임 단위로 따라가는, 마치 초고속 "선두 따라잡기" 게임과 같은 알고리즘을 작성해야 했습니다.
게임의 규칙
심사위원들은 두 가지를 측정했습니다:
- 정확도(Accuracy): 알고리즘의 예측값이 실제 점의 최종 위치와 얼마나 가까웠는가? 이들은 다양한 "허용 오차 수준"에서 이를 확인했습니다. 2D 추적의 경우 픽셀(예: 4, 8, 16, 32, 64 픽셀) 단위로 오차를 측정했고, 3D 추적의 경우 밀리미터(2, 4, 8, 16, 32 mm) 단위로 측정했습니다.
- 효율성(Efficiency): 알고리즘이 얼마나 빠른가? 수술 중에는 컴퓨터가 생각할 시간을 기다려줄 수 없습니다. 이들은 "지연 시간"(프레임 하나를 처리하는 데 걸리는 시간)을 측정했으며, 시스템이 멈추는 현상이 발생하지 않도록 95백분위수와 99백분위수를 확인했습니다.
참가자들과 결과
일곱 팀이 경기장에 들어섰습니다. 결과는 다음과 같았습니다.
2D 추적 레이스 (평면 화면)
목표는 평면 2D 화면상의 점들을 추적하는 것이었습니다.
- 깜짝 승자: 가장 정확한 방법은 어떤 팀의 화려한 발명품이 아니라, 주최 측이 시작점으로 제공한 MFT(Multi-Frame Tracker)라는 베이스라인 방법이었습니다. 이 방법은 평균 정확도 83.50을 기록했습니다.
- 인간 팀: 가장 뛰어난 성적을 거둔 인간 팀인 CCG DGIST가 82.99로 2위를 차지했습니다. 이들은 두 가지 다른 추적 스타일(짧은 움직임에 강한 방식과 긴 움직임에 강한 방식)을 혼합하여, 마치 운전자가 기어를 변속하듯 전환하는 "하이브리드" 접근 방식을 사용했습니다.
- "컨트롤" 그룹: 모든 점에 대해 "움직임 제로"라고 가정해버린 팀이 있었는데, 이들은 50.00을 기록했습니다. 이는 아무것도 하지 않는 것이 시도하는 것보다 확실히 나쁘다는 것을 증명했습니다.
3D 추적 레이스 (깊이)
이 단계는 더 어려웠습니다. 팀들은 점들이 공간상에서 얼마나 깊은 곳에 있는지 파악해야 했습니다.
- 우승: Team NCT TSO가 점수 68.46으로 제출된 팀 중 1위를 차지했습니다. 이들은 "칼만 필터"(움직임을 예측하는 수학 도구)를 사용하는 영리한 트릭을 사용했으며, 실수를 잡아내기 위해 자신의 결과를 스스로 검증했습니다.
- 준우승: Team MFTIQProb가 57.09로 2위를 차지했습니다.
- 베이스라인: 주최 측의 자체 3D 베이스라인(2D 추적과 스테레오 카메라를 결합한 방식)은 58.80을 기록했습니다. 즉, 우승 팀(NCT TSO)은 베이스라인을 이겼지만, 2위 팀(MFTIQProb)은 베이스라인보다 낮은 점수를 기록했습니다.
속도 레이스 (효율성)
속도는 중요합니다. 알고리즘이 너무 느리면 외과의가 사용할 수 없습니다.
- 가장 빠른 팀: Team NCT TSO가 속도 경쟁에서도 우승했습니다. 이들의 알고리즘은 프레임을 단 26.25 밀리초 만에 처리했습니다.
- 격차: 그다음으로 빠른 팀은 이보다 5배나 느린 140.52 밀리초가 걸렸습니다.
- 커트라인: 속도 레이스에 참여하려면 정확도가 최고 정확도의 90% 이상이어야 했습니다. 두 팀(SRV 및 BlueJays)은 너무 부정확하여 속도 부문에 경쟁할 자격을 갖추지 못했습니다.
논문이 말하는 것 (그리고 말하지 않는 것)
저자들은 몇 가지 사항을 주의 깊게 지적합니다:
- 마법의 해결책은 없다: 베이스라인인 MFT 방식이 가장 정확했다는 사실은, 팀들이 테스트 데이터에 너무 과하게 맞춰진 "오버피팅(과적합)"을 했거나, 혹은 베이스라인 자체가 매우 견고하다는 것을 시사합니다. 저자들은 미래의 팀들이 단순히 테스트 세트뿐만 아니라 새로운 데이터에서도 작동할 수 있도록 **강력한 교차 검증(cross-validation)**에 집중해야 한다고 제언합니다.
- 3D는 여전히 까다롭다: 논문은 어떤 팀도 처음부터 "완전한 3D"로 점을 추적하지 못했다고 언급합니다. 모두가 2D 추적과 스테레오 카메라 수학을 혼합하여 사용했습니다. 저자들은 3D 깊이를 본질적으로 이해하는 모델을 만드는 것이 현재로서는 너무 복잡하다고 보고 있습니다.
- "컨트롤" 체크: "제로 움직임"을 가정하는 Control 방식이 포함된 이유는 모두가 데이터를 올바르게 사용하고 있는지 확인하기 위함입니다. 만약 "아무것도 하지 않는" 팀보다 성적이 낮다면, 그것은 제대로 하고 있지 않은 것입니다.
요약
2025 STIR 챌린지는 우리가 조직을 추적하기 위한 매우 빠르고 정확한 도구들을 보유하고 있음에도 불구하고, "완벽한" 솔루션은 여전히 만들어지는 과정에 있음을 보여주었습니다. 최고의 결과는 구식의 신뢰성과 새로운 기술을 결합한 팀들로부터 나왔으며, 2D에서는 Team CCG DGIST가, 3D와 속도에서는 Team NCT TSO가 그 주인공이었습니다.
저자들은 다음 단계가 단순히 더 큰 모델을 만드는 것이 아니라, 제한된 데이터로부터 학습하고, "의사 라벨(pseudo-labels)"(AI가 자신의 예측으로 스스로를 가르치는 방식)을 활용하며, 실제 수술 중 발생하는 기이한 조명 변화나 조직의 꿈틀거림에도 당황하지 않는 더 똑똑한 모델을 구축하는 것이라고 제언합니다. 이는 진행 중인 작업이지만, "디지털 손가락"은 훨씬 더 안정적으로 변해가고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.