SurgMotion: A Video-Native Foundation Model for Universal Understanding of Surgical Videos
SurgMotion 은 저수준 픽셀 재구성의 한계를 극복하고 잠재 운동 예측을 기반으로 한 새로운 비디오 네이티브 기초 모델로, 대규모 수술 데이터셋을 활용해 다양한 수술 비디오 이해 태스크에서 기존 최첨단 기법들을 압도하는 성능을 입증했습니다.
원저자:Jinlin Wu, Felix Holm, Chuxi Chen, An Wang, Yaxin Hu, Xiaofan Ye, Zelin Zang, Miao Xu, Lihua Zhou, Huai Liao, Danny T. M. Chan, Ming Feng, Wai S. Poon, Hongliang Ren, Dong Yi, Nassir Navab, Gaofeng MeJinlin Wu, Felix Holm, Chuxi Chen, An Wang, Yaxin Hu, Xiaofan Ye, Zelin Zang, Miao Xu, Lihua Zhou, Huai Liao, Danny T. M. Chan, Ming Feng, Wai S. Poon, Hongliang Ren, Dong Yi, Nassir Navab, Gaofeng Meng, Jiebo Luo, Hongbin Liu, Zhen Lei
원저자: Jinlin Wu, Felix Holm, Chuxi Chen, An Wang, Yaxin Hu, Xiaofan Ye, Zelin Zang, Miao Xu, Lihua Zhou, Huai Liao, Danny T. M. Chan, Ming Feng, Wai S. Poon, Hongliang Ren, Dong Yi, Nassir Navab, Gaofeng Meng, Jiebo Luo, Hongbin Liu, Zhen Lei
이 논문은 수술실의 비디오를 보고 상황을 완벽하게 이해하는 새로운 인공지능, SurgMotion을 소개합니다. 기존 AI 들이 가진 한계를 극복하고, 마치 숙련된 외과 의사처럼 수술 과정을 파악하는 혁신적인 모델입니다.
이 복잡한 기술을 일상적인 비유로 쉽게 설명해 드릴게요.
1. 기존 AI 의 문제: "연기가 자욱한 방에서 벽지 무늬를 외우는 학생"
기존의 수술용 AI 모델들은 비디오를 볼 때 화면의 픽셀 (화소) 하나하나를 재구성하는 방식으로 학습했습니다.
비유: 마치 연기, 반사광, 물방울이 날아다니는 연기가 자욱한 수술실에서, 학생이 "벽지의 무늬"나 "연기의 모양"을 완벽하게 외우려고 애쓰는 것과 같습니다.
문제점: 수술에서 진짜 중요한 것은 "어떤 기구가 어떤 조직을 어떻게 움직였는지"라는 의미 있는 행동입니다. 하지만 기존 모델들은 연기나 반사광 같은 사소한 디테일에 에너지를 다 써서, 정작 중요한 수술 동작을 놓치고 맙니다.
2. SurgMotion 의 해결책: "무용의 흐름을 읽는 안무가"
SurgMotion 은 이 문제를 완전히 뒤집었습니다. 화면의 픽셀을 복원하는 대신, **움직임의 흐름 (잠재적 운동)**을 예측하는 방식으로 학습합니다.
비유: 이제 학생은 벽지 무늬를 외우는 대신, 무용수들의 움직임과 상호작용에 집중합니다. "칼이 어떻게 움직이고, 조직이 어떻게 반응하는가?"라는 핵심 스토리를 파악하는 것입니다.
핵심 기술 3 가지:
움직임에 집중하기 (Motion-Guided): 연기나 반사광은 무시하고, 칼과 조직이 만나는 가장 활발하게 움직이는 부분에 집중합니다.
시간의 흐름을 기억하기 (Self-Distillation): 수술은 끊어지지 않는 연속적인 흐름입니다. SurgMotion 은 과거의 장면과 미래의 장면이 자연스럽게 이어지도록 시간적 일관성을 유지하며 학습합니다.
단조로움에서 지루해하지 않기 (Diversity Regularization): 수술 중에는 조직이 똑같이 보일 때도 많습니다. 이때 AI 가 "아, 똑같네" 하고 지루해하며 기능을 멈추지 않도록, 다양한 특징을 찾아내도록 훈련시킵니다.
3. 거대한 학습 자료: "전 세계 수술실의 모든 기록"
이 AI 를 가르치기 위해 연구진은 SurgMotion-15M이라는 거대한 데이터셋을 만들었습니다.
규모: 3,658 시간 분량의 비디오.
범위: 뇌, 심장, 위장, 안구 등 13 가지 장기와 50 개 이상의 병원에서 촬영된 다양한 수술 장면.
의미: 마치 한 명의 의사가 전 세계 모든 수술실을 돌며 100 가지 이상의 수술을 수천 시간 동안 지켜본 것과 같은 경험을 AI 에게 심어준 것입니다. 덕분에 AI 는 특정 수술에만 능통한 '전문가'가 아니라, 어떤 수술 상황에서도 적응할 수 있는 '유니버설 전문가'가 되었습니다.
4. 놀라운 성과: "실제 수술실에서 증명된 실력"
이 모델은 17 가지 다른 테스트에서 기존 최고의 모델들을 압도했습니다.
수술 단계 인식: "지금은 절개 단계인가, 봉합 단계인가?"를 정확히 구분합니다. (기존 모델보다 정확도가 10~14% 나 향상됨)
세밀한 행동 분석: "어떤 기구가 무엇을 어떻게 조작했는지" (예: '집게로' '동맥을' '잡았다') 를 정확히 파악합니다.
수술 실력 평가: 의사의 수술 솜씨가 얼마나 뛰어난지, 실수가 없는지 객관적으로 평가할 수 있습니다.
3D 깊이 감지: 카메라 화면만 보고도 장기의 깊이와 형태를 3 차원으로 파악하여, 조직을 더 안전하게 다룰 수 있게 돕습니다.
5. 결론: 수술실의 새로운 동반자
SurgMotion 은 단순히 비디오를 보는 것을 넘어, 수술의 '의미'와 '흐름'을 이해하는 새로운 기준을 세웠습니다.
미래의 비전: 이 기술은 수술 중 의사에게 실시간으로 "다음 단계는 무엇인가?"를 알려주는 지능형 조수가 되거나, 의사의 수술 실력을 객관적으로 평가하여 교육 도구로 쓰일 수 있습니다.
요약하자면, SurgMotion 은 **"연기 자욱한 수술실에서도 핵심 동작을 놓치지 않고, 전 세계 모든 수술을 경험한 최고의 조교"**라고 할 수 있습니다. 이는 수술용 AI 의 역사를 바꾸는 중요한 한 걸음입니다.
1. 문제 정의 (Problem)
기존의 수술 영상 분석을 위한 파운데이션 모델들은 다음과 같은 근본적인 한계를 가지고 있습니다.
픽셀 수준 재구성의 비효율성: 대부분의 기존 모델 (MAE, VideoMAE 등) 은 픽셀 수준의 재구성을 학습 목표로 사용합니다. 그러나 수술 영상에는 연기, 반사광, 체액 이동 등 의미 없는 고주파수 시각적 노이즈가 많습니다. 모델이 이러한 저수준 (low-level) 디테일을 재구성하는 데 자원을 낭비하여, 수술 이해에 필수적인 도구 - 조직 상호작용의 운동 (motion) 과 같은 의미 있는 구조를 학습하지 못합니다.
시공간적 관계의 불안정성: 수술 영상은 시간적 연속성과 해부학적 구조 간의 관계가 중요합니다. 그러나 많은 사전 학습 파이프라인은 시간적 관계의 안정성을 명시적으로 제약하지 않아, 시점 변화나 큰 운동이 발생하면 특징이 불안정해지거나 (feature drift) 무너지는 문제가 발생합니다.
텍스트가 희소한 장면에서의 표현 붕괴: 노출된 지방 조직이나 매끄러운 장기 표면처럼 질감이 희박하고 시각적으로 균일한 영역에서는 특징 채널의 중복성이 증가하고 표현이 붕괴 (representation collapse) 될 위험이 큽니다.
데이터의 파편화: 기존 데이터셋은 특정 수술 (예: 담낭 절제술) 만을 대상으로 하여 범용적인 표현을 학습하기 어렵습니다. 다양한 해부학적 부위와 수술 기법을 아우르는 대규모 데이터가 부족했습니다.
2. 방법론 (Methodology)
저자들은 SurgMotion이라는 비디오 네이티브 (video-native) 파운데이션 모델을 제안했습니다. 이는 픽셀 재구성이 아닌 잠재 공간 운동 예측 (Latent Motion Prediction) 패러다임 (V-JEPA 아키텍처 기반) 으로 전환한 것이 핵심입니다.
주요 기술적 혁신
운동 유도 잠재 마스킹 예측 (Motion-Guided Latent Masked Prediction):
픽셀 공간이 아닌 잠재 공간 (Latent Space) 에서 마스킹된 영역을 예측합니다.
시공간 기울기 (spatiotemporal gradients) 를 기반으로 한 '운동 중요도 신호'를 도입하여, 도구와 조직의 상호작용이 활발한 영역의 예측 손실 가중치를 높입니다. 이를 통해 시각적 노이즈에 덜 민감하고 의미 있는 운동 정보를 학습합니다.
시공간 친화성 자기 증류 (Spatiotemporal Affinity Self-Distillation):
모든 잠재 토큰 간의 쌍별 관계를 모델링하는 '글로벌 토큰 친화성 행렬 (Global Token Affinity Matrix)'을 도입합니다.
모멘텀 업데이트된 교사 (Teacher) 네트워크와 학생 (Student) 네트워크 간의 친화성 구조를 정렬하여, 데이터 증강이나 시점 변화에 강인한 시공간적 일관성을 강제합니다.
시공간 특징 다양성 정규화 (Spatiotemporal Feature Diversity Regularization, SFDR):
질감이 희박한 장면에서의 표현 붕괴를 방지하기 위해 고안되었습니다.
(i) 예측된 잠재 특징의 분산을 정규화하여 다양성을 유지하고, (ii) 채널 간 공분산을 최소화하여 중복성을 줄입니다. 이를 통해 단조로운 수술 환경에서도 풍부하고 보완적인 특징 채널을 학습하게 합니다.
데이터셋: SurgMotion-15M
규모: 50 개 출처, 13 개 해부학적 영역, 100 개 이상의 수술 절차에 걸친 3,658 시간의 비디오 (약 45,757 개 영상) 를 포함하는 현재까지 최대 규모의 수술 영상 데이터셋입니다.
구성: 신경외과, 일반 외과, 안과, 위장관 수술, 산부인과, 비뇨기과 등 12 개 이상의 전문 분야를 포괄합니다.
3. 주요 기여 (Key Contributions)
새로운 학습 패러다임: 수술 영상 분석에 픽셀 재구성이 아닌, V-JEPA 기반의 잠재 운동 예측 패러다임을 성공적으로 적용했습니다.
수술 특화 아키텍처: 수술 영상의 고유한 문제 (노이즈, 질감 부족, 시공간 일관성 필요) 를 해결하기 위한 3 가지 핵심 기술 (운동 유도 마스킹, 친화성 증류, SFDR) 을 제안했습니다.
대규모 데이터셋 구축: 범용적인 수술 이해를 가능하게 하는 SurgMotion-15M 데이터셋을 공개 및 구축했습니다.
범용성 입증: 단일 수술이 아닌 다양한 수술 유형, 기관, 장비에서 우수한 성능을 보이는 범용 (Universal) 모델임을 입증했습니다.
4. 실험 결과 (Results)
17 개의 벤치마크에서 기존 최첨단 (SOTA) 모델 (EndoViT, EndoFM, GSViT, DINOv3 등) 과 비교하여 압도적인 성능 향상을 보였습니다.
수술 워크플로우 인식 (Workflow Recognition):
EgoSurgery: F1 점수에서 기존 최강 모델 대비 +14.6% 향상.
PitVis (비강 내 뇌하수체 수술): F1 점수에서 +10.3% 향상.
Cholec80 (담낭 절제술): Jaccard 지수에서 77.95% 달성 (기존 모델 대비 8.35% 향상).
세밀한 행동 인식 (Fine-Grained Action Understanding):
행동 트립플 인식 (CholecT50): 도구, 동사, 대상의 조합을 인식하는 mAP-IVT 에서 **39.54%**로 SOTA 기록.
기술 평가 (Skill Assessment, JIGSAWS): MAE 2.649, 스피어만 상관관계 0.770 로 기존 모델 대비 예측 오차 26% 감소 및 순위 상관관계 27%p 향상.
밀집 예측 (Dense Prediction):
폴립 분할 (Polyp Segmentation): 도메인 이동 (OOD) 환경에서도 가장 낮은 MAE 와 높은 Dice 계수를 기록하여 강력한 일반화 능력을 입증.
깊이 추정 (Depth Estimation, C3VD): 명시적인 기하학적 학습 없이도 RMSE 1.88 로 모든 베이스라인을 상회하는 3D 구조 이해 능력을 보임.
5. 의의 및 결론 (Significance)
수술 AI 의 새로운 표준: SurgMotion 은 픽셀 수준의 노이즈에 휘둘리지 않고 수술의 본질적인 '운동 (Motion)'과 '상호작용'을 이해하는 새로운 기준을 제시합니다.
범용성 (Universality): 단일 수술에 국한되지 않고 다양한 해부학적 부위와 수술 기법, 기관 간에 잘 일반화되는 모델을 실현했습니다.
임상 적용 가능성: 실시간 수술 의사결정 지원, 자동화된 수술 기록 생성, 객관적인 수술 기술 평가 등 다양한 임상 응용 분야에 기여할 수 있는 강력한 기반 기술입니다.
데이터의 중요성: 대규모이고 다양한 데이터 (SurgMotion-15M) 가 범용 수술 AI 개발에 필수적임을 강조하며, 향후 다기관 데이터 구축의 중요성을 시사합니다.
결론적으로, SurgMotion 은 수술 영상 분석 분야에서 픽셀 기반 접근법의 한계를 극복하고, 운동 중심의 의미 있는 표현 학습을 통해 범용적인 수술 이해를 실현한 획기적인 연구입니다.