← 최신 논문
🤖 machine learning

S3-Tracker: Self-Supervised Surgical Tissue Tracking With Contrastive Random Walks

이 논문은 컴퓨터 보조 중재를 위한 대규모 주석 데이터셋 확보의 어려움을 극복하기 위해, 레이블이 없는 내시경 비디오에서 대조적 랜덤 워크(contrastive random walks)를 활용하여 준지도 학습 방식에 필적하는 견고한 수술 조직 추적을 달성하는 자기지도 학습 방법인 S3-Tracker을 소개한다.

원저자: Jiaming Zhang, Zijian Wu, Mehran Armand, Septimiu Salcudean

게시일 2026-09-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiaming Zhang, Zijian Wu, Mehran Armand, Septimiu Salcudean

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인체 내부에서 수술용 카메라가 보는 풍경은 도구의 압력에 따라 늘어나고, 접히고, 미끄러지는 부드럽고 젖은 조직이 끊임없이 변화하는 지형과 같습니다. 외과의사와 이를 보조하는 로봇들에게 모든 조직 조각이 어디에 위치해 있는지에 대한 안정적인 정신적 지도를 유지하는 것은 지속적인 도전 과제입니다. 만약 외과의사가 화면에서 보고 있는 것과 CT 또는 MRI 같은 수술 전 스캔 영상을 일치시켜야 한다면, 조직이 실시간으로 변형될 때 그 작업은 거의 불가능에 가까워집니다. 이를 해결하기 위해 컴퓨터는 한 비디오 프레임에서 다음 프레임으로 넘어갈 때 특정 지점들을 추적하여, 라이브 영상과 환자의 내부 해부학적 구조 사이의 연속적인 연결을 유지해야 합니다. 현대의 인공지능은 일반적인 영상 속 객체를 추적하는 데 매우 능숙해졌지만, 혈액, 연기, 그리고 빛 반사가 심한 표면으로 가득한 수술실의 무질서한 현실은 방대한 양의 인간 라벨링 데이터 없이 컴퓨터가 이를 신뢰성 있게 수행하도록 가르치는 것을 어렵게 만들었습니다.

연구진은 어려운 라벨링 작업 없이도 컴퓨터가 수술용 조직을 추적하도록 가르치는 새로운 방법을 개발했습니다. 컴퓨터에게 인간이 공들여 점과 선을 그려 움직임을 보여주는 수천 개의 영상을 보여주는 대신, 이 새로운 방식인 S3-Tracker는 비디오 자체를 관찰하고 스스로의 작업을 검증하며 학습합니다. 이 시스템은 비디오를 연결된 순간들의 연속으로 취급하며 다음과 같은 간단한 질문을 던집니다. "만약 내가 한 프레임의 A 지점에서 다음 프레임의 B 지점으로 이동했다가, 다시 B에서 A로 돌아가려고 시도한다면, 정확히 시작했던 곳으로 돌아올 수 있는가?" 컴퓨터가 이 질문에 반복적으로 올르게 답하도록 강제함으로써, 시스템은 픽셀이 어떻게 움직이고 변형되는지 이해하게 되며, 이는 다음 순간에 조직의 모습이 매우 달라지더라도 마찬가지입니다. 이러한 접근 방식은 시스템이 인간 전문가가 모든 프레임을 주석 처리할 필요 없이 방대한 양의 라벨링되지 않은 수술 영상으로부터 학습할 수 있게 해줍니다.

연구진은 두 개의 비디오 프레임을 보고 한 프레임의 픽셀이 다음 프레임의 픽셀과 어떻게 연관되는지 파악하도록 시스템을 구축했습니다. 그들은 이 지점들 사이의 연결 지도를 만드는 과정을 사용하는데, 이는 본질적으로 컴퓨터에게 조직의 한 조각이 거친 가장 가능성 높은 경로를 추측하도록 요청하는 것입니다. 컴퓨터가 단순히 무작위로 추측하는 것이 아님을 보장하기 위해, 시스템은 움직임을 앞으로 진행시킨 다음 다시 뒤로 돌려보며 자신의 논리를 확인합니다. 만약 순방향 경로와 역방향 경로가 같은 지점에서 만나지 않는다면, 시스템은 실수를 했다는 것을 인지하고 이해도를 조정합니다. 저자들이 '대조적 랜덤 워크(contrastive random walk)'라고 부르는 이 자기 검증 메커니즘을 통해, 모델은 인간이 제공한 단 하나의 정답 없이도 조직이 늘어나고 굽어지는 복잡한 방식을 학습할 수 있습니다. 또한 이 시스템에는 어떤 지점이 더 이상 보이지 않을 때(예를 들어 혈액이나 기구에 의해 가려진 경우) 이를 결정하고, 다시 나타날 때까지 추적을 중단하여 컴퓨터가 혼란을 겪거나 경로를 벗어나는 것을 방지하는 기능이 포함되어 있습니다.

실제 수술 영상 데이터셋을 통해 테스트했을 때, 이 새로운 방식은 부분적인 인간 라벨링에 의존하는 기존 시스템들과 강력하게 경쟁하는 모습을 보였습니다. 연구진은 이 자기 지도 학습 방식이 일부 인간의 가이드가 포함된 방식과 견줄 만한 정확도로 지점을 추적할 수 있는 동시에, 실시간 실행 속도는 훨씬 더 빠르다는 것을 발견했습니다. 예측된 지점들이 실제 정답(ground truth)으로부터 얼마나 벗어났는지를 측정하는 테스트에서, 이 시스템은 다양한 오차 임계값에 걸쳐 평균 0-708의 정확도 점수를 달eric하며 임상 사용이 가능한 수준의 성능을 입증했습니다. 완전한 인간 라벨을 사용하는 완전 지도 학습 모델은 때때로 순수 오차 거리 측면에서 약간 더 정밀할 수 있지만, 실시간 수술 중에 프레임 단위로 작동하기에는 너무 느린 경우가 많습니다. 반면, 이 새로운 방식은 초당 3회의 프레임을 처리할 만큼 효율적으로 작동합니다. 이러한 속도는 수술실의 시각적 혼란을 처리하는 능력과 결인이 되어, 자기 지도 추적이 로봇 수술을 안내하고 외과의사가 인체의 복잡하고 움직이는 지형을 항해하는 데 도움을 주는 실용적인 도구가 될 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →