← 최신 논문
⚡ electrical engineering

An Open Multi-Center Whole-Body FDG PET/CT Foundation Model for Tumor Segmentation

본 논문은 임상 종양학에서 광범위한 수동 주석에 대한 의존성을 줄이기 위해 최소한의 레이블이 지정된 데이터로 높은 성능을 달성하기 위해 초기 교차 모드 융합과 전문화된 마스킹 자동 인코딩 목적 함수를 활용하는 전신 FDG PET/CT 종양 분할을 위한 오픈 소스 다중 센터 기반 모델을 소개합니다.

원저자: Xiaofeng Liu, Qianru Zhang, Thibault Marin, Menghua Xia, Chi Liu, Georges El Fakhri, Jinsong Ouyang

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaofeng Liu, Qianru Zhang, Thibault Marin, Menghua Xia, Chi Liu, Georges El Fakhri, Jinsong Ouyang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

환자의 신체에서 종양을 찾아내는 것을 의료 영상으로 컴퓨터에게 가르친다고 상상해 보세요. 의사는 보통 두 가지 유형의 영상을 함께 봅니다. 하나는 해부학적 구조를 보여주는 CT 스캔(뼈와 장기의 상세한 3D 지도와 같은) 이고, 다른 하나는 세포가 에너지를 소모하는 부위를 밝게 비추어 종양을 종종 나타내는 대사 활동을 보여주는 PET 스캔입니다.

오랫동안 컴퓨터는 이 두 가지 관점을 효과적으로 결합하는 데 서툴렀습니다. 대부분의 기존 AI 모델은 하나의 특정 시험만을 준비한 학생과 같았습니다. 이들은 한 병원의 소규모 환자 그룹으로만 훈련되었으며, CT 와 PET 스캔을 두 개의 별개 과목처럼 취급하여 '사고' 과정의 마지막 단계에서만 결합하려 했습니다. 이로 인해 모델은 취약해졌고, 컴퓨터가 다른 병원이나 다른 기계에서 촬영된 스캔을 보면 종종 혼란에 빠졌습니다.

이 논문은 PET/CT 스캔을 위한 새로운 해결책, 즉 **"기초 모델 (Foundation Model)"**을 소개합니다. 이를 하나의 시험을 준비하는 학생이 아니라, 실제 환자를 보기 전에 네 나라의 수천 권의 교과서를 읽은 의대생으로 생각하세요.

다음은 그들이 이를 어떻게 구축했고 왜 작동하는지를 간단히 설명한 것입니다:

1. 스캔의 "도서관"

한 곳의 작은 데이터셋을 사용하는 대신, 연구자들은 독일, 호주, 미국, 베트남의 네 가지 공개 데이터셋에서 4,997 개의 스캔을 수집했습니다.

  • 과제: 이러한 스캔들은 모두 크기가 다르고 다른 기계로 촬영되었습니다. 1000 조각 퍼즐의 조각과 500 조각 퍼즐의 조각이 섞여 있고 화질도 제각각인 퍼즐을 맞추려는 것과 같습니다.
  • 해결책: 그들은 "조화화 파이프라인 (harmonization pipeline)"을 만들었습니다. 모든 다른 퍼즐 조각을 가져와 가장자리를 다듬고 크기를 조정하여 모두 같은 물리적 격자 (조각당 2.0 x 2.0 x 3.0 mm) 에 맞도록 하는 마스터 편집자를 상상해 보세요. 중요하게도, 그들은 단순히 이미지를 똑같이 보이도록 늘린 것이 아니라, 컴퓨터가 사물의 실제 규모를 학습할 수 있도록 종양의 실제 물리적 크기를 보존했습니다.

2. CT 와 PET 의 "초기 결합"

대부분의 이전 AI 모델은 CT 와 PET 스캔을 테이블 양쪽 끝에 앉아 각자 보고서를 쓴 후에야 서로 대화하는 두 사람처럼 취급했습니다.

  • 새로운 접근법: 이 모델은 CT 와 PET 스캔이 처음부터 "손을 잡도록" 강요합니다. 컴퓨터가 분석을 시작하기 전에 채널 단위로 병렬로 연결 (side-by-side concatenation) 하여 함께 엮습니다.
  • 비유: 이는 강아지를 인식하도록 아이에게 강아지 그림을 보여주고 동시에 짖는 소리를 들려주는 것이지, 먼저 그림을 보여주고 "이게 뭐야?"라고 묻은 뒤, 소리를 들려주고 다시 "이게 뭐야?"라고 따로따로 묻는 것과 같습니다. 해부학적 정보 (CT) 와 대사 정보 (PET) 를 즉시 혼합함으로써 모델은 처음부터 신체의 구조와 에너지 사용이 어떻게 서로 관련되는지 학습합니다.

3. "안대" 게임 (마스크드 오토인코딩)

모든 종양에 인간이 윤곽을 그리는 것 (비싸고 느린 작업) 없이 이 모델을 가르치기 위해 **마스크드 오토인코딩 (Masked Autoencoding)**이라는 기법을 사용했습니다.

  • 게임: 컴퓨터에게 종양 사진을 보여주되, 안대로 50% 를 가립니다. 컴퓨터의 임무는 보이는 부분과 다른 스캔 유형 (예: CT 가 가려지면 PET 를 보고 모양을 추측) 을 기반으로 숨겨진 부분을 추측하는 것입니다.
  • 혁신: 일반적으로 컴퓨터가 이미지 일부를 가릴 때는 빈 공간을 일반적인 "플레이스홀더" 토큰 (회색 빈 사각형과 같은) 으로 채웁니다. 연구자들은 이것이 컴퓨터를 혼란스럽게 하는 "인공적인 가장자리"를 만든다는 것을 깨달았습니다. 대신, 그들은 Zero-Mean Imputation을 사용했습니다. 이미 데이터를 정규화 (평균이 0 이 되도록 밝기 조정) 했기 때문에, 숨겨진 부분을 단순히 0으로 채웠습니다.
  • 중요성: 이는 벽에 난 구멍을 회색 패치로 채우는 것이 아니라, 이미 그곳에 있던 정확한 색의 석고로 채우는 것과 같습니다. 이는 이미지의 "질감"을 매끄럽게 유지하여 컴퓨터가 가짜 경계에 방해받지 않고 더 잘 학습할 수 있게 합니다.

4. 결과: 더 적은 것으로 학습

연구자들은 이 새로운 모델을 "종양 분할 (tumor segmentation, 종양 주위에 선을 그리는 작업)"이라는 작업으로 테스트했습니다.

  • "Few-Shot"의 기적: 보통 AI 는 잘 학습하기 위해 수천 개의 레이블이 지정된 예시가 필요합니다. 그러나 이 모델은 먼저 4,997 개의 스캔으로 구성된 거대한 "도서관"으로 훈련되었습니다. 그들이 일반적인 레이블이 지정된 데이터의 10% (단 70 개의 스캔) 만으로 테스트했을 때, **100%**의 데이터로 훈련된 다른 모델들과 동일한 성능을 발휘했습니다.
  • "극한" 테스트: 그들은 심지어 컴퓨터가 레이블이 지정된 예시 5 개만 본다는 "5-shot" 테스트도 시도했습니다. 새로운 모델은 여전히 작동했지만, 이전 모델들은 완전히 실패했습니다.
  • 교훈: 이 모델은 크고 다양한 데이터셋에서 CT 와 PET 모두에서 종양이 어떻게 보이는지에 대한 일반적인 규칙을 학습했기 때문에, 모든 새로운 병원에 대해 처음부터 다시 가르칠 필요가 없었습니다.

요약

이 논문은 수천 개의 다양한 스캔을 읽은 의료 영상용 오픈 소스 "두뇌"를 제시합니다. CT 와 PET 스캔을 처음부터 함께 보도록 가르치고, 교묘한 "빈칸 채우기" 훈련 방법을 사용함으로써 다음과 같은 시스템을 만들었습니다:

  1. 더 똑똑함: 신체 구조와 대사 사이의 관계를 더 잘 이해합니다.
  2. 더 효율적: 매우 적은 레이블이 지정된 예시로 종양을 찾아내는 법을 학습하여 의사의 시간을 절약합니다.
  3. 더 견고함: 스캔이 다른 병원이나 기계에서 온 경우에도 잘 작동합니다.

저자들은 이것이 강력한 도구이지만, 현재는 CT 와 PET 스캔이 모두 존재해야만 작동하며 (결손 데이터를 처리할 수는 없음), 모델의 가장 큰 버전은 완벽하게 미세 조정하기 위해 테스트에 사용된 것보다 더 많은 레이블이 지정된 데이터를 필요로 할 수 있다고 지적합니다. 그러나 이는 향후 자동화된 암 영상 처리를 위한 강력하고 개방적인 기반을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →