기존의 AI 모델들은 주로 2D 사진 (예: 일반 X-ray) 을 보거나, 아주 작은 조각만 잘라내어 분석하는 데 익숙했습니다. 하지만 3D CT 는 다릅니다.
비유: 마치 거대한 3D 퍼즐을 한 번에 보려고 하는데, 기존 AI 는 그 퍼즐 조각을 하나씩 떼어내어 2D 평면으로만 보려 했거나, 퍼즐이 너무 커서 감당하지 못해 포기했던 것입니다.
난관: CT 스캔은 데이터 양이 너무 방대하고 (퍼즐 조각이 수백만 개), 모양이 일정하지 않으며 (비대칭), 의사의 설명서 (보고서) 와 연결하는 것도 어렵습니다.
2. SPECTRE 의 해결책: 두 단계로 배우는 '학습법'
SPECTRE 는 이 문제를 해결하기 위해 두 가지 단계로 나누어 학습합니다. 마치 의대생이 먼저 해부학을 익히고, 그다음 임상 실습을 하는 것과 같습니다.
1 단계: 눈썰미 기르기 (자기 지도 학습)
방법: 라벨 (정답) 이 없는 수많은 CT 스캔만 보고 학습합니다.
비유:눈을 감고 퍼즐을 만져보는 훈련입니다. AI 는 CT 스캔의 일부를 가리고 ("이게 뭐지?"), 나머지 부분으로 추론하게 합니다. 이를 통해 AI 는 폐가 어디에 있고, 간은 어떤 모양인지, 뼈와 근육의 경계는 어디인지 기하학적 구조와 공간감을 스스로 깨닫습니다.
효과: 이제 AI 는 CT 영상의 '형체'와 '구조'를 완벽하게 이해하게 됩니다.
2 단계: 언어와 연결하기 (크로스 모달 학습)
방법: 이제 CT 스캔과 그 스캔에 대한 **의사의 보고서 (텍스트)**를 짝지어 학습합니다.
비유:그림과 설명서를 연결하는 훈련입니다. "이런 모양의 덩어리 (CT) 는 '폐암'이라고 쓴다 (보고서)"는 식으로 연결합니다.
특이점: 기존 모델들은 이 연결이 약했는데, SPECTRE 는 의사가 쓴 복잡한 보고서까지 이해할 수 있도록 훈련되어, "이런 그림은 '염증'을 의미한다"는 식의 의미 있는 지식을 얻습니다.
3. SPECTRE 의 특별한 기술: '마이크로'와 '매크로'의 조화
SPECTRE 는 두 가지 눈 (Transformer) 을 동시에 사용합니다.
현미경 (Local Transformer): 아주 작은 부분 (세포나 작은 결절) 을 자세히 봅니다.
망원경 (Global Transformer): 전체 장기를 한눈에 봅니다.
비유:현미경으로 세포를 보면서도, 망원경으로 전체 도시의 지도를 동시에 보는 것과 같습니다. 이 두 눈을 연결하여, 작은 병변이 전체 건강에 어떤 영향을 미치는지 종합적으로 판단할 수 있게 됩니다.
4. 결과: 왜 SPECTRE 가 특별한가?
공개된 데이터로만 학습: 비공개 환자 데이터를 쓰지 않고, 누구나 볼 수 있는 공개 데이터로만 학습했습니다. 이는 투명하고 공정한 AI 를 만든다는 뜻입니다.
범용성: 암을 찾거나, 장기 분할 (그림 그리기), 의사의 보고서와 영상을 매칭하는 등 다양한 업무에서 기존 최고 모델들보다 더 좋은 성적을 냈습니다.
비유: **한 번 배운 지식을 다양한 상황에 적용할 수 있는 '만능 의사'**가 된 것입니다.
5. 요약: 이 연구가 가져오는 변화
SPECTRE 는 3D CT 영상의 거대한 퍼즐을 해결할 수 있는 첫 번째 '완전한' AI입니다.
기존: "이건 뭐야? (정답을 알려줘야 해)"
SPECTRE: "이건 모양이 A 라서 B 일 가능성이 높고, 보고서에 C 라고 적혀있으니 D 일 수도 있겠네." (스스로 추론하고 이해함)
이 모델은 앞으로 의료진이 더 정확한 진단을 내리고, 환자들에게 더 나은 치료를 제공하는 데 큰 도움을 줄 것으로 기대됩니다. 또한, 이 모델과 학습 코드를 모두 공개하여 전 세계 연구자들이 함께 발전시킬 수 있도록 했습니다.
한 줄 요약:
SPECTRE 는 거대한 3D CT 퍼즐을 스스로 조립하고, 의사의 설명서와 연결하여 '의미'를 이해하는 새로운 차원의 의료 AI 입니다.
1. 연구 배경 및 문제 정의 (Problem)
배경: 컴퓨터 비전 분야에서 자기지도 학습 (SSL) 과 비전 - 언어 정렬 (VLA) 은 강력한 시각 표현 학습을 가능하게 했습니다. 그러나 이러한 성공이 2D 의료 영상에서 3D 체적 CT(Computed Tomography) 영상으로 자연스럽게 확장되지 못했습니다.
주요 기술적 난제:
토큰 스케일링의 극대화: 3D 볼륨을 패치 (patch) 로 나누면 토큰 수가 해상도에 따라 세제곱으로 증가합니다. 트랜스포머의 자기 어텐션 (self-attention) 은 토큰 수에 따라 제곱으로 계산 비용이 증가하므로, 대규모 3D 데이터에 대한 전역 어텐션 계산이 비현실적입니다.
기하학적 이방성 (Anisotropy): CT 영상은 슬라이스 방향과 평면 방향의 보간 간격 (voxel spacing) 이 다르고, 스캐너별 전처리 (재구성 커널, 노이즈 제거 등) 가 상이합니다. 등방성 (isotropy) 을 가정하는 기존 위치 인코딩은 이러한 기하학적 차이를 제대로 반영하지 못합니다.
약하고 노이즈가 많은 임상 감독: 임상 데이터는 자유 텍스트 보고서, 희소 태그, 연구 수준 레이블 등 계층적이고 불완전한 형태로 존재합니다. 이는 공간적 정밀도를 요구하는 밀집 객관식 (dense objectives) 과 언어적 의미 정렬을 요구하는 전역 객관식 (global alignment) 간의 긴장을 유발합니다.
부정 예제 (Negative) 의 모호성: 의료 보고서에는 여러 공존 질환이 자주 언급되므로, 대비 학습 (contrastive learning) 에서 '부정 예제'가 양의 예제와 임상적 의미를 공유하여 학습 신호가 약화됩니다.
2. 제안된 방법론: SPECTRE (Methodology)
저자들은 SPECTRE(Self-Supervised & Cross-Modal Pretraining for CT Representation Extraction) 라는 3D CT 기반의 풀 트랜스포머 (fully transformer-based) 파운데이션 모델을 제안합니다.
A. 아키텍처 설계
이중 단계 트랜스포머 구조:
로컬 ViT (ViTℓ): 고해상도 3D 볼륨의 세부 특징을 추출하기 위해 국소 윈도우 (local window) 내에서의 어텐션만 수행합니다.
글로벌 ViT (ViTg): 로컬 윈도우에서 추출된 요약 토큰을 받아 전체 스캔의 맥락 (scan-level context) 을 모델링합니다.
효율성: 이 구조는 대규모 3D 어텐션 계산을 계산적으로 tractable 하게 만들면서도 전역 컨텍스트를 보존합니다.
3D 토크나이제이션 및 위치 인코딩:
CT 의 이방성을 고려하여 16×16×8 크기의 비등방성 3D 패치를 사용합니다.
3D Rotary Positional Embeddings (RoPE): 절대 위치가 아닌 상대적 위치 정보를 회전 행렬을 통해 주입하여, 다양한 해상도와 윈도우 크기에 강건하게 작동하도록 설계했습니다. DINOv3 스타일의 확률적 시프트 (stochastic shifts) 를 적용하여 보간 간격과 FOV 변화에 대한 강건성을 높였습니다.
B. 2 단계 프리트레이닝 파이프라인
1 단계: 자기지도 학습 (SSL) - DINOv3 기반
목표: 라벨 없이 CT 볼륨의 기하학적 구조와 국소적 특징을 학습.
방법: 학생 - 교사 (student-teacher) 아키텍처를 사용. 마스킹된 패치 예측 (iBOT), 글로벌 일관성 (DINO), 그리고 임베딩 공간의 균일 분포 (KoLeo) 를 결합한 손실 함수를 최적화합니다.
데이터 증강: 다중 크롭 (multi-crop), 랜덤 플립, 가우시안 블러/샤프닝, 강도 변환 등을 적용하여 기하학적 불변성을 학습시킵니다.
2 단계: 비전 - 언어 정렬 (VLA) - SigLIP 기반
목표: CT 영상과 방사선 보고서 (텍스트) 간의 의미론적 정렬.
방법:SigLIP (Sigmoid Loss for Language Image Pretraining) 를 사용합니다. 기존 CLIP 의 소프트맥스 기반 InfoNCE 손실 대신 시그모이드 기반 이진 교차 엔트로피를 사용하여, 하나의 스캔이 여러 텍스트 설명과 매칭될 수 있는 의료 데이터의 '다대다 (many-to-many)' 특성과 노이즈를 더 잘 처리합니다.
텍스트 처리: Qwen3-0.6B 임베딩 모델에 LoRA 를 적용하여 보고서를 인코딩하며, 보고서의 'Findings'와 'Impressions' 섹션을 재작성 (paraphrasing) 하여 언어적 변이성을 학습시킵니다.
3. 주요 기여 (Key Contributions)
SPECTRE 모델 공개: 3D CT 영상과 방사선 보고서를 동시에 학습하는 최초의 풀 트랜스포머 기반 파운데이션 모델 중 하나로, 오픈 소스로 공개되었습니다.
확장 가능한 3D 아키텍처: 3D 볼륨 데이터의 계산적 한계를 극복하기 위한 로컬/글로벌 어텐션 분해 및 3D RoPE 기반의 기하학적 인코딩을 제안했습니다.
비공개 데이터 불필요: 독점 데이터 없이 공개된 CT 데이터셋 (NLST, CT-RATE, Merlin 등 총 22 만 개 이상의 스캔) 만으로 훈련되어, 높은 성능과 일반화 능력을 입증했습니다.
두 가지 학습 전략의 통합: SSL 을 통한 기하학적 특징 학습과 VLA 를 통한 임상적 의미 부여를 결합하여, 공간적 정밀도와 임상적 유용성을 모두 갖춘 표현을 학습했습니다.
4. 실험 결과 (Results)
SPECTRE 는 6 개의 다양한 CT 벤치마크 (암 바이오마커 예측, 분할, 텍스트 - 이미지 검색) 에서 기존 모델들을 능가했습니다.
바이오마커 예측 (Zero-shot & Fine-tuned):
6 개 벤치마크 (LUNA16, DLCS, NSCLC 등) 중 4 개에서 가장 높은 AUC 를 기록했습니다.
고정된 임베딩 (frozen embedding) 에 kNN 분류기를 사용하여 평가했을 때, CT-FM, Merlin, CT-CLIP 등 기존 모델보다 일관되게 우수한 성능을 보였습니다.
의미론적 분할 (Semantic Segmentation):
디코더 없이 인코더만 사용하는 SEoMT (Semantic Encoder only Masked Transformer) 방식을 nnU-Net 에 적용했습니다.
KiTS23, LiTS, WORD 데이터셋에서 기존 트랜스포머 기반 모델 (SwinUNETRv2, nnFormer 등) 을 능가하며, nnU-Net (Convolution 기반) 과 경쟁하는 수준의 Dice 점수를 달성했습니다.
Zero-shot 텍스트 - 이미지 검색:
CT-RATE: Findings 및 Impressions 섹션 전체를 포함한 보고서 기반 검색에서 CT-CLIP 대비 Recall@100 에서 59.9% (CT-CLIP: 28.8%) 로 압도적인 성능 향상을 보였습니다.
Merlin: 'Impressions' (의사의 소견) 섹션 기반 검색에서 기존 Merlin 모델보다 더 나은 성능을 보이며, 보고서 구조에 덜 민감하고 임상적 의미 통합이 뛰어나다는 것을 입증했습니다.
5. 의의 및 결론 (Significance)
확장 가능한 3D 의료 AI: 3D CT 데이터의 고유한 도전 과제 (계산 비용, 기하학적 이방성, 약한 감독) 를 해결하는 확장 가능한 프레임워크를 제시했습니다.
오픈 소스 생태계 조성: 전 세계 연구 기관이 독점 데이터 없이도 고품질 3D 의료 표현을 학습하고 활용할 수 있도록 SPECTRE 와 관련 코드를 공개하여 의료 AI 의 민주화와 형평성을 증진합니다.
임상적 유용성: 단순한 이미지 분류를 넘어, 자유 텍스트 보고서와 정렬된 표현을 학습함으로써 복잡한 임상적 추론과 검색 태스크에 직접적으로 적용 가능한 모델을 구축했습니다.
이 연구는 3D 의료 영상 처리를 위한 새로운 표준을 제시하며, 자기지도 학습과 비전 - 언어 모델링의 결합이 어떻게 일반 목적의 3D 파운데이션 모델을 가능하게 하는지를 보여줍니다.