Mammo-FM: Breast-specific foundational model for Integrated Mammographic Diagnosis, Prognosis, and Reporting
이 논문은 14 만 명 이상의 환자에 대한 82 만 장 이상의 유방촬영술 데이터를 기반으로 학습된 최초의 유방 전용 기초 모델인 'Mammo-FM'을 소개하며, 진단, 예후, 보고서 생성 등 다양한 임상 작업을 단일 프레임워크로 통합하고 기존 일반적 기초 모델보다 뛰어난 성능과 효율성을 입증했습니다.
원저자:Shantanu Ghosh, Vedant Parthesh Joshi, Rayan Syed, Param Budhraja, Aya Kassem, Katelyn C. Morrison, Alex Tang, Ho Cheung Aiden Wong, Abhishek Varshney, Payel Basak, Weicheng Dai, Judy Wawira GichoyaShantanu Ghosh, Vedant Parthesh Joshi, Rayan Syed, Param Budhraja, Aya Kassem, Katelyn C. Morrison, Alex Tang, Ho Cheung Aiden Wong, Abhishek Varshney, Payel Basak, Weicheng Dai, Judy Wawira Gichoya, Hari M. Trivedi, Imon Banerjee, Shyam Visweswaran, Clare B. Poynton, Kayhan Batmanghelich
지금까지의 의료 AI 는 **'만능 열쇠'**처럼 만들어졌습니다. 폐, 심장, 뼈 등 모든 장기를 다룰 수 있도록 훈련시켰죠. 하지만 유방 촬영 (마모그램) 은 아주 미세한 석회화나 작은 덩어리를 찾아야 하는 초정밀 작업입니다.
비유: 마치 고해상도 보석 세공을 하려고 하는데, 일반적인 건설용 망치로 작업하는 것과 같습니다. 망치 (일반 AI) 는 큰 구조물을 다룰 수는 있지만, 보석 (미세한 유방암 징후) 을 정교하게 다듬거나 발견하는 데는 한계가 있습니다. 게다가 일반 AI 는 고해상도 이미지를 제대로 보지 못해 중요한 디테일을 놓치기 일쑤였습니다.
2. Mammo-FM 이란 무엇인가요? (해결책)
연구팀은 **"유방암 진단만을 위해 태어난 AI"**를 만들었습니다. 이것이 바로 Mammo-FM입니다.
엄청난 학습 데이터: 이 AI 는 미국 4 개 병원 (Mayo Clinic, UPMC 등) 에서 수집한 14 만 명 이상의 환자, 82 만 장 이상의 유방 촬영 이미지와 의사들이 쓴 수백만 건의 진단 보고서를 함께 학습했습니다.
비유: 다른 AI 가 "의사 학교"를 졸업한 일반 의대생이라면, Mammo-FM 은 유방암 진단만 10 년간 해온 최고의 전문의와 같습니다. 오직 유방 촬영 이미지와 그에 대한 의사의 설명 (텍스트) 만을 보며 훈련했기 때문에, 미세한 변화도 놓치지 않습니다.
3. 이 AI 의 놀라운 능력 3 가지
이 AI 는 단순히 "암이 있다/없다"고 말하는 것을 넘어, 세 가지 핵심 역할을 수행합니다.
① 눈과 귀를 동시에 쓰는 '이중 감각' (이미지 + 텍스트)
기존 AI 는 이미지만 보고 판단했지만, Mammo-FM 은 이미지와 의사의 설명을 동시에 학습합니다.
비유: 의사가 "왼쪽 유방에 작은 덩어리가 보인다"고 말하면서 손가락으로 가리키는 장면을 상상해 보세요. Mammo-FM 은 **이미지 (손가락이 가리키는 곳)**와 **말 (텍스트)**을 연결하여 학습합니다. 덕분에 AI 가 "왜" 그런 판단을 내렸는지, 어떤 문장이 그 근거인지 설명할 수 있게 됩니다. (이걸 해석 가능성이라고 합니다.)
② 초고해상도 눈 (High-Resolution Vision)
이 AI 는 원본 이미지 (1520x912 픽셀) 를 그대로 봅니다. 다른 AI 들은 이미지를 작게 줄여서 (448x448 픽셀) 보다가 중요한 미세한 석회화를 놓쳤지만, Mammo-FM 은 보석 세공용 돋보기처럼 아주 작은 부분까지 선명하게 봅니다.
③ 자동 보고서 작성 (Mammo-GRG)
단순히 진단만 하는 게 아니라, 의사가 쓰는 것처럼 자연스러운 진단 보고서를 자동으로 작성합니다.
비유: 환자가 병원에 오면, AI 가 먼저 초안을 쓰고, 그 내용을 바탕으로 **실제 유방 촬영 이미지에서 발견된 사실 (덩어리, 석회화 등) 을 다시 한번 확인 (Grounding)**하여 오류를 수정한 후 최종 보고서를 냅니다. 마치 수석 비서가 초안을 쓰고, 전문의가 사실 관계를 확인하여 최종 보고서를 제출하는 과정과 같습니다.
4. 실제 성과는 어떨까요?
더 적은 데이터로 더 잘함: 다른 AI 들은 많은 데이터를 필요로 하지만, Mammo-FM 은 데이터의 3 분의 1 만으로도 훨씬 더 좋은 결과를 냅니다.
어떤 병원에서도 잘 작동: 미국 내 다양한 병원 데이터로 훈련했기 때문에, 훈련하지 않은 새로운 병원 (다른 인종, 다른 장비) 에 가서도 유방암을 찾아내는 능력이 뛰어나게 유지됩니다.
예측과 설명: 암이 있을 확률을 예측할 때, 단순히 "위험합니다"라고만 하는 게 아니라, **"왼쪽 유방의 특정 부분에 덩어리가 보이기 때문에 위험합니다"**라고 이미지와 텍스트로 구체적으로 설명해 줍니다.
5. 결론: 왜 이것이 중요한가요?
이 연구는 **"유방암 진단을 위해 특화된 AI"**가 일반적인 AI 보다 훨씬 안전하고 신뢰할 수 있음을 증명했습니다.
의사들의 부담 감소: AI 가 초안 보고서를 작성하고 위험도를 예측해 주면, 의사는 그 내용을 검토하고 환자에게 설명하는 데 집중할 수 있습니다.
환자의 안전: 미세한 암도 놓치지 않고, AI 가 왜 그런 판단을 내렸는지 설명해 주기 때문에 환자와 의사 모두 AI 를 더 신뢰할 수 있습니다.
한 줄 요약:
"유방암 진단만을 위해 태어난, 고해상도 눈과 의사 같은 설명 능력을 가진 AI 마스터 키가 등장하여, 더 정확하고 신뢰할 수 있는 유방암 검진을 가능하게 했습니다."
1. 문제 정의 (Problem)
유방암은 전 세계 여성 사망의 주요 원인 중 하나이며, 조기 발견을 위한 대규모 선별 검사가 필수적입니다. 그러나 기존 AI 시스템은 다음과 같은 한계를 가지고 있습니다:
작업 분리 및 비효율성: 진단, 예후, 보고 생성 등 각 임상 작업을 위해 별도의 모델을 개발해야 하여 데이터 효율성이 낮고 일반화 능력이 떨어집니다.
일반적 기초 모델 (Generalist FMs) 의 부적합성: 기존 의료용 기초 모델 (예: MedGemma) 은 유방촬영술 (Mammography) 에 특화되지 않았습니다. 이들은 저해상도 (예: 448x448) 로 이미지를 처리하여 미세석회화 (microcalcifications) 와 같은 미세하지만 임상적으로 중요한 소견을 놓치는 경우가 많습니다.
해석 가능성 부족: 많은 AI 모델이 '블랙박스'로 작동하여, 왜 특정 위험 점수를 산출했는지나 어떤 시각적 증거에 기반했는지에 대한 임상적 설명 (Interpretability) 을 제공하지 못합니다.
데이터 부족: 고품질의 전문 라벨링 데이터는 획득 비용이 매우 비싸며, 특히 유방촬영술 분야에서는 부족합니다.
2. 방법론 (Methodology)
저자들은 Mammo-FM이라는 유방촬영술 전용 기초 모델 (Foundation Model) 을 제안하며, 이를 기반으로 진단, 예후, 보고 생성을 통합한 프레임워크를 구축했습니다.
A. Mammo-FM (기초 모델)
데이터: 미국 4 개 기관 (Mayo Clinic, UPMC, Boston University, EMBED) 의 **140,677 명 환자 (821,326 장의 유방촬영 이미지)**로 구성된 대규모 다기관 데이터셋을 사용하여 사전 학습 (Pretraining) 했습니다. 이는 현재까지 가장 크고 다양한 유방촬영 데이터셋입니다.
아키텍처:
이미지 인코더: 고해상도 (1520x912 픽셀) 원본 이미지를 처리할 수 있도록 EfficientNet-B5를 사용합니다. (기존 모델들의 저해상도 처리 문제 해결)
텍스트 인코더:ModernBERT를 사용하며, 약 20 만 건의 흉부 CT 보고서를 추가로 파인튜닝하여 의학 용어 이해도를 높였습니다.
학습 전략: 이미지와 텍스트 (방사선 보고서) 를 공유 임베딩 공간에 정렬시키는 **다중 뷰 대비 학습 (Multi-view Contrastive Learning)**을 수행합니다. 원본 및 증강된 이미지/텍스트 쌍을 사용하여 로버스트한 표현을 학습합니다.
특징: 일반적 기초 모델의 3 분의 1 수준인 3 천만 파라미터 (Vision Encoder 기준) 만으로도 뛰어난 성능을 발휘하도록 설계되었습니다.
B. Mammo-GRG (보고 생성기)
목적: 고해상도 4 뷰 (LCC, MLO, 양측) 유방촬영 이미지를 입력받아 임상적으로 정확한 보고서를 생성합니다.
아키텍처: Mammo-FM 의 고정된 비전 인코더 + 멀티모달 프로젝터 + Llama-3.1-8B LLM.
학습 프로세스:
정렬 단계 (Alignment): 이미지 특징과 LLM 을 정렬합니다.
지시 튜닝 (Instruction Tuning): 35 만 개 이상의 질문 - 답변 (QA) 쌍으로 모델을 미세 조정합니다.
Grounding 단계 (핵심): Mammo-FM 의 제로샷 (Zero-shot) 예측 결과를 활용하여 생성된 보고서의 사실성 (Factuality) 을 검증하고 수정합니다. 이는 환각 (Hallucination) 을 줄이고 임상적 정확도를 보장합니다.
C. 해석 가능한 위험 예측 (Interpretable Risk Prediction)
기존 MIRAI 및 AsymMIRAI 모델에 Mammo-FM 인코더를 통합하여 MIRAI w/ Mammo-FM 및 AsymMIRAI w/ Mammo-FM을 구축했습니다.
지식 증류 (Knowledge Distillation): Mammo-FM 기반 모델이 MIRAI 의 위험 점수를 학습하도록 하여 예측 정확도를 유지하면서 해석 가능성을 추가했습니다.
해석 가능성: **Matryoshka Sparse Autoencoder (SAE)**를 사용하여 뉴런 수준의 해석을 가능하게 했습니다. 특정 뉴런의 활성화를 시각적 히트맵과 보고서의 특정 문장과 연결하여, "어떤 소견이 위험 점수에 기여했는지"를 언어적으로 설명할 수 있습니다.
3. 주요 기여 (Key Contributions)
최대 규모의 유방 특화 기초 모델: 14 만 명 이상의 환자를 대상으로 한 다기관 데이터로 학습된 최초의 유방촬영 전용 기초 모델 (Mammo-FM) 을 제안했습니다.
통합 프레임워크: 진단 (Diagnosis), 예후 (Prognosis), 보고서 생성 (Reporting) 을 단일 프레임워크에서 처리하며, 이미지 - 텍스트 정렬을 통해 시각적 및 텍스트 기반의 해석 가능성을 동시에 제공합니다.
고해상도 처리: 원본 고해상도 이미지를 처리하여 미세석회화 등 중요한 소견을 포착하고, 저해상도 모델들의 한계를 극복했습니다.
임상적 사실성 검증 (Grounding): 보고서 생성 시 Mammo-FM 의 제로샷 예측을 활용하여 임상적 오류를 줄이는 'Grounding' 단계를 도입했습니다.
새로운 평가 지표: 생성된 보고서의 임상적 정확도를 평가하기 위해 GREEN 지표를 유방촬영에 맞게 적응화하여 적용했습니다.
4. 결과 (Results)
진단 성능: Mammo-FM 은 분포 내 (ID) 및 분포 외 (OOD, VinDr, RSNA 데이터셋) 모두에서 기존 일반적 기초 모델 (MedSigLIP 등) 과 단일 기관 모델을 능가했습니다.
제로샷 (Zero-shot) 유방암 분류에서 MedSigLIP 대비 22~25% 상대적 개선을 보였습니다.
미세석회화 분류에서 MedSigLIP 대비 27% 개선된 AUROC(0.94) 를 기록했습니다.
데이터 효율성: 전체 데이터의 25% 만으로 학습한 Mammo-FM 이 80% 로 학습한 MedSigLIP 보다 평균 10~15% 높은 성능을 보였습니다.
예후 및 해석 가능성: Mammo-FM 기반 위험 예측 모델은 기존 MIRAI 와 유사한 예측 정확도를 유지하면서도, 위험 요인을 보고서 문장과 연결하여 텍스트 기반 해석을 가능하게 했습니다. SAE 를 통한 뉴런 분석은 시각적 소견과 텍스트 설명의 인과 관계를 입증했습니다.
보고서 생성 (Mammo-GRG):
생성된 보고서의 임상적 정확도를 측정하는 GREEN 점수에서 일반적 모델 (MedGemma, LLaVA-Med) 대비 62% 이상 향상된 성능을 보였습니다.
병리학적 소견 (종괴, 석회화 등) 의 회상률 (Recall) 에서 기존 모델 대비 45~114% 높은 성능을 기록했습니다.
분포 외 (OOD) 데이터셋에서도 강건한 성능을 유지했습니다.
5. 의의 및 결론 (Significance)
이 연구는 **도메인 특화 기초 모델 (Domain-specific Foundation Model)**이 의료 AI 분야에서 일반적 모델보다 훨씬 효율적이고 해석 가능하며 임상적으로 유용함을 입증했습니다.
임상적 신뢰성: 이미지와 텍스트의 정렬을 통해 AI 의 판단 근거를 의사가 이해할 수 있는 언어로 설명할 수 있어, 임상 현장에서의 도입 장벽을 낮춥니다.
실용성: 고해상도 처리와 데이터 효율성을 통해 실제 선별 검사 환경에서의 적용 가능성을 높였습니다.
미래 방향: 2D 유방촬영에 국한되었으나, 이 프레임워크는 3D 단층촬영 (DBT) 이나 MRI 로 확장 가능하며, 의료 영상 AI 가 '검증 가능하고 신뢰할 수 있는' 도구로 발전하는 중요한 이정표가 됩니다.
결론적으로, Mammo-FM과 Mammo-GRG는 유방암 진단, 위험 평가, 보고서 작성의 전 과정을 아우르는 투명하고 신뢰할 수 있는 AI 워크플로우를 제시합니다.