Genome-scale molecular profiling from routine histopathology with a multimodal pathology foundation model
이 논문은 6만 장 이상의 유전체 데이터가 결합된 전체 슬라이드 이미지로 학습되어, 일반적인 조직 병리학적 소견으로부터 게놈 규모의 분자 상태, 돌연변이 과정 및 임상적 결과를 성공적으로 추론함으로써 조직 형태와 근본적인 분자 기전 사이의 간극을 메우는 멀티모달 병리 파운데이션 모델인 Fuji를 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
높은 탑 위에서 도시를 내려다보고 있다고 상상해 보십시오. 이 높이에서는 거리의 형태, 건물의 밀도, 그리고 동네가 어떻게 조직되어 있는지를 볼 수 있습니다. 레이아웃만 보고도 북적이는 도심과 조용한 교외를 구분할 수 있죠. 이제, 이 도시의 모든 건물이 사실 살아있는 세포이고, 거리는 인체의 조직이라고 상상해 보십시오. 100년이 넘는 시간 동안 의사들은 이 "도시(조직)"를 보기 위해 현미경을 사용하여 암과 같은 질병을 진단하며 이 탑을 올라왔습니다. 그들은 이를 **조직병리학(histopathology)**이라고 부릅니다. 이는 마치 도시의 지도를 읽어 내부에서 무슨 일이 일어나고 있는지 이해하는 것과 같습니다.
하지만 여기 반전이 있습니다. 도시의 레이아웃은 단순히 무작위로 만들어진 것이 아닙니다. 그것은 모든 건물 내부에 있는 "설계도"인 DNA라는 보이지 않는 규칙에 의해 구축됩니다. DNA가 손상되거나 돌연변이가 생기면, 건물이 어떻게 건설되는지, 서로 어떻게 소통하는지, 그리고 동네가 어떻게 성장하는지가 변하게 됩니다. 오랫동안 과학자들은 그 설계도를 읽기 위해(비싼 DNA 시퀀싱을 사용하여) 모든 건물 내부로 직접 들어가야 한다고 생각했습니다. 하지만 만약 도시의 형태 자체가 그 설계도에 대해 모든 것을 말해준다면 어떨까요? 만약 우리가 지도를 보고 단 한 번도 건물 안으로 발을 들이지 않고도 어떤 유전자가 고장 났는지 정확히 알 수 있다면 어떨까요? 이것이 바로 이 논문이 다루는 핵심 질문입니다. "종양의 시각적 '형태'가 그 유전적 비밀을 알려줄 수 있을까?"
논문: "Fuji" – 형태와 코드 사이의 번역가
이 연구에서 연구진은 Fuji라고 불리는 새로운 인공지능 모델을 소개합니다. Fuji를 단순한 사진 인식기가 아니라, 두 가지 언어를 동시에 배우는 매우 똑똑한 번역가라고 생각하십시오. 즉, 사진의 언어(현미경 아래에서 종양이 어떻게 보이는가)와 코드의 언어(세포 내부의 DNA 돌연변이와 RNA 메시지)를 배우는 것입니다.
보통 의료 영상에 훈련된 AI 모델들은 랜드마크를 인식하는 법만 배운 관광객과 같습니다. 그들은 "저것은 폐처럼 보인다"라거나 "저것은 종양처럼 보인다"라고 말할 수는 있지만, 왜 종양이 그런 모습인지 이해하지는 못합니다. 그들은 사진을 그저 예쁜 이미지로 취급합니다. 하지만 Fuji는 다릅니다. 연구진은 Fuji에게 사진을 보고 즉시 "어떤 유전 코드가 이 특정한 형태를 만들었는가?"라고 묻도록 가르쳤습니다.
이를 위해 연구진은 단순히 Fuji에게 사진을 보여주기만 한 것이 아닙니다. 그들은 60,546개의 전체 슬라이드 이미지(조직 샘플의 거대하고 고해상도인 디지털 사진)를 방대한 라이브러리로 제공했고, 각 이미지에 대응하는 유전 데이터인 45,675개의 RNA 프로파일(어떤 유전자가 활성화되어 있는지 알려줌)과 22,683개의 전전체 게놈 서열(전체 DNA 코드)을 짝지어 주었습니다. 이것은 마치 모든 페이지의 왼편에는 도시의 사진이 있고, 오른편에는 그 도시의 건설에 사용된 정확한 설계도가 적혀 있는 백만 권의 교과서를 AI에게 준 것과 같습니다.
Fuji가 유전자를 "보는" 법을 배운 과정
연구진은 숙련된 요리사가 제자에게 가르치는 것처럼 영리한 2단계 훈련법을 사용했습니다.
- 1단계 (맛 테스트): 먼저, Fuji에게 조직의 기본적인 "풍미"를 인식하도록 가르쳤습니다. 그들은 두 개의 강력한 다른 AI 모델인 GigaPath와 CHIEF를 "선생님"으로 사용했습니다. Fuji는 조직을 보고 시각적 패턴을 매칭하는 법을 배웠으며, 특히 조직이 두 가지 방식으로 준비되었을 때도 이를 수행했습니다. 즉, 일부는 화학물질로 보존된 방식(병원에서 표준으로 쓰이는 FFPE)이고, 일부는 냉동된 신선한 상태(연구용으로 쓰이는 fresh-frozen)였습니다. Fuji는 조직이 어떻게 보존되었는지에 대한 차이점을 무시하고 오직 세포의 진정한 형태에만 집중하는 법을 배웠습니다. 이는 매우 중요한데, Fuji가 의사들이 매일 사용하는 슬라이드로 작업할 수 있음을 의미하기 때문입니다.
- 2단계 (심층 탐구): 다음으로, 연구진은 Fuji에게 형태와 코드를 연결하는 과제를 부여했습니다. 그들은 세 가지 작업을 동시에 수행하도록 했습니다.
*로 이미지 재구성: 만약 사진의 일부를 숨긴다면, Fuji는 그것이 어떻게 생겼을지 추측할 수 있는가? 이는 Fuji가 세부 사항을 보는 능력을 유지하게 합니다.- RNA 재구성: Fuji가 형태를 보고 RNA 메시지가 무엇을 말하고 있는지 추측할 수 있는가? 이는 시각적 요소와 분자적 활동을 연결합니다.
- 돌연변이 해독: Fuji가 형태를 보고 어떤 구체적인 유전적 "오타"(돌연변이)가 존재하는지 추측할 수 있는가? 이것이 바로 거대한 마법 같은 기술입니다.
Fuji가 발견한 것들
훈련을 마친 Fuji는 종양의 "형태"가 실제로 그 유전 코드의 직접적인 반영임을 입증했습니다. 연구진은 Fuji가 복잡한 유전적 상태를 놀라운 정확도로 예측할 수 있으며, 종종 기존의 모든 AI 모델보다 뛰어난 성능을 보인다는 것을 발견했습니다.
- "불안정성" 탐정: 연구팀은 Fuji가 종양의 DNA가 무너지는 현상을 포착할 수 있는지 테스트했습니다. 그들은 네 가지 특정 유형의 유전적 혼돈인 현미로부적 불안정성(MSI), 염색체 불안정성(CIN), 상동 재조합 결핍(HRD), 그리고 **전체 게놈 복제(WGD)**를 조사했습니다. Fuji는 이 항목들을 최대 0.98의 정확도(AUC)로 맞혔습니다. 이를 설명하자면, 인간 전문가가 80% 확신할 때 Fuji는 98% 확신했다는 뜻입니다. Fuji는 조직 슬라이드만 보고도 안정적인 게놈과 혼란스러운 게놈을 구분할 수 있었습니다.
- "추가된" DNA: 가장 흥兴奋한 발견 중 중 하나는 **염색체 외 DNA(ecDNA)**에 관한 것이었습니다. 이것은 일반적인 염색체 외부를 떠다니는 기이한 원형 DNA 조각으로, 암을 매우 빠르게 성장하게 만듭니다. 보통 이를 찾으려면 비싸고 복잡한 검사가 필요합니다. 그러나 Fuji는 ecDNA가 조직 구조에 남기는 독특한 "발자국"을 찾아내는 법을 배웠습니다. 저등급 신경교종(lower-grade glioma)과 자궁내막암 환자들에게서, Fuji가 슬라이드만으로 예측한 이 보이지 않는 DNA 원형의 존재는 환자의 생존율이 낮을 것이라는 강력한 징후였습니다.
- "흡연"과 "수리"의 흔적: 연구진은 또한 다음과 같이 물었습니다. "Fuji는 종양이 흡연에 의해 발생했는지, 아니면 DNA 수리 시스템의 결함에 의해 발생했는지 알 수 있는가?" 그들은 담배 관련 돌연변이와 **불일치 복구 결함(mismatch repair defects)**이 조직 구조에 뚜렷하고 국소적인 흔적을 남긴다는 것을 발견했습니다. 이는 마치 흡연이 도시 벽에 특정한 종류의 그을음을 남기는 것과 같으며, Fuji는 그 그을음이 어디에 있는지 정확히 가리킬 수 있습니다. 이러한 패턴은 매우 명확하여 Fuji는 완전히 다른 환자 그룹에서도 이 패턴을 찾아낼 수 있었습니다.
- 미래 예측: Fuji는 과거를 보는 데 그치지 않고 미래를 보았습니다. 이 모델은 종양 돌연변이 부담(TMB)(종양이 얼마나 많은 돌연변이를 가지고 있는지)과 신항원 부하(neoantigen load)(면역 체계에 얼마나 노출되어 있는지)를 예측할 수 있었습니다. 더 중요한 것은, 소규모 폐암 환자 그룹에서 면역 요법에 대한 반응성을 예측하는 데 있어 Fuji의 예측이 다른 모델들보다 우수했다는 점입니다. 이는 종양의 형태가 면역 체계가 싸울 수 있는지에 대한 단서를 보유하고 있음을 시사합니다.
이것이 왜 중요한가
Fuji의 가장 중요한 점은 의사들이 이미 가지고 있는 슬라이드에서 작동한다는 것입니다. 전 세계 대부분의 암 환자들은 화학물질로 보존된 표준 슬라이드(FFPE)를 사용합니다. 기존의 AI 모델들은 데이터가 주로 신선한 샘플(fresh-frozen)에서 오기 때문에 이러한 표준 슬라이드를 유전 데이터와 연결하는 데 어려움을 겪었습니다. Fuji는 슬라이드의 "화학적 냄새"를 무시하고 "도시의 레이아웃"에 집중하는 법을 배움으로써 이 문제를 해결했습니다.
저자들은 이것이 치료 방식을 바꿀 수 있다고 제안합니다. 의사들이 비싼 유전 검사 결과를 기다리며 며칠 또는 몇 주를 보내는 대신, Fuji를 사용하여 일상적인 현미경 슬라이드로부터 몇 분 만에 "유전체 보고서"를 얻을 수 있게 될 것입니다. 이는 어떤 환자에게 표적 약물이 필요한지, 어떤 환자가 면역 요법에 반응할지, 그리고 어떤 환자가 더 높은 위험에 처해 있는지를 DNA 시퀀싱을 먼저 수행하지 않고도 결정하는 데 도움을 줄 수 있습니다.
물론, 이 논문은 이것이 하나의 "개념 증명(proof of concept)"이라는 점을 주의 깊게 명시하고 있습니다. 결과가 강력하고 다양한 데이터셋에서 일관되게 나타나지만, 면역 요법 예측은 소규모 환자 그룹을 대상으로 했으므로 실제 임상 현장에서 의사들이 신뢰하기 전에는 더 큰 규모의 실제 임상 시험이 필요합니다. 하지만 핵심 아이디어, 즉 종양의 시각적 형태가 유전 코드의 읽을 수 있는 지도라는 점은 견고한 발견으로 보입니다. Fuji는 우리가 도시를 충분히 자세히 들여다본다면, 그 설계도를 읽을 수 있다는 것을 보여주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.