HEIST: A Graph Foundation Model for Spatial Transcriptomics and Proteomics Data
이 논문은 공간적 맥락을 세포 내 유전자 및 단백질 네트워크와 통합하여 세포 주석 생성, 유전자 임퓨테이션(imputation), 임상 결과 예측에서 최첨단 성능을 달착성하는 동시에 공간 단백체학과 같은 미학습 데이터 유형으로 일반화되는 2,230만 개의 공간 해상도 세포로 사전 학습된 계층적 그래프 트랜스포머 파운데이션 모델인 HEIST를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
당신이 북적이고 붐비는 도시를 이해하려고 노력하고 있다고 상상해 보십시오. 당신에게는 두 종류의 데이터가 있습니다:
- 사람 목록: 모든 사람의 생각과 행동(그들의 "유전자 발현")을 알려주는 거대한 스프레드시트입니다.
- 지도: 모든 사람이 정확히 어디에 서 있는지, 그리고 누구 옆에 서 있는지 보여주는 GPS(그들의 "공간적 위치")입니다.
오랫동안 과학자들은 '사람 목록'을 보거나 '지도'를 보는 것 중 하나를 선택해야만 했습니다. 목록을 본다면 그들은 이웃이라는 맥락을 놓쳤습니다. 지도를 본다면 그들은 개인의 내면적인 생각들을 놓쳤습니다. 게 더욱이, 대부분의 컴퓨터 모델은 모든 사람의 "어휘"가 고정되어 있다고 취급했기 때문에, 만약 자신이 학습한 것과 다른 단어(유전자 또는 단백질)를 사용하는 새로운 도시를 마주하면 이를 이해할 수 없었습니다.
HEIST의 등장.
HEIST는 세포의 내면적인 생각과 그들의 **이웃 맥ante(맥락)**를 동시에 이해하도록 설계된 새로운 "파운데이션 모델"(초지능형 AI 베이스)입니다. HEIST가 어떻게 작동하는지 다음의 간단한 비유를 통해 설명해 드리겠습니다.
1. 두 층 구조의 도시 지도 (계층적 그래프)
대부분의 모델은 도시를 단 한 가지 방식으로만 바라봅니다. 하지만 HEIST는 **러시아 인형(마트료시카)**이나 2층 건물처럼 도시를 바라봅 수 있습니다:
- 위층 (이웃/네이버후드): 이는 전체 조직의 지도입니다. 세포가 서로 누구 옆에 서 있는지에 기초하여 세포들을 연결합니다. 이 모델은 "종양 이웃"에 있는 세포가 "건강한 이웃"에 있는 세포와 다르다는 것을 알고 있습니다.
- 아래층 (내부 사무실): 모든 개별 세포 내부에서, HEIST는 해당 세포의 유전자들로 이루어진 미니 네트워크를 구축합니다. 단순히 유전자를 나열하는 것이 아니라, 누가 누구와 대화하는지(공동 발현)를 기반으로 유전자를 연결합니다.
마법 같은 기술: HEIST는 위층만을 보거나 아래층만을 보지 않습니다. 대신, 이 두 층이 서로 대화할 수 있게 합니다.
- 만약 세포가 시끄럽고 붐비는 이웃(특정 조직 환경)에 서 있다면, HEIST는 그 스트레스를 반영하여 해당 세포의 내부 "생각"을 업데이트합니다.
- 반대로, 세포 내부의 유전자들이 특정한 메시지를 외치고 있다면, HEST는 이를 사용하여 해당 세포가 이웃에서 차지하는 위치를 업데이트합니다.
2. 고정된 사전이 없음 (일반화)
당신이 영어 통역사를 훈련시켰는데, 그에게 프랑스어로 쓰인 책을 건네주었다고 상상해 보십시오. 표준 모델은 오직 "영어 어휘"만 알고 있기 때문에 작동을 멈출 것입니다.
HEIST는 다릅니다. HEIST는 고정된 단어 목록(유전자)을 암기하는 대신, 단어들이 서로 어떻게 관계를 맺는지를 배웁니다.
- 만약 이전에 본 적 없는 새로운 단백질(프로테오믹스 데이터와 같은)을 보더라도, HEIST는 당황하지 않습니다. 이 새로운 단백질이 그 이웃들과 어떻게 "대화"하고 있는지를 살펴보고, 그 관계를 바탕으로 그 의미를 추론합니다.
- 덕분에 HEIST는 처음부터 다시 학습할 필요 없이 RNA(전사체학) 연구에서 단백질(단백질체학) 연구로 뛰어넘을 수 있습니다. 이는 마치 단어를 들어본 적이 없더라도 문법과 문장 구조를 이해함으로써 새로운 언어를 배울 수 있는 다국어 능력자와 같습니다.
3. 어떻게 학습했는가 (학습 과정)
HEIST는 2,230만 개의 세포와 15개의 서로 다른 장기, 124개의 서로 다른 조직을 포함하는 거대한 "도시" 데이터셋을 통해 학습되었습니다.
- 선생님의 게임: AI는 학습을 위해 두 가지 게임을 수행했습니다:
- "차이점 찾기" 게임 (대조 학습): AI에게 두 개의 세포를 보여주고 "이 이웃들이 서로 유사한가, 아니면 다른가?"라고 묻습니다. 이를 통해 비슷한 세포들은 함께 묶고, 다른 세포들은 서로 멀리 떨어뜨리는 법을 배웠습니다.
- "빈칸 채우기" 게임 (마스크드 오토인코딩): AI에게 일부 유전자나 위치 데이터가 가려진(마스킹된) 세포를 보여줍니다. 그러면 AI는 세포의 이웃과 내부 유전자 네트워크에 대해 알고 있는 지식을 바탕으로 누락된 조각들을 추측해야 합니다.
4. HEIST가 할 수 있는 일 (결과)
논문은 HEIST가 생물학의 네 가지 특정 분야에서 "슈퍼 파워"라고 주장합니다:
- 숨겨진 클러스터 찾기: 다른 모델들이 놓치는 아주 작고 숨겨진 세포 하위 그룹을 찾아낼 수 있습니다. 예를 들어, 이전 모델들이 단순히 "일반적인 면역 세포"로 취급했던 것과 달리, HEIST는 종양 내의 매우 특정한 "미세 환경"에서만 존재하는 특정 유형의 면역 세포를 포착할 수 있습니다.
- 건강 결과 예측: 조직 샘플을 보고 암 환자가 면역 요법에 반응할지, 혹은 태반이 건강한지를 예측할 수 있으며, 종종 기존의 최고 모델들을 능가하는 성능을 보입니다.
- 빈틈 메우기: 실험실에서 흔히 발생하는 문제인 유전자 측정값이 누락되거나 노이즈가 섞인 경우, HEIST는 그것이 무엇이어야 하는지 정확하게 추측할 수 있습니다.
- 속도: HEST는 매우 빠릅니다. 모든 세포를 서로 연결하려고 시도하는 대신 스마트하고 희소한(sparse) 방식을 사용하기 때문에, 경쟁 모델들보다 8배 더 빠르고, 다른 모델들보다는 48배 더 빠릅니다.
요약
HEIST를 궁극의 생물학적 탐정이라고 생각하십시오. 이 모델은 단순히 세포의 신분증(유전자)을 읽는 것에 그치지 않고, 범죄 현장(조직 지도)을 살피고, 용의자들 사이의 관계(유전자 네트워크)를 이해하며, 그 맥락을 사용하여 다른 탐정(모델)들이 너무 눈이 멀어 보지 못했던 미스터리를 해결합니다. HEIST는 "누구인가"(유전자), "어디에 있는가"(공간), 그리고 "어떻게 대화하는가"(네트워크)를 하나의 통합되고 적응 가능한 시스템으로 성공적으로 결합한 최초의 모델입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.