scpFormer: A Foundation Model for Unified Representation and Integration of the Single-Cell Proteomics
scpFormer 는 3 억 9 천만 개 이상의 단일 세포 프로테오믹스 데이터로 사전 학습된 트랜스포머 기반 기초 모델로, 표적 항체 패널의 분열성을 극복하고 일관된 의미 공간에서 세포를 통합하여 대규모 배치 통합, 클러스터링, 그리고 암 치료 반응 예측 등 다양한 응용 분야를 지원합니다.
원저자:Qifeng Zhou, Lei Yu, Yuzhi Guo, Yuwei Miao, Hehuan Ma, Wenliang Zhong, Lin Xu, Junzhou Huang
단일 세포 연구에서 과학자들은 세포 안의 단백질을 측정합니다. 단백질은 세포가 실제로 무엇을 하는지 (기능) 를 보여주는 '실제 작업자'입니다. (반면 RNA 는 '작업 계획서'에 가깝습니다.)
하지만 지금까지의 문제는 다음과 같았습니다:
부족한 정보: 각 연구실마다 측정하는 단백질의 종류 (패널) 가 달랐습니다. A 실험실은 100 개, B 실험실은 50 개를 측정했는데, 겹치는 게 거의 없었습니다.
단절된 데이터: 서로 다른 실험실 데이터를 합치려면, 겹치는 단백질만 남기고 나머지는 다 버려야 했습니다. 마치 서로 다른 언어로 된 책을 합치려다, 공통된 단어만 남기고 나머지는 다 태워버리는 것과 같습니다.
결측치: 측정 기술의 한계로 많은 데이터가 '없음 (Missing)'으로 처리되었습니다.
2. scpFormer 가 해결한 방법 (해결책)
scpFormer 는 이 문제를 해결하기 위해 두 가지 혁신적인 아이디어를 도입했습니다.
① "고정된 사전" 대신 "유연한 번역기" (오픈 어휘 아키텍처)
기존 방식: 기존 AI 는 미리 정해진 단어장 (사전) 만 알고 있었습니다. 사전에 없는 단백질이 나오면 AI 는 "이건 몰라"라고 하고 무시했습니다.
scpFormer 의 방식: 이 모델은 단백질의 **아미노산 서열 (DNA 와 같은 기본 구성)**을 이해합니다. 마치 언어를 배우지 않은 사람이라도 글자의 구조를 알면 새로운 단어를 유추할 수 있듯, scpFormer 는 처음 보는 단백질이라도 그 구조를 보고 "이건 어떤 역할을 할 것 같다"고 추론할 수 있습니다.
결과: 서로 다른 실험실의 데이터를 합쳐도, 겹치지 않는 단백질은 버리지 않고 AI 가 자연스럽게 연결해 줍니다.
② "숫자 나열" 대신 "의미 있는 이야기" (연속적 표현)
기존 방식: 단백질의 양을 단순히 '높음/낮음'으로 나누거나 숫자만 나열했습니다.
scpFormer 의 방식: 단백질의 양을 연속적인 흐름으로 이해합니다. 세포의 상태는 '0 과 1'처럼 딱딱 끊어지는 게 아니라, 부드러운 그라데이션입니다. scpFormer 는 이 미세한 차이를 놓치지 않고, 단백질 간의 복잡한 관계 (누가 누구와 함께 일하는지) 를 학습합니다.
3. scpFormer 가 할 수 있는 일 (성공 사례)
이 모델은 3 억 9 천만 개가 넘는 세포 데이터를 학습했습니다. 그 결과 다음과 같은 놀라운 능력을 보여줍니다.
세포 분류의 명인:
비유: 복잡한 도시의 주민들을 구별하는 일입니다.
기존 방법은 비슷하게 생긴 세포 (예: 혈구 세포의 여러 종류) 를 잘 구별하지 못했습니다. 하지만 scpFormer 는 미세한 차이를 포착해 95% 이상의 정확도로 세포 종류를 맞춥니다.
데이터 통합의 마법:
비유: 서로 다른 나라에서 온 사진을 한데 모으되, 배경 (실험실 환경) 을 지우고 사람 (세포) 만 똑같이 보이게 하는 일입니다.
기존 방법은 배경을 지우려다 사람까지 뭉개버리거나, 반대로 사람을 구분하지 못했습니다. scpFormer 는 배경 소음은 지우면서도 세포의 고유한 특징은 완벽하게 유지합니다.
잃어버린 데이터 복원 (Imputation):
비유: 퍼즐 조각이 몇 개 빠졌을 때, 주변 조각을 보고 빠진 조각이 어떤 모양일지 상상해 채우는 일입니다.
측정되지 않은 단백질의 값을 AI 가 매우 정확하게 예측해 줍니다. 특히 임상 데이터처럼 정보가 부족한 경우에도 생물학적 구조를 복원해 냅니다.
암 치료 예측:
비유: 환자의 세포 상태를 분석해 "어떤 약이 잘 들을까?"를 예측하는 일입니다.
scpFormer 가 만든 세포의 '지문'을 이용해, 기존 RNA 기반 모델보다 더 정확하게 암 치료제 반응을 예측했습니다.
4. 요약: 왜 이것이 중요한가요?
scpFormer 는 **단일 세포 단백질 연구의 '구글 번역기'이자 '지식 베이스'**가 됩니다.
데이터의 장벽을 허뭅니다: 서로 다른 실험실, 다른 장비, 다른 측정 항목을 가진 데이터도 하나로 통합할 수 있게 합니다.
새로운 발견을 돕습니다: 아직 측정하지 않은 단백질도 AI 가 추론해 주어, 실험 비용 없이 더 많은 정보를 얻을 수 있습니다.
정밀 의학을 앞당깁니다: 암 치료나 면역 치료에 필요한 맞춤형 정보를 더 빠르고 정확하게 제공합니다.
결론적으로, scpFormer 는 단백질 데이터의 혼란을 정리하고, 세포의 진짜 이야기를 들려주는 강력한 인공지능입니다.
논문 요약: scpFormer (단일 세포 단백질체학 기반 모델)
1. 문제 정의 (Problem)
단일 세포 단백질체학 (Single-cell Proteomics, SCP) 은 세포의 기능적 상태를 직접적으로 파악할 수 있는 핵심 기술이지만, 데이터 통합과 분석에 다음과 같은 근본적인 한계가 존재합니다.
표적 패널의 단편화 (Fragmentation): scRNA-seq 이 약 20,000 개의 유전자를 포괄하는 반면, SCP 데이터는 연구마다 서로 다른 항체 패널 (Antibody Panels) 을 사용하거나 질량 분석법의 확률적 샘플링으로 인해 측정된 단백질의 종류와 수가 매우 불일치합니다.
고정된 어휘의 한계: 기존 트랜스포머 (Transformer) 기반 모델은 고정된 어휘 (Vocabulary) 를 기반으로 하여, 사전 학습에 포함되지 않은 단백질은 처리할 수 없습니다. 이로 인해 데이터 소실 (Data Silos) 이 발생하고 다양한 실험 데이터의 통합이 어렵습니다.
결측치와 노이즈: 단백질은 PCR 증폭이 불가능하여 감도 한계로 인해 체계적인 결측치 (Missingness) 가 발생하며, 이는 무작위 노이즈가 아닌 분자 농도와 화학적 특성에 기반한 구조화된 패턴을 보입니다. 기존 보간 (Imputation) 방법들은 이를 제대로 처리하지 못합니다.
기존 모델의 부재: DNA/단백질 서열 기반 언어 모델이나 단일 세포 전사체 (scRNA-seq) 기반 모델은 존재하지만, 단일 세포 단백질체 데이터를 위한 전용 파운데이션 모델은 존재하지 않았습니다.
2. 방법론 (Methodology)
저자들은 위 한계를 극복하기 위해 scpFormer라는 트랜스포머 기반의 생성형 파운데이션 모델을 제안했습니다.
데이터 규모: 다양한 플랫폼 (Mass Cytometry, CITE-seq, Multiplexed Imaging 등) 에서 수집된 3 억 9 천만 개 이상의 세포와 530 개 이상의 단백질을 포함하는 대규모 데이터셋으로 사전 학습 (Pre-training) 을 수행했습니다.
핵심 혁신 1: 연속적 의미 토큰화 (Continuous Semantic Tokenization)
단백질 식별자 (Identity): 단백질의 아미노산 서열을 기반으로 사전 학습된 ESM (Evolutionary Scale Modeling) 인코더를 사용하여, 각 단백질을 이산적인 인덱스가 아닌 공유된 구조적/기능적 매니폴드 (Manifold) 상의 연속 벡터로 매핑합니다. 이를 통해 사전 학습에 포함되지 않은 단백질도 제로샷 (Zero-shot) 으로 처리 가능합니다.
발현 값 (Expression): 발현량을 이산화 (Discretization) 하지 않고, 원시 연속 값 (Raw continuous values) 을 MLP 를 통해 고차원 벡터로 직접 인코딩하여 미세한 표현형 그라디언트를 보존합니다.
Open-World Protein Embedding: 위 두 가지 (식별자 + 발현 값) 를 융합하여 가변 길이의 패널 입력을 처리합니다.
핵심 혁신 2: 계층적 사전 학습 프레임워크
단일 재구성 작업이 아닌, 세 가지 시너지 있는 디코더를 동시에 최적화합니다.
Expression Self-Decoder: 관측된 단백질들의 국소적 상호작용을 기반으로 결측 단백질을 보간합니다.
Global Expression Decoder: 전체 세포 상태 ([CLS] 토큰) 를 압축하여, 단백질 식별자만으로 결측 발현량을 예측하도록 강제합니다 (세포 전체 상태의 인코딩 강화).
Joint Decoder: 국소적 단백질 네트워크와 거시적 세포 상태를 융합하여, 보간된 값이 전체 세포의 생리학적 상태와 일치하도록 정제합니다.
하위 작업 (Downstream Tasks):
세포 유형 주석: [CLS] 토큰 임베딩을 입력으로 사용하는 분류기를 미세 조정 (Fine-tuning) 합니다.
배치 통합 (Batch Integration): 경사 반전 레이어 (GRL) 와 탄성 세포 유사도 (Elastic Cell Similarity) 손실 함수를 사용하여 기술적 노이즈는 제거하고 생물학적 변이는 보존합니다.
단백질 보간: 결측된 단백질 발현을 관측된 패널을 기반으로 예측합니다.
약물 반응 예측: 단일 세포에서 추출된 단백질 임베딩을 벌크 (Bulk) 오믹스 데이터로 변환하여 암 약물 반응 (IC50) 을 예측합니다.
3. 주요 기여 (Key Contributions)
단일 세포 단백질체 최초의 파운데이션 모델: SCP 데이터의 고유한 도전 과제 (단편화, 결측치, 가변 패널) 를 해결하는 최초의 범용 모델입니다.
오픈 어휘 (Open-Vocabulary) 아키텍처: 고정된 어휘에 의존하지 않고, ESM 을 통해 단백질 서열의 진화적 정보를 활용하여 새로운 단백질도 처리할 수 있게 함으로써 데이터 소실을 방지합니다.
생물학적 매니폴드 재구성: 희소한 임상 데이터셋에서도 제로샷 방식으로 결측치를 보간하여 생물학적 구조를 복원하는 능력을 입증했습니다.
크로스-스케일 일반화: 단일 세포 수준의 단백질체 임베딩이 벌크 오믹스 수준의 약물 반응 예측 성능을 향상시킴을 보여주었습니다.
4. 결과 (Results)
세포 유형 주석 (Cell Type Annotation):
Levine 데이터셋 (골수 세포) 에서 Seurat, CellTypist 등 기존 방법보다 뛰어난 성능을 보였습니다 (Macro F1-score: 0.978, 기존 방법 대비 0.868~0.920).
특히 희귀 세포나 분화 과정에 있는 세포 (HSC, HSPC) 에 대한 분류 정확도가 획기적으로 개선되었습니다.
다른 실험 배치 (Batch) 간 데이터에서도 높은 강건성을 보이며, 기술적 편향 없이 세포 유형을 정확히 식별했습니다.
배치 통합 및 클러스터링:
Harmony, ComBat 등 기존 통합 방법과 비교하여 생물학적 변이 보존 (AvgBIO) 과 배치 효과 제거 (AvgBATCH) 모두에서 최상의 성능을 기록했습니다.
scpFormer 는 선형적 정렬이 아닌 비선형적 관계를 학습하여 명확한 면역 표현형 경계를 유지하면서 배치 효과를 제거했습니다.
단백질 발현 보간 (Imputation):
In silico 벤치마크에서 Pearson 상관계수 0.751을 기록하여 Random Forest, k-NN 등 기존 회귀 모델들을 능가했습니다.
임상 데이터 (MIS-C) 에서는 제로샷 보간을 통해 기술적 결측치로 인해 흐려졌던 면역 세포 하위 집단의 생물학적 서명을 복원했습니다.
암 약물 반응 예측:
DeepCDR 프레임워크에 scpFormer 임베딩을 적용한 결과, 기존 전사체 기반 모델 (scFoundation) 보다 IC50 예측 정확도가 높았습니다 (Pearson 상관계수: 0.921 vs 0.888).
223 개 약물 중 183 개에서 scpFormer 가 더 낮은 평균 절대 오차 (MAE) 를 보였습니다.
5. 의의 및 결론 (Significance)
scpFormer 는 단일 세포 단백질체학 분석의 패러다임을 전환하는 도구입니다.
기술적 장벽 해소: 서로 다른 패널과 플랫폼 간의 데이터 통합을 가능하게 하여, 기존에 불가능했던 대규모 메타 분석을 가능케 합니다.
기능적 상태의 정확한 반영: 전사체 (RNA) 데이터보다 단백질 데이터가 세포의 실제 기능 상태를 더 잘 반영한다는 점을 입증하며, 이를 기반으로 한 파운데이션 모델이 더 안정적인 생물학적 신호를 포착함을 보여줍니다.
정밀 종양학 및 신약 개발: 희소하거나 제한된 임상 데이터에서도 생물학적 매니폴드를 복원하고, 이를 통해 암 약물 반응을 정확하게 예측함으로써 정밀 의학과 신약 개발에 기여할 수 있습니다.
확장성: 공간 단백질체학 (Spatial Proteomics) 및 번역 후 변형 (PTM) 분석 등으로의 확장을 위한 강력한 기반을 마련했습니다.
이 연구는 단일 세포 단백질체 데이터를 위한 범용적이고 확장 가능한 계산 기반 (Computational Substrate) 을 제공하여, 향후 바이오마커 발견 및 정밀 종양학 연구의 속도를 가속화할 것으로 기대됩니다.