LucaCell: a sequence-centric foundation model for cross-species single-cell analysis
LucaCell은 고정된 유전자 식별자 대신 사전 학습된 mRNA 서열 임베딩을 활용하여 정확한 세포 유형 전이, 미생물 종 차별화, 숙주-바이러스 상호작용 예측을 포함한 강건한 교차 종, 교차 모달리티 및 교차 컨텍스트 단일 세포 분석을 가능하게 하는 서열 중심 파운데이션 모델입니다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
모든 살아있는 세포 내부에는 그 세포가 어떻게 기능하고, 성장하며, 환경에 반응하는지를 결정하는 복잡한 지침서인 라이브러리가 존재합니다. 이 지침들은 RNA라고 불리는 화학적 언어로 기록되어 있으며, 이는 세포의 마스터 설계도로부터 명령을 전달하는 메신저 역할을 합니다. 수십 년 동안 과학자들은 이러한 메시지를 읽어내는 도구들을 개발해 왔으며, 이를 통해 인체의 다양한 세포 유형을 목록화하고 질병이 정상적인 작동을 어떻게 방해하는지 이해할 수 있었습니다. 그러나 커다란 장애물이 항상 남아 있었습니다. 기존의 도구들은 유전자에 부여된 고정된 이름과 라벨에 의존하는데, 이는 마치 모든 책에 특정한 호출 번호가 지정되어 있어야만 작동하는 도서관과 같습니다. 만약 과학자가 인간 세포와 생쥐 세포를 비교하거나, 인간 세포와 미생물을 비교하려고 하면, 기존 시스템은 이름이 일치하지 않거나 데이터가 완전히 다른 유형의 측정 방식에서 왔다는 이유로 종종 실패하곤 합니다. 이러한 한계는 서로 다른 종과 생물학적 맥락을 아우르는 단일하고 보편적인 생명의 이해를 구축하는 것을 어렵게 만들었습니다.
이제 한 연구팀이 이러한 명명 문제를 완전히 우회하는 새로운 접근법을 도입했습니다. 정적인 라벨에 의존하는 대신, 그들은 유전 코드의 구성 성분인 염기 서열 자체로부터 직접 학습하는 컴퓨터 모델을 구축했습니다. 연구진은 모델에게 화학적 문자의 패턴을 인식하도록 가르침으로써, 특정 이름을 알 필요도, 해당 종이 무엇인지 알 필요도 없이 유전자의 본질을 이해할 수 있는 시스템을 만들었습니다. '루카셀(LucaCell)'이라 불리는 이 새로운 모델은 유전 코드를 단절된 항목들의 목록이 아닌 연속적인 언어로 취급합니다. 그 결과, 이 모델은 생물학적 정보를 여러 종 사이에서 번역하고, 세포가 변화에 어떻게 반응할지 예측하며, 심지어 감염이 눈에 띄기 전에 식별해 낼 수 있는, 생명의 구성 요소를 연구하기 위한 더욱 유연하고 강력한 도구가 되었습니다.
이 돌파구의 핵심은 모델이 유전자를 표현하는 방식에 있습니다. 전통적인 방식은 각 유전자를 사전 속의 단어와 유사하게 고유한 기호로 취급합니다. 만약 사전이 바뀌거나 다른 언어로 된 책을 읽고 있다면, 그 기호들은 더 이상 의미를 갖지 못합니다. 그러나 루카셀은 유전자를 형성하는 실제 글자 서열을 들여다봅니다. 이 모델은 사전 학습된 시스템을 사용하여 이러한 서열을 그 의미와 관계를 포착하는 수학적 형상으로 변환합니다. 모델이 유전자를 마주할 때, 그것은 라벨이 아닌 화학적 구조를 바탕으로 그 기능을 이해합니다. 이를 통해 모델은 인간의 신장 세포에 있는 유전자와 생쥐 신장의 유사한 유전자가 이름이나 데이터 수집 기술이 다르더라도 서로 연관되어 있음을 인식할 수 있습니다. 연구진은 인간과 생쥐로부터 얻은 8,500만 개의 세포라는 방대한 데이터셋을 사용하여 모델을 훈련함으로써 이를 테스트했으며, 이 데이터셋은 수십 가지의 조직과 질병 상태를 포함하고 있었습니다. 이러한 훈련을 통해 모델은 세포가 어떻게 행동하는지에 대한 깊고 일반적인 이해를 갖추게 되었습니다.
훈련을 마친 모델은 기존 시스템이 일반적으로 어려움을 겪는 몇 가지 도전적인 시나리오에서 시험대에 올랐습니다. 한 실험에서 연구진은 모델에게 인간, 생쥐, 그리고 회색쥐붙이(gray mouse lemur)의 신장에서 세포 유형을 식별하도록 요청했습니다. 모델은 유전 코드를 직접 읽는 방식과 DNA의 접근성을 읽는 방식처럼 데이터의 측정 유형이 다름에도 불구하고, 서로 다른 종 사이에서 세포 유형을 성공적으로 일치시켰습니다. 특히 학습되지 않은 생쥐 데이터를 대상으로 했을 때 뛰어난 성능을 보였는데, 이는 서열 기반의 접근 방식이 종을 초월하여 적용되는 근본적인 생물학적 진리를 포착하고 있음을 시사합니다. 또한 모델은 미생물과도 작업할 수 있음이 증명되었습니다. 단일 박테리아를 대상으로 한 테스트에서 모델은 참조 게놈에 먼저 정렬할 필요 없이 원시 유전 리드를 분석했습니다. 모델은 50가지 이상의 서로 다른 박테리아 종을 성공적으로 구별해 냈으며, 단순히 유전 서열의 패턴을 관찰하는 것만으로도 항생제 스트레스에 대한 반응과 같은 박테리아의 미세한 내부 상태 변화를 감지할 수 있었습니다.
이러한 서열 중심적 관점의 힘은 특정 변화에 세포가 어떻게 반응하는지를 예측하는 영역까지 확장되었습니다. 연구진은 특정 유전자가 꺼지거나 변형되는 과정, 즉 '섭동(perturbation)'이 일어날 경우 어떤 일이 발생할지 시뮬레이션하기 위해 모델을 사용했습니다. 이 테스트에서 모델은 이전의 시스템들보다 더 정확하게 유전자 활성의 변화를 예측했습니다. 또한 모델은 개인 간의 미세한 유전적 차이인 단일 염기 다형성(SNP)까지 고려할 수 있었습니다. 이러한 작은 차이를 통합함으로써 모델은 특정 개인에 대한 유전자 발현 수준을 예측하는 능력을 향상시켰으며, 이는 아주 미세한 유전 서열의 변화조차 세포 기능에 측정 가능한 영향을 미칠 수 있음을 보여주었습니다. 이러한 세부 수준의 데이터는 모델이 라벨 기반의 광범위한 시스템이 놓치기 쉬운 미묘한 차이까지 포착하고 있음을 시사합니다.
가장 놀라운 응용 사례 중 중 하나는 숙주-바이러스 상호작용의 영역이었습니다. 연구진은 다양한 인플루엔자 바이러스 변종에 감염된 개별 세포의 바이러스 양을 예측하도록 모델을 훈련했습니다. 모델은 이전에 본 적 없는 새로운 바이러스-숙주 조합에 직면했을 때, 기존의 모든 도구들을 능가하며 정확하게 감염 패턴을 식별해 냈습니다. 심지어 모델은 바이러스에 노출되지 않은 세포들을 살펴보고, 감염이 임박했음을 나타내는 유전적 징후를 이미 보이고 있는 작은 하위 집단을 찾아내기도 했습니다. 이 발견은 모델이 세포 수준에서 질병이 어떻게 확산되는지를 이해하는 데 있어 매우 중요한 능력이 될 수 있는, 감염에 취약하게 만드는 세포의 미묘하고 선행적인 상태를 감지할 수 있음을 시사합니다.
루카셀의 성공은 유전 글자의 서열이 생물학을 이해하기 위한 전이 가능한 토대를 포함하고 있음을 시사합니다. 고정된 식별자에서 벗어나 근본적인 화학적 언어에 집중함으로써, 연구진은 더 적응력이 높고 견고한 모델을 만들어 냈습니다. 현재 버전은 인간과 생쥐의 데이터에 의존하며 유전 서열에 대한 단순화된 뷰를 사용하고 있지만, 결과는 이 접근 방식이 종, 데이터 유형, 그리고 생물학적 맥락 사이의 간극을 메울 수 있음을 보여줍니다. 이는 세포의 세계를 바라보는 새로운 방식을 제시하며, 그곳에서는 생명의 근본적인 언어가 번역이나 경직된 분류 없이 직접적으로 이해됩니다. 라벨에서 서열으로의 이러한 전환은 세포가 어떻게 작동하고, 상호작용하며, 생명의 도전에 대응하는지를 밝혀내는 미래의 발견들을 위한 표준이 될 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.