Tokenizing single-cell transcriptomes as a native language for large language models
이 논문은 연속적인 단일 세포 전사체 프로파일을 사전 학습된 거대 언어 모델과 호환 가능한 이산 시퀀스로 토큰화하는 새로운 접근 방식인 CellTok을 소개하며, 이를 통해 세포 데이터, 생물학적 맥락, 그리고 텍스트 명령어를 결합하여 세포 식별, 질병 추론, 상태 생성과 같은 다양한 과업을 수행할 수 있는 통합된 프레임워크를 가능하게 한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
생물학의 세계를 거대한 도서관이라고 상상해 보세요. 오랫동안 과학자들은 이 도서관에서 매우 다른 두 종류의 책을 가지고 있었습니다. 한 선반은 인간의 언어, 즉 단어로 쓰인 이야기, 지침, 설명들로 가득 차 있습니다. 다른 선반에는 단일 세포 전사체(single-cell transcriptomes)가 있는데, 이는 마치 단일 세포 내부의 분자 활동을 나타내는 복잡하고 연속적이며 고차원적인 지도와 같습니다.
수년 동안 이 두 선반은 서로 대화하지 못했습니다. 만약 당신이 세포를 이해하기 위해 인간의 언어를 읽는 매우 똑똑한 인공지능(대규모 언어 모델, LLM)을 사용하고 싶다면, 그 AI는 막혀 있는 상태였습니다. AI에게 세포의 분자 지도는 "외국어"였기 때문입니다. AI는 세포에 대한 텍-스트 설명은 읽을 수 있었지만, 세포의 원시 데이터를 직접 읽거나, 다른 아이디어와 결합하거나, 다음에 일어날 일을 예측할 수는 없었습니다. 왜냐하면 데이터가 AI의 모국어 형식이 아니었기 때문입니다.
여기에 세포의 "외국어"를 AI의 "모국어"로 바꾸어 주는 보편적인 번역기 역할을 하는 새로운 접근 방식인 CellTok이 등장했습니다.
마법의 번역기: 세포를 레고 블록으로 만들기
세포의 유전자 발현 프로파일을 거대하고 무질서하며 연속적인 그림이라고 생각해 보세요. 그것은 아름답지만 텍스트 기반 AI가 직접 처리하기에는 어렵습니다. CellTok은 특별한 도구(벡터 양자화 오토인코더, vector-quantized autoencoder)를 사용하여 이 그림을 작고 깔끔한 시퀀스인 **이산적 토큰(discrete tokens)**으로 잘게 쪼갭니다.
그 그림을 가져와서 짧은 레고 블록 문자열로 만든다고 상상해 보세요. 각 블록은 세포의 상태를 나타내는 특정한 이산적 코드입니다. 그런 다음 CellTok은 이 레고 블록들을 가져와 AI의 어휘 사전에 직접 추가합니다. 갑자기 AI는 단어만 보는 것이 아니라, "심장", "질병", 또는 "성장"과 같은 단어들과 함께 "세포-블록"을 보게 됩니다.
이 논문은 세포를 이런 방식으로 다룸으로써, AI가 드디어 텍스트와 마찬가지로 세포 데이터를 읽고, 구성하고, 생성할 수 있음을 보여줍니다.
이제 AI가 할 수 있는 것 (재미있는 부분)
AI가 "세포-블록"을 말할 수 있게 되자, 다음과 같은 멋진 퍼즐들을 해결할 수 있게 되었습니다:
- 세포 식별하기: 문장을 읽고 그것이 고양이에 관한 것임을 알 수 있듯이, AI는 일련의 세포-블록을 보고 "아, 이것은 T-세포구나!"라고 말할 수 있습니다. AI는 이 작업을 매우 잘 수행하여 많은 전문 생물학 모델들을 이겼으며, 심지어 추측만 하고 있던 거대한 범용 목적 AI 모델들보다 더 뛰어난 성능을 보였습니다.
- 세포 집단 읽기: 생물학은 단 하나의 세포에 관한 것이 아니라, 세포들의 무리에 관한 것입니다. CellTok은 세포-블록 전체를 한꺼번에 볼 수 있습니다. AI는 건강한 세포 무리와 병든 세포 무리의 차이를 구분할 수 있으며, 심지어 세포들이 서로 뒤섞여 있는 경우에도 이를 식별할 수 있습니다.
- 대화 예측하기: 세포들은 서로 대화합니다. 논문은 CellTok이 두 그룹의 세포를 보고 그들이 어떤 종류의 "신호 전달 경로"(화학적 텍스트 메시지와 같은 것)를 사용하여 소통하고 있는지 예측할 수 있음을 보여줍니다. 이는 마치 AI가 두 동네 사이의 대화를 엿듣고 그들이 무엇에 대해 토론하고 있는지 추측하는 것과 같습니다.
- 시간 여행: AI는 또한 사건의 순서를 파악할 수 있습니다. 만약 당신이 발달 단계(예: 4일째부터 61일째까지 성장하는 뇌 오가노이드)의 세포들을 보여준다면, AI는 그것들을 올바른 타임라인에 배치할 수 있습니다. 심지어 AI는 시간의 흐름을 이해함으로써, 본 적 없는 날의 세포가 어떤 모습일지 추측할 수 있다는 점까지 제안합니다.
- 새로운 세포 만들기: 이것이 가장 놀라운 부분입니다. 만약 당신이 "31일째의 세포를 만들어줘"라는 텍ot 텍스트 설명을 준다면, AI는 다시 현실적인 유전자 발현 프로파일로 디코딩될 수 있는 세포-블록의 시퀀스를 생성할 수 있습니다. 이는 마치 AI가 이야기를 쓰고 나서 그 이야기에 맞는 그림을 그리는 것과 같습니다.
CellTok이 할 수 없는 것 ("안 돼" 목록)
이 논문이 주장하지 않는 바를 아는 것도 중요합니다. 저자들은 매우 명확하게 밝히고 있습니다:
- 아직 마법의 만병통치약이 아닙니다. 논문은 이것이 "개념 증명(proof of concept)"임을 명시적으로 밝히고 있습니다. 이것은 완성된 제품이 아니라, 새로운 사고방식입니다.
- 단순히 라벨을 암기해서 작동하는 것이 아닙니다. 논문은 실제 질병 이름(예: "COVID-19")을 지루하고 중립적인 이름(예: "상태 A")으로 교체하여 테스트했습니다. AI는 이름이 지루해졌을 때 성능이 떨어졌습니다. 이는 AI가 단순히 "COVID-19"가 항상 "나쁜 세포"와 연결된다는 것을 암기한 것이 아니라, 단어의 생물학적 의미를 실제로 사용하고 있음을 증명합니다.
- 모든 세부 사항에서 완벽하지는 않습니다. 논문은 연속적인 그림을 레고 블록으로 만드는 과정에서 미세하고 정교한 세부 사항을 일부 잃을 수 있음을 인정합니다. 저자들은 향후 연구를 통해 정확히 어떤 정보가 번역 과정에서 손실되는지 파악해야 한다고 제안합니다.
얼마나 확신하나요?
저자들은 결과에 자신감을 보이지만, 조심스러운 언어를 사용합니다. 그들은 Cell-Tok이 많은 과업에서 작동함을 **입증(demonstrated)**하고 보여주었습니다(showed). 또한 이 접근 방식이 생물학의 새로운 문을 열 것이라고 **제안(suggest)**합니다.
예를 들어, 새로운 시점에 대한 일반화 능력에 대해 말할 때, 그들은 결과가 모델이 특정 날짜를 단순히 암기한 것이 아니라 발달의 "국소적 연속성(local continuity)"을 학습했음을 **시사한다(suggest)**고 말합니다. 미세한 세부 사항의 손실에 대해 논할 때, 그들은 정보가 압축되거나 버려질 수 있다고 언급하며, 이를 실패가 아닌 탐구해야 할 한계로 프레임화합니다.
큰 그림
CellTok을 다리 건설이라고 생각해보세요. 이전에는 생물학 데이터와 AI 언어가 서로 반대편 섬에 있었습니다. CellTok은 "토큰"(레고 블록)으로 만들어진 다리를 건설하여 AI가 세포의 섬으로 걸어서 탐험할 수 있게 해줍니다. 이를 통해 과학자들은 평범한 영어로 AI에게 질문을 던지고, 생명의 실제 분자 데이터에 깊이 뿌리를 둔 답변을 얻을 수 있습니다.
논문은 이것이 단순한 새로운 도구가 아니라, 새로운 관점이라고 결론짓습니다. 이는 단일 세포 데이터를 드디어 AI의 "모국어"로 만들어, 우리가 세포, 집단, 그리고 생물학적 지식을 모두 동일한 공유 공간 내에서 모델링할 수 있게 해준다는 것을 시사합니다. 이것은 생명을 이해하기 위해 AI를 사용하는 방식에 있어 매우 흥고로운 새로운 장을 여는 첫걸음이자 유망한 실험입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.