← 최신 논문
🧬 biology

Predictive single cell foundation model for gene regulation and aging with privacy-preserving tabular learning

이 논문은 기관 간에 원시 데이터를 공유하지 않고도 조절 논리를 발견하고 회춘 인자를 식별할 수 있도록, 연합 학습을 활용하여 유전체 데이터의 표 형식 구조를 명시적으로 포착하는 개인정보 보호 기능이 있는 단일 세포 파운데이션 모델인 Tabula를 소개한다.

원저자: Xiaojie Qiu, Jiayuan Ding, Jianhui Lin, Ziyang Miao, Nils Mechtel, Shiyu Jiang, Yixin Wang, Zhaoyu Fang, Jorge Martin-Rufino, Chen Weng, Reuben Saunders, Weize Xu, Jonathan Weissman, Min Li, Jiliang T
게시일 2026-07-09
📖 5 분 읽기🧠 심층 분석

원저자: Xiaojie Qiu, Jiayuan Ding, Jianhui Lin, Ziyang Miao, Nils Mechtel, Shiyu Jiang, Yixin Wang, Zhaoyu Fang, Jorge Martin-Rufino, Chen Weng, Reuben Saunders, Weize Xu, Jonathan Weissman, Min Li, Jiliang Tang, Wei Ouyang, Yuancheng Ryan Lu

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

개요: 새로운 종류의 "세포 두뇌"

모든 세포가 하나의 작고 복잡한 공장이라고 상상해 보세요. 각 공장 내부에서는 수천 명의 노동자(유전자)들이 서로에게 끊임없이 쪽지를 보내며, 공장이 무엇을 해야 할지 결정합니다. 피부를 만들 것인지, 감염과 싸울 것인지, 아니면 손상을 복구할 것인지 말이죠.

과학자들은 이 쪽지들을 읽고 공장이 어떻게 작동하는지 이해할 수 있는 "슈퍼 브레인"(AI 모델)을 구축하려고 노력해 왔습니다. 기존의 슈퍼 브레인 시도들은 두 가지 큰 문제점이 있었습니다:

  1. "개인정보 유출": 학습을 위해 이 두뇌들은 모든 공장의 비밀 노트를 한꺼번에 들여다봐야 했습니다. 이는 모든 병원에 환자 기록을 중앙 서버로 보내달라고 요청하는 것과 같으며, 이는 엄청난 개인정보 보호 위험을 초래합니다.
  2. "잘못된 책 형식": 이 두뇌들은 마치 소설(텍스트)을 읽는 것처럼 학습되었습니다. 그들은 유전자들을 문장처럼 특정한 순서 속에 강제로 끼워 맞추려 했습니다. 하지만 유전자는 문장이 아닙니다. 유전자는 스프레드시트의 열(column)과 같습니다. 순서는 중요하지 않으며, 중요한 것은 각 열의 '값'입니다.

Tabula는 이 두 가지 문제를 모두 해결하는 새로운 솔루션입니다. 이는 단일 세포 데이터(single-cell data)를 위해 특별히 설계된 "파운데이션 모델"(거대한 사전 학습된 AI)이며, 개인정보를 존중하면서 데이터의 진정한 구조를 이해하는 방식으로 학습합니다.


1. 개인정보 보호 솔루션: "비밀 레시피" 요리 대회

문제점: 보통 스마트한 AI를 훈련시키려면 모든 데이터를 한곳에 모아야 합니다. 하지만 의료 데이터의 경우, 수백만 명의 환자 기록을 중앙 서버로 옮길 수는 없습니다.

Tabula의 솔루션 (연합 학습 - Federated Learning):
8명의 서로 다른 셰프(병원 또는 연구소)가 세계 최고의 수프 레시피를 만들기 위해 요리 경연 대회를 연다고 상상해 보세요.

  • 기존 방식: 모든 사람이 자신의 비밀 재료를 하나의 거대한 주방으로 보냅니다. 총괄 셰프가 그 재료들을 모두 섞습니다. (이것은 비밀을 유출합니다.)
  • Tabula 방식: 각 셰프는 자신의 주방에 머뭅니다. 그들은 자신만의 비밀 재료를 사용하여 수프 한 배치를 요리합니다. 그런 다음, 그들은 재료를 어떻게 조절했는지에 대한 레시피 노트(소금, 열기, 향신료를 어떻게 조절했는지에 대한 수학적 계산)만을 총괄 셰프에게 보냅 정합니다.
  • 총괄 셰프는 이 노트들을 결합하여 "마스터 레시피"를 만듭니다.
  • 마스터 레시피는 다시 모든 셰프에게 전달되어, 그들이 다음 배치를 만들 때 개선하는 데 사용됩니다.

결과: AI는 모든 데이터로부터 학습하지만, 어떠한 원시 데이터(raw data)도 외부로 유출되지 않습니다. 환자의 개인정보는 절대 침해되지 않습니다.

2. 구조적 솔루션: "스프레드시트" vs "소설"

문제점: 이전의 AI 모델들은 세포를 하나의 문장처럼 취급했습니다. 그들은 "유전자 A가 먼저 오고, 그다음 유전자 B, 그다음 유전자 C가 온다"라고 말했습니다. 하지만 세포 내에서 유전자는 고정된 순서를 갖지 않습니다. 유전자는 스프레드시트의 열과 같아서, 열을 이리저리 섞어도 세포는 여전히 같은 세포입니다.

Tabula의 솔루션 (표 형식 학습 - Tabular Learning):
Tabula는 데이터를 정확히 스프레드시트처럼 다룹니다.

  • 행(Rows): 각 행은 하나의 세포입니다.
  • 열(Columns): 각 열은 하나의 유전자입니다.
  • 핵심 기술: 왼쪽에서 오른쪽으로 이야기를 읽는 대신, Tabula는 전체 행을 한꺼번에 봅니다. Tabula는 5번 열과 10번 열을 바꾼다고 해서 세포의 의미가 변하지 않는다는 것을 이해합니다.

이러한 "스프레드시트"의 특성을 존중함으로써, Tabula는 유전자를 이야기 형식으로 강제하려는 모델들보다 유전자 간의 실제 관계를 훨씬 더 잘 학습합니다.

3. 플랫폼: "Chiron" – 디지털 회의실

이 개인정보 친화적인 요리 대회를 쉽게 만들기 위해, 저자들은 Chiron이라는 플랫폼을 구축했습니다.

  • Chiron은 내장된 "AI 에이전트"(도움이 되는 로봇 비서)를 갖춘 디지털 회의실이라고 생각하면 됩니다.
  • 어떤 병원이든 클릭 한 번으로 이 방에 참여할 수 있습니다. 서버를 설정하기 위해 엔지니어 팀을 꾸릴 필요가 없습니다.
  • 로봇 비서가 가이드를 제공합니다: "여기에 당신의 데이터가 있고, 여기에 당신의 모델이 있습니다. 이제 학습을 시작합시다."
  • 학습이 완료되면, 개선된 "마스터 레시피"(향상된 AI 모델)는 공개 라이브러리(Model Hub)에 게시되어, 원시 데이터를 전혀 보지 않고도 누구나 사용할 수 있게 됩니다.

4. Tabula는 실제로 무엇을 할 수 있는가?

논문은 Tabula가 단순히 개인정보 보호 도구일 뿐만 아니라, 기존 모델들보다 생물학적으로 더 똑똑하다는 것을 보여줍니다.

  • "제로샷(Zero-Shot)" 탐정: Tabula는 특정 규칙을 명시적으로 배우지 않고도 유전자들이 어떻게 대화하는지 예측할 수 있습니다.
    • 비유: 탐정에게 논리의 규칙을 가르치고 몇 가지 범죄 현장을 보여준다고 상상해 보세요. 그 후, 한 번도 본 적 없는 완전히 새로운 범죄 현장을 보여주면, 탐정은 즉시 누가 범인이고 어떻게 범행을 저질렀는지 추론할 수 있습니다. Tabula는 네 가지 복잡한 생물학적 시스템(혈액 형성, 심장 발달, 뇌 발달, 췌장 발달)에 대해 이 작업을 수행했으며, 거의 매번 "정답(ground truth)"을 맞혔습니다.
  • 항노화의 열쇠 찾기: 연구진은 구체적인 퍼즐을 풀기 위해 Tabula를 사용했습니다: 세포의 정체성을 잃지 않으면서 어떻게 하면 오래된 피부 세포를 다시 젊게 만들 수 있을까?
    • 그들은 젊은 피부 세포와 늙은 피부 세포의 데이터를 사용했습니다.
    • 그들은 Tabula에게 "재젊화(rejuvenation)" 과정을 시뮬레이션하도록 요청했습니다: "이 유전자들을 미세하게 조정한다면, 늙은 세포를 젊게 만들면서도 여전히 피부 세포로 유지할 수 있을까?"
    • Tabula는 특정 유전자들(CPE, POSTN, OLFM2)을 제안했습니다. 이 유전자들의 수치를 높이면 노화 징후를 되돌릴 수 있다는 것입니다.
    • 검증: 연구진이 실험실에서 이 유전자들을 테스트했을 때, 실제로 효과가 있었습니다. 흥-미롭게도, 이 유전자들은 유명한 "야마나카 인자(Yamanaka factors, 알려진 역분화 방법)"와는 다르게 작동했습니다. 이는 Tabula가 세포의 정체성을 유지하면서 노화를 되돌리는 새로운 경로를 찾아냈음을 시사합니다.

요약

Tabula는 다음과 같은 새로운 생물학 AI입니다:

  1. 개인정보를 보호합니다: "비밀 레시피" 방식을 사용하여, 병원의 개인 환자 데이터를 직접 보지 않고도 학습합니다.
  2. 데이터를 올바르게 이해합니다: 세포를 이야기가 아닌 스프레드시트로 취급하여, 유전자 상호작용을 이해하는 데 훨씬 더 똑똑합니다.
  3. 사용하기 쉽습니다: Chiron 플랫폼을 통해 어떤 연구실이든 클릭 한 번으로 학습 과정에 참여할 수 있습니다.
  4. 결과를 만들어냅니다: 복잡한 유전자 규칙을 성공적으로 예측하고 피부 노화를 되돌리는 새로운 후보들을 식별함으로써, 의학적 발견을 위한 강력한 도구가 될 수 있음을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →