← 최신 논문
💻 bioinformatics

Single-cell foundation models benefit from cross-modal training: adding proteomics data beats parameter scaling

이 논문은 단일 세포 파운데이션 모델을 단백질체 데이터와 교차 모달 사전 학습하는 것이 단순히 RNA 전용 모델의 규모를 키우는 것보다 더 우수한 유전자 수준 및 세포 수준 표현과 더 나은 일반화 성능을 제공한다는 것을 입증하며, 이는 파라미터 스케일링 자체보다 멀티모달 학습의 가치를 강조한다.

원저자: Burq, M., Stepec, D., Kim, C., Cimermancic, P.

게시일 2026-08-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Burq, M., Stepec, D., Kim, C., Cimermancic, P.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

모든 살아있는 세포 내부에서는 두 가지 서로 다른 언어로 쓰인 복잡한 대화가 진행되고 있습니다. 한 가지 언어는 RNA로 이루어져 있는데, 이는 세포를 살아가게 하고 기능하게 만드는 일꾼인 단백질을 구축하기 위한 지침을 전달하는 분자입니다. 과학자들은 이 RNA 메시지를 읽는 법을 배우기 위해 수년간 노력해 왔으며, 세포가 건강할 때와 질병 상태일 때 어떻게 행동하는지를 설명하는 거대한 디지털 라이브러리를 구축했습니다. 이 라이브러리들은 매우 커져서, 이제 연구자들은 파운데이션 모델이라고 알려진 강력한 컴퓨터 프로그램을 사용하여 그 안에서 패턴을 찾아냅니다. 이 프로그램들은 마치 책의 표지만 보고도 그 장르를 즉시 식별할 수 있는 사서처럼, 서로 다른 세포 유형의 고유한 특징을 인식하는 법을 배웁니다. 오랫동안 지배적이었던 믿음은, 이러한 프로그램들을 더 똑똑하게 만드는 유일한 방법은 더 많은 RNA 데이터를 계속해서 입력하여, 그 엄청난 양이 결국 세포 생명의 모든 비밀을 밝혀내기를 기대하는 것이라는 점이었습니다.

하지만 세포는 한 가지 이상의 언어를 사용합니다. RNA와 더불어, 세포는 실제 작업을 수행하는 구조물인 단백질을 생성합니다. RNA가 세포에 무엇을 만들라고 지시한다면, 단백질은 완성된 결과물입니다. 최근까지 대부분의 세포 컴퓨터 모델은 RNA 지침에만 집중하며 이 단백질들을 무시해 왔습니다. 이는 지침이 항상 최종 결과와 일치하지는 않기 때문에 이해의 공백을 남겼습니다. 과학자들의 과제는 이 두 번째 정보의 층위인 단백질 데이터를 추가하는 것이 단순히 더 많은 RNA 데이터를 추가하는 것보다 컴퓨터 모델을 더 많이 가르칠 수 있을 것인가 하는 점이었습니다. 이는 품질과 다양성이 단순히 모델을 더 크게 만들고 동일한 것을 더 많이 먹이는 전략보다 더 뛰어날 수 있는지에 대한 시험이었습니다.

한 연구팀은 새로운 종류의 데이터로 컴퓨터 모델을 훈련함으로써 이 질문에 답하고자 했습니다. 그들은 이미 수억 개의 RNA 샘를 통해 학습을 마친 기존 모델에서 시작했습니다. 단순히 더 많은 RNA를 제공하는 대신, 그들은 방대한 단백질 프로파일을 모델에 도입했습니다. 이 프로파일들은 세포 내에 존재하는 특정 단백질을 측정하는 기술인 질량 분석법을 사용한 440개의 서로 다른 연구에서 왔습니다. 연구진은 모델이 이 48,843개의 단백질 샘플로부터 학습하도록 세심하게 유도했는데, 이 과정을 '교차 모달 연속 사전 훈련(cross-modal continued pretraining)'이라고 불렀습니다. 이는 모델이 이미 알고 있는 RNA 언어와 단백질 언어가 어떻게 연관되어 있는지를 배우도록 함으로써, 결과적으로 지침과 완성된 제품 모두를 통해 세포를 이해하도록 가르치는 것을 의미했습니다.

결과는 놀라웠습니다. 연구진은 복잡성의 척도인 7,000만 개의 파라미터를 가진 모델을 이 혼합 데이터로 단 한 번의 통과(one pass)만으로 훈련시켰습니다. 이 모델을 테스트했을 때, 이 모델은 훨씬 더 크고 오직 RNA로만 훈련된 모델들만큼이나, 혹은 그보다 더 나은 성능을 보였습니다. 구체적으로, 단백질 데이터가 포함된 이 작은 모델은 10억 개 및 30억 개의 파라미터를 가진 RNA 전용 모델의 성능과 일치하거나 이를 능가했습니다. 이러한 발견은 더 나은 이해를 향한 유일한 길이 단순히 모델의 크기와 RNA 데이터의 양을 키우는 것이라는 생각에 도전합니다. 대신, 이는 다른 유형의 생물학적 데이터를 도입하는 것이 모델의 지능에 훨씬 더 효율적인 상승을 제공할 수 있음을 시사합니다.

이 접근 방식의 이점은 일반적인 성능 그 이상으로 확장되었습니다. 단백질 데이터로 훈련된 모델은 더 강력한 일반화 능력을 보여주었는데, 이는 모델이 이전에 본 적 없는 새로운 상황에 자신이 배운 것을 적용할 수 있음을 의미합니다. 이는 모델이 단백질 변화에 어떻게 반응하는지를 테스트했을 때 특히 명확하게 드러났습니다. 단순히 RNA 전용 모델을 더 크게 만드는 것은 이러한 변화를 이해하는 데 아무런 도움이 되지 않았습니다. 그러나 단백질으로부터 학습한 모델은 이러한 새로운 도전들을 더 수월하게 처리했습니다. 이는 단백질 데이터가 모델로 하여금 RNA에 나타나는 패턴에만 엄격하게 얽매이지 않고, 세포가 어떻게 작동하는지에 대한 더 견고하고 유연한 이해를 구축하도록 도왔음을 나타냅니다.

이러한 발견은 세포를 이해하는 미래가 단일 유형의 데이터로 훈련된 점점 더 거대한 모델을 만드는 데 있지 않을 수도 있음을 시사합니다. 대신, 가장 강력한 통찰력은 서로 다른 종류의 생물학적 정보를 신중하게 결합하는 데서 올 수 있습니다. 컴퓨터 모델에게 세포의 지침과 결과물을 모두 읽는 법을 가르침으로써, 과학자들은 더 똑똑할 뿐만 아니라 예측력이 더 높은 도구를 만들 수 있습니다. 이 접근 방식은 더 많은 정보를 담은 모델이 세포의 전체적인 복잡성을 포착할 수 있다는 유망한 경로를 제시하며, 때로는 새로운 관점을 추가하는 것이 단순히 같은 것을 더 많이 추가하는 것보다 훨씬 더 가치 있다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →