← 최신 논문
🧬 biology

Scaling Laws for Masked-Reconstruction Transformers on Single-Cell Transcriptomics

본 연구는 단일 세포 RNA 시퀀싱 데이터로 학습된 마스크드 재구성 트랜스포머(masked-reconstruction transformers)가 희소한 데이터셋의 한계를 극복할 수 있을 만큼 충분한 데이터가 확보되었을 때에만 자연어 처리에서의 것과 유사한 신경 스케일링 법칙(neural scaling laws)을 따른다는 체계적인 첫 번째 증거를 확립한다.

원저자: Ihor Kendiukhov

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ihor Kendiukhov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

당신이 로봇에게 단 하나의 세포 안에 존재하는 생명의 "언어"를 이해하도록 가르치고 있다고 상상해 보세요. 이 언어는 "사과"나 "달리다"와 같은 단어로 이루어진 것이 아니라, 바로 **유전자(genes)**로 이루어져 있습니다. 세포는 수천 개의 유전자를 가지고 있으며, 어느 순간에도 어떤 유전자는 "켜져(활성화)" 있고 어떤 유전자는 "꺼져(비활성화)" 있습니다. 이 활동의 양을 **유전자 발현(gene expression)**이라고 부릅니다.

이 논문은 똑똑한 컴퓨터 프로그램(챗봇을 구동하는 것과 같은 유형의 AI인 "트랜스포머(Transformer)")에게 세포의 유전적 이야기 중 빠진 부분을 추측하는 법을 가르치는 것에 관한 내용입니다.

연구진이 수행한 작업과 발견한 내용을 다음과 같이 간단히 정리했습니다.

1. 게임: "빈칸 채우기"

연구진은 방대한 세포 데이터 라이브러리(CELLxGENE Census, 인간 세포에 대한 거대한 공공 백과사전과 같은 것)를 가져왔습니다. 그들은 200,000개의 세포를 선택했고, 각 세포에서 가장 흥يق로운 512개의 유전자에 집중했습니다.

그들은 AI와 함께 게임을 했습니다:

  • AI에게 세포의 유전적 프로필을 보여주되, 15%의 유전자를 숨겼습니다(마스킹).
  • AI는 남은 유전자들을 보고 숨겨진 유전자들이 무엇을 하고 있는지 추측해야 했습니다.
  • 목표는 실제 정답에 최대한 가깝게 맞히는 것이었습니다.

2. 핵심 질문: 더 커지는 것이 항상 더 나은가?

AI의 세계에는 **"스케일링 법칙(Scaling Laws)"**이라는 유명한 규칙이 있습니다. 기본적으로 이것은 AI를 더 크게 만들고(더 많은 뇌 용량), 더 많은 데이터를 주면, 예측 가능한 방식으로 업무 능력이 향로된다는 것을 의미합니다.

과학자들은 이 규칙이 언어(챗봇)나 이미지(사진 생성기)에서도 작동한다는 것을 알고 있었습니다. 하지만 아무도 이것이 생물학에도 적용되는지 알지 못했습니다. 연구진은 이 규칙이 세포에도 적용되는지 확인하고 싶었습니다.

그들은 여섯 가지 서로 다른 버전의 AI를 구축했습니다. 아주 작은 "장난감" 모델(뇌세포가 500개뿐인 모델)부터 거대한 "거인" 모델(뇌세포가 1억 개 이상인 모델)까지 다양하게 구성했습니다.

3. 결과: "스위트 스팟(최적의 지점)"

그들은 여섯 모델 모두를 동일한 데이터로 학습시켰고, 얼마나 잘 숨겨진 유전자를 맞혔는지 측정했습니다.

  • 좋은 소식: 언어 모델과 마찬가지로, AI가 커질수록 유전자를 더 잘 맞혔습니다. 오차율은 매끄럽고 예측 가능한 곡선을 그리며 감소했습니다. 이는 단일 세포 생물학에도 신경 스케일링 법칙(neural scaling laws)이 존재함을 증명합니다.
  • 함정 (수익 체감): 곡선이 완만해지기 시작했습니다. AI가 약 2,000만 개의 파라미터(중간 크기)에 도달했을 때, 그보다 더 크게 만드는 것(1억 개까지)은 큰 도움이 되지 않았습니다. 그것은 마치 이미 99% 차 있는 양동이에 물을 더 붓는 것과 같았습니다. 더 많은 물(컴퓨팅 파워)을 추가해도 물의 높이는 거의 변하지 않았습니다.

4. "노이즈" 바닥: 학습할 수 없는 것은 무엇인가?

가장 크고 똑똑한 AI조차 완벽한 점수를 얻을 수는 없었습니다. 오차가 멈추는 "바닥"이 존재했습니다.

연구진은 자문했습니다: 이것이 AI가 아직 너무 멍청해서일까, 아니면 데이터 자체가 지저분하기 때문일까?

그들은 완벽한 AI라 할지라도 추측하려는 유전자마다 2.3 비트(bits)의 정보만큼은 틀릴 것이라고 계산했습니다.

  • 비유: 친구가 시끄러운 방 안에서 속삭이는 소리를 들으려고 노력한다고 상상해 보세요. 당신이 세상에서 가장 좋은 귀(가장 큰 AI)를 가지고 있더라도, 방이 너무 시끄럽거나(생물학적 노이즈) 친구가 말을 흐릿하게 하기 때문에(기술적 한계) 완벽하게 들을 수는 없습니다.
  • 발견: 이 "2.3 비트"는 **줄일 수 없는 불확실성(irreducible uncertainty)**을 나타냅니다. 이는 현재의 데이터와 처리 방식 하에서 유전자 발현이 얼마나 예측 가능한지에 대한 한계치입니다. 이것은 우주의 보편적인 법칙이 아니라, 이 특정 실험에 대한 한계입니다.

5. 데이터 크기에 대한 경고

연구진은 또한 AI의 크기는 동일하게 유지하면서 입력하는 데이터의 양을 바꾸는 다른 실험도 진행했습니다.

  • 놀라운 사실: 단순히 AI에게 더 많은 데이터를 주되, 더 오래 학습시키지 않으면 성능이 개선되지 않았습니다.
  • 교훈: 단순히 더 큰 책 도서관(데이터)을 갖는 것만이 중요한 것이 아니라, 학생이 그 책들을 얼마나 오래 읽게 하느냐(학습 단계)가 중요합니다. 만약 학생에게 백만 권의 책을 주고 딱 10분 동안만 읽게 한다면, 백 권의 책을 주고 10분 동안 읽게 했을 때보다 더 많이 배우지는 못할 것입니다.

요약

이 논문은 더 큰 AI 모델이 생물학에서도 더 효과적임을 처음으로 증명했지만, 오직 특정 지점까지만 그렇다는 것을 보여줍니다.

  1. 스케일링은 작동합니다: 더 큰 모델이 유전자 활동을 더 잘 예측합니다.
  2. 한계가 있습니다: 약 2,000만 개의 파라미터 근처에서는 모델을 더 키우는 것이 비용 대비 효율적이지 않습니다.
  3. 노이즈 한계가 있습니다: 완벽한 모델이라도 생물학이 본질적으로 "노이즈"가 많고 예측 불가능하기 때문에(약 2.3 비트의 불확실성) 모든 것을 예측할 수는 없습니다.
  4. 학습이 중요합니다: 모델의 크기, 데이터의 양, 그리고 학습에 투입되는 시간 사이의 균형을 맞춰야 합니다.

이것이 미래에 갖는 의미:
이 논문은 과학자들이 무턱대고 거대한 모델만을 계속 만들어서는 안 된다는 점을 시사합니다. 대신, 세포가 어떻게 행동하는지 예측하는 데 왜 한계가 존재하는지를 정확히 이해하기 위해 더 나은, 더 깨끗한 데이터를 확보하고 더 스마트한 실험을 수행하는 데 집중해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →