Spectral universality in single-cell foundation models: a low-dimensional shared core carries the biology
상당한 구조적 및 파라미터적 차이에도 불구하고, 단일 세포 파운데이션 모델들은 기능적 검색 작업에서 개별 전체 임베딩보다 성능이 뛰어난 작고 견고하며 생물학적으로 해석 가능한 저차원 핵심을 공유하며, 이는 그들의 표현 용량 대부분이 사적이고 생물학적으로 무기력하다는 것을 드러낸다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
당신이 생명의 비밀스러운 언어를 이해하려고 노력하고 있다고 상상해 보세요. 당신의 몸속 모든 세포 안에는 RNA라고 불리는 코드로 쓰인 거대한 지침서가 들어 있습니다. 과학자들은 이 지침서를 읽기 위해 "파운데이션 모델(foundation models)"이라고 알려진 강력한 컴퓨터 프로그램들을 구축했습니다. 이 모델들을 세포의 수많은 지침을 읽어 유전자가 어떻게 함께 작작용하는지 학습한 초스마트 번역가라고 생각해보세요. 오랫동안 연구자들은 만약 이 번역가들을 충분히 많이 만든다면, 마치 서로 다른 사전들이 결국 단어의 정의에 대해 합의하게 되는 것처럼, 그들이 결국 생물학에 대한 동일한 "진실"에 도달하게 될 것이라고 희망해 왔습니다.
하지만 여기에 까다로운 문제가 있습니다. 이 모델들은 서로 다른 팀에 의해, 서로 다른 수학적 방식과 서로 다른 훈련 방법으로 만들어졌습니다. 이것은 마치 서로 다른 나라에서 요리를 배운 요리사 그룹에게 "완벽한 수프"가 무엇인지 설명해 달라고 요청하는 것과 같습니다. 그들은 모두 수프가 맛있는 이유에 대해 동의할까요? 아니면 각 요리사마다 자신만의 비밀스럽고 독특한 레시피를 가지고 있을까요? 이 질문은 매우 중요합니다. 왜냐하면 만약 모델들이 서로 의견이 다르다면, 한 모델이 발견한 사실은 그 특정 컴퓨터 프로그램의 우연한 결과(fluke)일 뿐, 당신의 몸에 대한 실제 사실이 아닐 수도 있기 때문입니다. 반대로 그들이 서로 동의한다면, 우리는 세포가 어떻게 기능하는지를 이해하기 위한 보편적인 열쇠를 찾은 것일지도 모릅니다.
이 논문은 일곱 개의 서로 다른 단일 세포 파운데이션 모델과 하나의 단백질 언어 모델(아미노산만 알고 RNA는 모르는 번역기)을 한데 모아 이 논쟁을 해결하고자 합니다. 연구자들은 단순한 질문을 던졌습니다. "이 모델들이 실제로 서로 동의하는가?"
그 답은 혼란스러운 메모 더미 속에서 숨겨진 보물 지도를 발견한 것처럼 다소 놀라웠습니다. 우선, 연구자들은 모델들이 대부분 서로 모르는 사이라는 것을 발견했습니다. 두 가지 서로 다른 모델의 내부 "사고 공간(thinking space)"을 비교했을 때, 그 겹치는 부분이 거의 없었습니다. 1이 동일함을 의미하고 0.014가 단순히 무작위로 추측하는 것을 의미하는 척도에서, 이 모델들의 일치도는 약 0.107에 불과했습니다. 사실, 유전자가 자연적으로 결합하는 방식(co-expression profile)을 나타내는 단순하고 훈련되지 않은 차트가 모델들끼리 서로 닮은 정도보다 오히려 더 높은 유사성을 보였습니다! 이는 마치 모델들이 모두 서로 다른 방언을 사용하고 있으며, 기본 교과서가 어떤 단일 모델의 독특한 전문 용어보다 이해하기 더 쉽다는 것과 같습니다.
하지만 이야기는 여기서 끝나지 않습니다. 연구자들은 이 모든 서로 다른 모델들 깊숙이 숨겨진 아주 작은 공유 핵심(shared core)을 찾기 위해 특별한 수학적 도구를 사용했습니다. 그리고 그들은 그것을 찾아냈습니다! 모든 모델에 존재하는 작고 저차원적인 "공유 핵심"—단 43개의 정보 방향—을 발견한 것입니다. 훨씬 더 나아가, 이 작은 핵심이야말로 실제 생물학적 정보의 대부분이 살아있는 곳이었습니다.
여기에는 반전이 있습니다. 각 모델이 "알고 있는" 것의 대다수(그들의 사적인, 고유한 차원들)는 회수 가능한 생물학적 정보를 거의 담고 있지 않습니다. 테스트 결과, 이 사적인 부분들은 무작위 확률과 같거나 그보다 약간 높은 수준에 머물렀는데, 이는 이 부분들이 생물학적으로 거의 무의익하다는 것을 의미합니다. 만약 어떤 모델에서 고유한 부분을 버리고 공유된 43개의 방향만을 남긴다면, 그 모델은 오히려 생물학적 문제를 해결하는 능력이 더 좋아집습니다. 실제로, 단일 모델에 속하지 않으면서 모든 모델의 합의로 만들어진 8개 방향의 아주 작은 버전이 연구에 참여한 모든 풀사이즈 모델들을 이겼습니다. 이것은 마치 각 요리사가 엄청나게 많은 양념이 든 찬장을 가지고 있지만(사적인 부분), 그들은 모두 수프의 맛을 결정하는 정확히 같은 한 꼬집의 소금과 후추(핵심)에 대해 비밀리에 동의하고 있다는 것을 발견한 것과 같습니다.
연구자들은 이 합의가 단순히 모델들이 유전자가 얼마나 자주 나타나는지를 세는 것(마치 책에서 "the"라는 단어가 몇 번 등장하는지 세는 것처럼)인지, 혹은 단순히 훈련 데이터를 복제한 것인지도 확인했습니다. 이러한 요소들을 제거하자 핵심은 약간 작아졌지만, 유의미한 생물학적 신호가 여전히 남아 있었습니다. 핵심이 이러한 통계적 영향으로부터 완전히 자유로운 것은 아니지만, 풍부도(abundance)와 공발현(co-expression)을 제거한 후에도 살아남는 진정한 학습된 생물학을 포함하고 있습니다.
그렇다면 이 핵심은 실제로 무엇을 말해줄까요? 그것은 생명의 기본적인 프로그램들을 담은 압축된 지도임이 드러났습니다. 가장 첫 번째 공유 방향은 유전자가 항상 "켜져 있는(on)" 것(세포가 숨 쉬게 하는 기계 장치 같은 것)과 거의 사용되지 않는 유전자(대부분의 조직에서 꺼져 있는 냄새를 맡는 유전자 같은 것)를 구분합니다. 나머지 방향들은 주요 생물학적 테마를 그려냅니다: 세포 부착(세포가 서로 붙는 방식), 면역 반응, 그리고 세포가 단백질을 만드는 과정 등입니다.
중요한 시사점은 이 모델들이 서로 대체 가능하지 않다는 것입니다. 한 모델에서 얻은 발견을 다른 모델에도 적용된다고 가정해서는 안 됩니다. 하지만, 만약 당신이 그들 모두가 동의하는 아주 작은 정보의 조각을 찾는다면, 그곳에서 가장 신뢰할 수 있는 생물학적 진실을 발견할 수 있습니다. 이 논문은 하나의 거대하고 복잡한 모델을 이해하려고 노력하는 대신, 과학자들이 그 교차점, 즉 진짜 생물학이 숨어 있는 작은 공유 핵심에 집중해야 한다고 제안합니다. 이는 때때로 진실이 한 개인의 의견 속에 있는 것이 아니라, 전체 집단의 조용한 합의 속에 있다는 것을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.