← 최신 논문
💻 bioinformatics

Do Geometric Outliers Identify Important Genes in Single-Cell Foundation Models?

단일 세포 파운데이션 모델들은 리보솜 농축과 같은 유전자 임베딩에서의 일부 공유된 구조적 패턴을 나타내지만, 기하학적 이상치는 주로 모델 특이적이며 생물학적으로 중요한 유전자나 질병 관련 표적을 신뢰성 있게 식별하지 못한다.

원저자: Whalley, J. P.

게시일 2026-08-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Whalley, J. P.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

당신이 활기찬 도시 속의 미스터리를 풀려는 탐정이라고 상상해 보세요. 이 도시는 벽돌과 모르타르로 만들어진 것이 아니라, 모든 살아있는 세포 내부의 작은 지침인 "유전자"들로 이루어져 있습니다. 오랫동안 과학자들은 이 도시를 지도화하려고 노력해 왔지만, 최근에 그들은 새로운 것을 구축했습니다: 거대하고 초지능적인 컴퓨터 뇌인 "파운데이션 모델(foundation models)"입니다. 이 모델들을 모든 책(유전자)을 읽고 그것들이 서로 어떻게 연관되어 있는지 학습한 거대한 도서관이라고 생각할 수 있습니다. 이들은 각 유전자를 거대한 보이지 않는 3D 공간 속의 고유한 좌표로 변환합니다. 만약 두 유전자가 이 공간에서 이웃한다면, 컴퓨터는 그들이 절친한 친구라고 생각합니다. 만약 멀리 떨어져 있다면, 그들은 타인입니다.

과학자들은 이 지도의 가장자리(가장 "이상하거나" "특이한" 유전자, 즉 기하학적 이상치(geometric outliers)를 찾는 것)를 살펴본다면, 질병을 일으키거나 생명의 비밀을 간직한 가장 중요한 유전자를 찾을 수 있을 것이라 기대했습니다. 이는 마치 붐비는 무도회장의 가장자리에 홀로 서 있는 사람이 방 안에서 가장 흥미로운 사람임이 틀림없다고 생각하는 것과 같습니다. 하지만 여기서 큰 질문이 생깁니다. 그 사람은 실제로 특별한 존재일까요, 아니면 단지 DJ(컴퓨터 모델)가 음악을 이상하게 배치했기 때문에 그곳에 서 있는 것일까요? 이 논문은 이러한 "이상한" 지점들이 실제 생물학적 중요성을 가리키는지, 아니면 단지 디지털상의 특이점인지 조사합니다.


거대한 지도의 불일치

이 연구에서 저자인 저스틴 월리(Justin Whalley)는 단일 세포 생물학에 사용되는 가장 유명한 세 가지 "컴퓨터 뇌", 즉 Geneformer, scGPT, scFoundation을 테스트하기로 했습니다. 이 세 모델을 동일한 도시를 그리려고 노력하지만, 서로 다른 도구와 서로 다른 지도, 그리고 거리의 배치 규칙을 사용하는 세 명의 지도 제작자로 생각할 수 있습니다.

월리는 동일한 "이상치 탐지기(outlier detector)"를 세 모델 모두에 적용했습니다. 그는 지도의 중심에서 이상하게 멀리 떨어져 있거나 군중 속에 홀로 서 있는 유전자들을 찾아냈습니다. 결과는 다소 충격적이었습니다. 세 모델은 누가 "괴짜"인지에 대해 전혀 동의하지 않았습니다. 이는 마치 당신이 세 명의 친구에게 방 안에서 가장 특이한 사람 다섯 명을 골라달라고 요청했는데, 그들이 모두 완전히 다른 사람들을 골라낸 것과 같습니다.

  • GeneformerscGPT(유전자를 문장 속의 단어처럼 취급하는 두 모델)는 서로 조금 더 일치했지만, 그조차도 "이상한" 유전자를 아주 적은 비율로만 공유했습니다.
  • scFoundation(유전자를 연속적인 숫자로 취급하는 모델)은 완전히 다른 집합의 이상치를 선택했습니다.

그들이 유일하게 일치했던 때는 세포의 발전소(미토콘드리아)나 단백질 공장(리보솜)을 만드는 것과 같은 매우 지루하고 흔한 유전자들에 대해서였습니다. 하지만 진정으로 독특한 유전자에 대해서는, 모델들이 서로 다른 노래를 부르고 있었습니다.

"괴짜"들은 진짜인가, 아니면 단순한 오류인가?

이 연구의 큰 희망은 이러한 기하학적 이상치들이 그들의 단백질 구조 때문에 특별할 것이라는 점이었습니다. 예를 들어, 실제 생명체 내에서 특이한 모양을 가진 유전자 같은 것 말입니다. 이를 테스트하기 위해, 저자는 순수 단백질 코드만을 살펴보는 완전히 다른 시스템(ESM-2라고 불리는)에서도 이 "이상한" 유전자들이 이상하게 나타나는지 확인했습니다.

결과는 대부분 아니오였습니다. 단일 세포 모델에서 이상하게 보였던 대부분의 유전자는 단백질 시스템에서는 지극히 정상적이었습니다. 이는 "이상함"이 유전자 자체의 속성이 아니라, 해당 특정 컴퓨터 모델이 자신의 지도를 배치하기로 결정한 방식의 특이점임을 시사합니다. 이는 마치 GPS가 소프트웨어 버그 때문에 우연히 빵집을 달 위에 배치한 것과 같습니다. 빵집이 실제로 달에 있는 것이 아니라, 지도가 잘못된 것입니다.

"삭제하고 관찰하기" 테스트

그렇다면 이 유전자들이 디지털 오류라면, 그것이 중요할까요? 저자는 이 "이상치" 유전자들이 컴퓨터가 알아야 할 가장 중요한 유전자들인지 알고 싶었습니다. 그는 영리한 실험을 수행했습니다: 그는 Geneformer 모델에서 가장 "이상한" 상위 50개의 유전자를 가져와서, 마치 존재하지 않는 것처럼 가정하고(입력값에서 삭제하고) 컴퓨터가 다양한 유형의 세포를 식별하도록 했습니다.

만약 이 유전자들이 모델이 의존하는 "비법 소스"였다면, 컴퓨터는 작동이 멈추거나 매우 혼란스러워했어야 합니다. 하지만 그렇지 않았습니다. 컴퓨터는 그 유전자들을 삭제했을 때도, 신체 내 사용량이나 길이 등 다른 모든 면에서 유사하도록 정교하게 매칭된 50개의 무작위 유전자를 삭제했을 때와 마찬가지로 똑같이 잘 작동했습니다.

실제로 "이상한" 유전자를 삭제해도 성능 저하는 거의 발생하지 않았습니다(almost no drop in performance). 저자는 또한 이 유전자들이 인간의 질병과 연관되어 있는지(ClinVar라는 데이터베이스를 사용하여) 확인했습니다. 다른 요인들을 조정한 후에도, "이상한" 유전자들은 다른 어떤 유전자들보다 질병과 관련될 가능성이 높지 않았습니다.

결론

이 논문은 기하학적 이상치들이 컴퓨터 모델이 어떻게 구축되었는지 이해하는 데는 흥고하지만, 중요한 유전자를 찾는 마법의 탄환은 아니라고 결론짓습니다.

  • 발견한 점: "이상한" 유전자들은 주로 모델의 내부 수학에 특이적인 것이지, 유전자의 생물학적 특성이 아닙니다.
  • 배제한 점: 모델의 지도에서 유전자가 "이상치"라는 것이 자동으로 세포 기능이나 질병에 중요하다는 생각입니다.
  • 시사점: 이러한 "이상한" 목록을 맹목적으로 신뢰하기보다는, 과학자들이 모델 자체를 감사(audit)하는 데—즉, 컴퓨터가 올바른 것을 배우고 있는지 확인하는 데—이러한 기하학적 검사를 사용해야 합니다. 이는 AI의 세계에서, 때때로 가장 특이한 것들은 현실의 반영이 아니라 기계 자신의 상상력의 결과일 수 있다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →