← 최신 논문
💻 bioinformatics

Pretrained gene representations transfer mean expression more broadly than spatial patterns in virtual spatial transcriptomics

이 연구는 가상 공간 전사체학에서 사전 학습된 유전자 표현형이 유전자의 공간적 변이보다는 조직 전반에 걸친 유전자의 평균 발현 예측을 주로 향상시킨다는 점을 입증하며, 이는 유전자 간 일반화가 특정 공간 패턴의 회복보다는 광범위한 발현 전이에 의해 주도된다는 것을 보여준다.

원저자: Chen, T., Hicks, S. C.

게시일 2026-09-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chen, T., Hicks, S. C.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

모든 건물이 비밀스러운 도서관을 품고 있고, 그 도서관 안에는 수천 권의 책들이 서로 다른 페이지를 펼친 채 놓여 있는 한 도시를 상상해 보십시오. 인체에서 이 건물들은 세포이며, 책은 유전자입니다. 수십 년 동안 과학자들은 단일 세포에서 어떤 책이 펼쳐져 있는지는 읽을 수 있었지만, 그 세포들이 장기의 복잡한 조직 내 어디에 위치하는지는 파악하는 데 어려움을 겪어 왔습니다. 유전자 활동의 전체 지도를 얻기 위해, 연구자들은 전통적으로 조직의 물리적 단면을 채취하여 비용이 많이 들고 시간이 오래 걸리는 테스트를 수행해야 했습니다. 이는 신체의 얼마나 많은 부분을 한 번에 연구할 수 있는지에 제한을 둡니다. '가상 공간 전사체학(virtual spatial transcriptomics)'이라 불리는 새로운 접근 방식은 인공지능을 사용하여 이 문제를 해결하고자 합니다. 모든 유전자에 대해 매번 새로운 테스트를 실행하는 대신, 컴퓨터는 조직의 표준 사진을 보고 어떤 유전자가 활성화되어 있는지, 그리고 어디에 있는지를 예측합니다. 컴퓨터가 조직 이미지 속의 패턴을 인식하도록 학습시킨다면, 가보지 않은 새로운 영역에 대해서도 유전자의 위치를 추측할 수 있게 되어, 추가적인 실험실 작업 없이도 지도의 범위를 새로운 영역으로 확장할 수 있다는 것이 이 기술의 희망입니다.

연구자들이 던진 핵심 질문은, 이 컴퓨터 모델들이 실제로 조직 전반에 걸친 유전자 활동의 복잡하고 변화무쌍한 패턴을 학습하고 있는 것인지, 아니면 단순히 존재하는 유전자의 평균량을 매우 잘 추측하고 있는 것인지였습니다. 모델이 유전자의 위치를 예측할 때, 모델은 두 가지 일을 동시에 수행합니다. 즉, 해당 유전자의 전체적인 수준을 추정하는 것과, 그 수준이 한 지점에서 다른 지점으로 어떻게 변하는지를 파악하는 것입니다. 모델은 모든 위치에 동일한 평균값을 할당함으로써 성공적인 것처럼 보일 수 있는데, 이는 전체 양에 대한 예측은 잘 해내는 것처럼 보일지라도 유전자가 실제로 어디에 집중되어 있는지에 대한 정교한 세부 사항을 포착하는 데는 실패하게 됩니다. 진실을 밝히기 위해, 연구자들은 이 두 가지 능력을 분리할 수 있는 시스템을 구축했습니다. 그들은 모델이 학습 과정에서 본 적 없는 유전자를 대상으로 테스트하며, 모델이 새로운 환자에게서도 해당 유전자의 평균 수준과 특정한 공간적 패턴을 여전히 예측할 수 있는지 확인했습니다.

연구자들은 뇌의 세 가지 서로 다른 영역과 유방암 유형을 포함한 네 가지 서로 다른 인간 조직 샘플 집단에 대해 이 아이디어들을 테스트했습니다. 그들은 방대한 양의 유전자를 바탕으로 모델을 학습시킨 후, 시스템에 완전히 새로운 수백 개의 유전자가 보여주는 행동을 예측하도록 도전 과제를 부여했습니다. 그들은 두 가지 유형의 '사전 학습된 유전자 표현(pre-trained gene representations)'을 사용했는데, 이는 방대한 생물학적 데이터로부터 유전자의 정체성을 추출한 디지털 요약본입니다. 한 가지 유형의 요약은 유전자 주변의 DNA 서열에서 오고, 다른 하나는 단일 세포 내에서의 유전자 거동에서 옵니다. 모델이 새로운 유전자들을 예측하려고 시도했을 때, 결과는 성능의 명확한 격차를 보여주었습니다. 모델들은 이 보이지 않는 유전자들의 평균 발현 수준을 예측하는 데 매우 성공적이었습니다. 실제로 모델의 전반적인 정확도가 향상되었을 때, 그 향상의 90% 이상은 단순히 유전자의 평균량을 정확하게 맞히는 것에서 기인했습니다.

그러나 특정 공간적 패턴, 즉 유전자 활동의 '어디'를 복구하는 능력은 훨씬 더 제한적이었습니다. 연구자들은 모델이 학습 데이터에서 이미 높은 변동성을 보였던 유전자들에 대해서만 공간적 예측 능력이 향상된다는 것을 발견했습니다. 대부분의 유전자에 대해, 컴퓨터는 해당 유전자가 평균적으로 얼마나 존재하는지는 말해줄 수 있었지만, 조직 내 어디에 그 유전자가 집중되어 있는지는 신뢰할 수 있게 알려주지 못했습니다. 모델이 실제로 조직 이미지를 사용하여 이러한 패턴을 찾아내는 것이 아님을 증명하기 위해, 연구자들은 두 번째 테스트를 수행했습니다. 그들은 유전자의 디지털 요약본만을 보고 조직 사진은 완전히 무시하는 단순화된 버전의 모델을 만들었습니다. 놀랍게도, 이미지를 배제한 이 모델은 전체 모델이 달성했던 평균 유전자 수준 예측의 향상분을 거의 그대로 유지했습니다. 이는 사전 학습된 유전자 요약본이 유전자의 평균 수준에 대한 정보를 담고 있었을 뿐, 조직 이미지는 새로운 대상들에 대한 유전자의 구체적인 위치에 관한 새로운 정보를 거의 추가하지 않았음을 입증했습니다.

이 연구는 또한 유전자 표현의 유형이 중요하다는 점을 밝혀냈습니다. 두 종류의 요약 모두 평균 수준을 예측하는 데는 도움이 되었지만, 어떤 특정 유전자가 공간적 정확도 향상에 기여하는지는 서로 달랐습니다. 어떤 유전자는 한 유형의 요약으로부터 도움을 받았고, 다른 유전자는 다른 유형으로부터 도움을 받았습니다. 이는 알려진 유전자로부터 새로운 유전자로 지식을 전달하는 능력이 단일하고 균일한 기술이 아님을 시사합니다. 대신, 이는 두 가지 별개의 능력, 즉 유전자가 얼마나 존재하는지를 추정하는 광범위한 능력과, 그 정밀한 위치를 지도화하는 선택적이고 어려운 능력의 조합입니다. 연구자들은 이러한 가상 도구들이 우리가 연구할 수 있는 유전자의 목록을 확장하는 데는 강력하지만, 모든 유전자에 대해 조직의 복잡한 공간적 구조를 아직 완전히 포착하고 있지는 못하다고 결론지었습니다. 평균 수준을 예측하는 데 있어 이 모델들의 성공은 중요한 진전이지만, 새로운 유전자의 상세한 공간적 패턴을 정확하게 재구성하는 과제는 여전히 진행 중인 작업으로 남아 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →