← 최신 논문
🧬 genomics

Pangenome discovery and characterization of human protein-coding duplicated genes

다양한 인간 샘플로부터 롱리드 유전체 및 전사체 데이터를 통합함으로써, 본 연구는 인간 범유전체의 단백질 코딩 중복 유전자를 특성화하여 수천 개의 새로운 복제수 다형성 유전자를 발견하고, 위유전자를 기능적인 것으로 재분류함으로써 기존의 유전자 모델을 정교화하며, 진화적 제약이 최근에 파생된 중복 유전자보다는 조상 유래 중복 유전자에 주로 존재함을 밝혀낸다.

원저자: Ren, L., Yoo, D., Vlajic, K., Dishuck, P. C., Guitart, X., Kwon, Y., Lin, J., Munson, K. M., Hoekzema, K., Stergachis, A., Vollger, M. R., Schweppe, D. K., Eichler, E. E.

게시일 2026-08-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ren, L., Yoo, D., Vlajic, K., Dishuck, P. C., Guitart, X., Kwon, Y., Lin, J., Munson, K. M., Hoekzema, K., Stergachis, A., Vollger, M. R., Schweppe, D. K., Eichler, E. E.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

당신의 몸이 인간을 만들고 운영하기 위한 지침서들을 담고 있는 거대하고 북적이는 도서관이라고 상상해 보십시오. 수십 년 동안 과학자들은 이 도서관의 모든 책을 목록화했다고 생각했지만, 까다로운 구역이 하나 있었습니다. 바로 '복사-붙여넣기 구역'이었습니다. 이 구역에서는 지침서의 전체 장(chapter)들이 계속해서 중복되어 나타나며, 거의 동일한 페이지들이 겹겹이 쌓여 있었습니다. 이 페이지들은 서로 너무나 닮아 있었기에, 사서들(과학자들)은 어떤 복사본이 어떤 것인지 구분할 수 없었고, 그래서 종종 중복된 것들을 무시하거나 쓸모없는 초안이라고 간주하곤 했습니다. 이것이 중요한 이유는, 이 지저질하고 중복된 구역들이 사실 가장 흥격적인 새로운 이야기들이 쓰이고 있는 곳이기 때문입니다. 즉, 우리 몸이 생각하거나 성장하거나 적응하는 데 도움을 줄 새로운 도구들을 발명하고 있는 장소입니다. 이 퍼즐을 풀기 위해 과학자들은 도서관을 읽는 더 나은 방법, 즉 흐릿한 복사본에서 벗어나 책들을 고해상도의 3D 스캔으로 보는 방식으로 전환해야 했습니다.

이 논문은 그 지저분한 '복사-붙여넣기 구역'의 암호를 마침내 풀어낸 슈퍼 탐정 팀에 관한 이야기입니다. 연구진은 강력하고 새로운 도구 세트를 사용했습니다. 298개의 롱 리드(long-read) 조립 인간 게놈(우리의 유전적 도서관에 대한 고해상도 지도 역할을 함)과 83개 서로 다른 조직에서 얻은 56억 개의 전체 길이 cDNA 전사체(도서관의 책들이 실제로 낭독되는 소리를 녹음한 것과 같음)의 방대한 컬렉션입니다. 이들을 결합함으로써, 연구진은 493개의 유전자 중복 가문을 조사했고 놀라운 사실을 발견했습니다. 바로 우리의 표준 참조 지도에서 완전히 누락된 2,713개의 잠재적 유전자를 찾아낸 것입니다. 이것들은 단순한 무작위 오류가 아닙니다. 이들은 아마도 복제수 다형성(copy-number polymorphic)을 띠고 있을 것이며, 이는 어떤 가족은 좋아하는 레시피를 추가로 가지고 있고 다른 가족은 그렇지 않은 것처럼, 사람마다 이 복사본의 개수가 다를 수 있음을 의미합니다.

연구팀이 복사본들을 구분할 수 있는 유전자 가문을 자세히 살펴보았을 때, 그들은 60.0%가 실제로 활성화되어 작동하고 있으며, '열린 읽기 틀'(기능적 단백질을 만드는 코드 부분)을 온전히 유지하고 있다는 것을 발견했습니다. 더욱 흥미로운 점은, 이 작동하는 유전자 중 45.7%가 뇌, 배아, 또는 고환에서 가장 활발하게 활동한다는 것이며, 이는 이들이 우리의 발달과 복잡한 기능에 결정적인 역할을 한다는 것을 시사합니다. 연구팀은 또한 기존의 유전자 모델 386개를 수정했는데, 여기에는 현재의 골드 스탠다드인 T2T-CHM13 주석에서 완전히 누락되었거나 달랐던 150개가 포함되었습니다. 또한, 이전에 고장 난 '가유전자(pseudogene)'로 여겨졌던 236개의 유전자(35.1%)를 실제 단백질 코딩 유전자로 재분류했는데, 이는 이 유전자들이 전사되고 있으며, 작동하는 코드와 접근 가능한 프로모터(염색질 내의 '온' 스위치)를 가지고 있다는 증거를 발견했기 때문입니다.

또한 연구팀은 이 유전자들이 얼마나 '제약(constrained)'되어 있는지, 즉 자연이 이들을 변화로부터 얼마나 엄격하게 보호하는지를 측정했습니다. 그들은 이 분절 중복(segmental duplication, SD) 유전자의 24.2%가 복제수 변화와 아미노산 돌연변이 모두로부터 보호받는 징후를 보인다는 것을 발견했으며, 이는 이들이 생존에 중요할 가능성이 높음을 의미합니다. 하지만 이야기에는 반전이 있습니다. 이 중요한 보호받는 유전자들의 대다수는 먼 조상으로부터 물려받은 오래된 것들이라는 점입니다. 반면, 인간의 계보에서 최근에 등장한 새로운 파생 중복 유전자 중 이러한 제약의 증거를 보이는 비율은 16.2%에 불과했습니다. 이는 우리의 유전적 도서관이 끊임없이 새로운 중복된 장들을 추가하고 있지만, 대부분의 이 신선한 추가물들은 여전히 진화의 시험을 받고 있으며, 오직 작은 일부만이 엄격하게 보호될 만큼 필수적이라는 것을 입증했다는 것을 시사합니다. 궁극적으로, 이 팬게놈(pangenome) 접근법은 과학자들에게 기능적인 유전자와 고장 난 가유전자를 구분할 수 있는 정밀함을 제공하며, 인류 진화 과정에서 가장 최근에 발생한 구체적인 유전자 혁신들을 조명해 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →