← 최신 논문
🧬 biology

Information-theoretic profiling of structural organization in human genes

본 연구는 쿨백-라이블러 클러스터 엔트로피에 기반한 정보 이론적 클러스터링 프레임워크를 사용하여 후성유전적 조절 및 신경 발달 장애에 관여하는 특정 인간 유전자의 구조적 조직을 분석하며, 이를 통해 도출된 엔트로비 프로파일이 비교 유전체학 및 기능적 유전자 특성 규명에 있어 견고하고 유용함을 입증한다.

원저자: Chiara Panico, Filippo Gandino, Renato Ferrero, Anna Carbone

게시일 2026-09-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chiara Panico, Filippo Gandino, Renato Ferrero, Anna Carbone

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

인간의 게놈은 인간을 만들고 운영하기 위한 지침을 담고 있는 거대한 도서관입니다. 이것은 DNA의 구성 성분을 나타내는 네 개의 글자로 이루어진 화학적 코드로 쓰여 있습니다. 수십 년 동안 과학자들은 생명이 어떻게 작동하는지 이해하기 위해 이 책의 구체적인 단어들, 즉 단백질을 코딩하는 유전자들을 읽는 데 집중해 왔습니다. 그러나 이 단어들 사이의 공간과 단어 내에서 글자들이 배열되는 방식은 또 다른 종류의 비밀을 간직하고 있습니다. 이 영역들은 단순한 빈 채움용 요소가 아닙니다. 이들은 유전자가 언제 어디서 켜지고 꺼지는지를 조절하는 데 도움을 주는 복잡한 조직화 패턴을 포함하고 있습니다. 이러한 숨겨진 구조를 이해하기 위해, 연구자들은 원래 정보와 불확실성을 측정하기 위해 개발된 수학의 한 분과로 눈을 돌리고 있습니다. DNA 서열을 데이터 스트림으로 취급함으로써, 그들은 서열을 다른 종과 정렬하거나 비교할 필요 없이 유전 코드가 어떻게 조직되어 있는지 보여주는 통계적 패턴을 찾아낼 수 있습니다. 이 접근 방식은 그들이 게놈의 "질감"을 파악하여, 고도로 질서 정연하게 행동하는 영역과 더 무작위적으로 보이는 영역을 식별할 수 있게 해줍니다.

최근 이탈리아의 폴리테크니코 디 토리노(Politecnico di Torino) 연구진은 이 정보 기반 접근 방식을 DNA가 어떻게 패키징되고 읽히는지를 조절하는 데 관여하는 것으로 알려진 다섯 가지 특정 인간 유전자에 적용했습니다. ASH1L, NSD1, NSD2, NSD3, SETD2라고 불리는 이 유전자들은 발달에 매우 중요하며, 기능 장애가 발생할 경우 다양한 질병과 연결됩니다. 연구팀은 이 유전자들의 수학적 "지문"이 내부 구조를 드러낼 수 있는지 확인하고자 했습니다. 그들은 긴 DNA 글자 문자열을 일련의 숫자로 변환하는 것으로 시작했습니다. 이를 공정하게 수행하기 위해, 그들은 DNA 글자를 화학적 모양에 따라 두 가지 범주, 즉 고리가 두 개인 것과 하나인 것으로 분류했습니다. 이를 통해 각 유전자의 시작부터 전후 1,000글자까지의 균형 잡힌 수치 지도를 생성하여, 주변의 조절 환경까지 확실히 포착하도록 했습니다.

연구진은 창(window)을 서열을 따라 슬라이딩하며 작은 구간들을 한 번에 하나씩 살펴보는 방식으로 이 수치 지도를 분석했습니다. 각 구간에 대해, 그들은 글자들이 어떻게 서로 군집하는지를 측정하고 그 패턴을 일련의 컴퓨터 생성 모델과 비교했습니다. 이 모델들은 완전히 혼돈스러운 노이즈부터 시간의 흐름에 따른 상관관계를 가진 기상 시스템과 유사한 장거리 연결을 가진 패턴에 이르기까지, 다양한 유형의 무작위성을 나타냈습니다. 목표는 어떤 컴퓨터 모델이 실제 DNA 서열과 가장 잘 일치하는지 찾는 것이었습니다. 만약 어떤 DNA 구간이 순수한 무작위성과 정확히 일치한다면, 그 일치도는 완벽할 것입니다. 만약 그것이 특정한 비무작위적 구조를 보여준다면, 실제 DNA와 무작위 모델 사이의 수학적 거리(divergence)가 증가할 것입니다. 이 거리, 즉 발산은 해당 유전 부위가 얼마나 구조화되어 있는지를 보여주는 신호 역할을 했습니다.

결과는 다섯 가지 유전자 모두에서 놀랍고 일관된 패턴을 드러냈습니다. 단백질을 코딩하는 구간으로 알려진 엑손(exons)은 강력하고 뚜렷한 신호를 보여주었습니다. 이 코딩 영역들은 일관되게 무작위 모델로부터 벗어나 있었으며, 이는 이들이 특정한 조직화된 내부 구조를 가지고 있음을 나타냅니다. 반면, 유전자 길이의 대부분을 차지하는 비코딩 구간인 인트론(introns)은 훨씬 더 무작위적이고 상관관계가 없는 모델처럼 행동했습니다. 수학적 척도는 유전자의 "작동하는" 부분과 "간격" 부분을 효과적으로 구분해 냈습니다. 연구진이 이러한 수학적 프로필을 유전자의 알려진 생물학적 지도와 비교했을 때, 신호의 정점(peaks)은 단백질 코딩 엑손의 위치와 완벽하게 일치했습니다. 신호의 골(valleys)은 인트론에 해당했습니다.

이 발견은 정보 이론적 방법이 생물학적 기능을 미리 알 필요 없이 코딩 DNA와 비코딩 DNA를 구별할 수 있음을 시사합니다. 연구는 또한 유전자의 스위치 역할을 하는 프로모터(promoters) 및 인핸서(enhancers)와 같은 다른 조절 특징들도 조사했습니다. 수학적 신호와 이러한 조절 요소 사이의 연결은 덜 명확했으며 유전자마다 차이가 있었는데, 이는 코딩 구조는 이 방법으로 견고하게 포착되는 반면, 조절 스위치의 조직화는 더 복잡하고 맥락 의존적임을 시사합니다. 연구진은 코딩 영역에서의 신호 강도가 유전자의 크기 및 포함된 코딩 DNA의 양과 밀접하게 연관되어 있음을 발견했습니다.

이 연구는 인간 유전자의 구조적 조직이 감지 가능한 통계적 서명을 남긴다는 것을 입증합니다. 서열이 순수한 무작위성과 얼마나 다른지를 측정하는 방법을 사용하여, 연구진은 복잡한 유전자의 내부 아키텍처를 매핑할 수 있었습니다. 이 접근 방식은 데이터가 중첩되거나 중첩되지 않은 섹션에서 분석되더라도 일관되게 작동하며 견고함을 증명했습니다. 이 방법은 코딩 영역과 비코딩 영역을 명확히 구분하지만, 특정 조절 스위치를 정밀하게 찾아내는 능력은 여전히 발전 단계에 있습니다. 이 작업은 단순히 알려진 다른 서열들과 비교하는 것에 의존하기보다 서열 자체의 수학적 특성에 기반한, 게놈을 바라보는 새롭고 보완적인 방법을 제공합니다. 이는 결과적으로 과학자들이 게놈 내의 기능적 영역을 더 효율적으로 식별하는 데 도움을 주어, 생명을 지탱하기 위해 유전 코드가 어떻게 조직되어 있는지에 대한 더 깊은 이해를 제공할 수 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →