Reconstructing sequence-grammar trajectories enables interpretable and tunable cis-regulatory element design
이 논문은 향상된 활성도와 특이성을 가진 다양한 세포 유형별 시스 조절 요소를 설계하고 실험적으로 검증하기 위해, 하이브리드 Transformer-Mamba2 모델을 강화 학습 및 서열-문법 궤적 재구성과 결합한 해석 가능한 딥러닝 프레임워크인 GO-CRE를 제시한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
모든 세포 내부에는 생명이 어떻게 기능하는지를 규정하는 방대한 지시서 라이브러리가 있지만, 이 라이브러리에서 가장 중요한 부분은 유전자 그 자체가 아닙니다. 대신, 세포 생명의 진정한 지휘자는 cis-조절 요소(cis-regulatory elements)라고 알려진 짧고 스위치 같은 DNA 조각들입니다. 이 조각들은 디머 스위치(dimmer switches)나 온-오프 버튼처럼 작동하여, 특정 유전자가 언제 켜질지, 얼마나 크게 노래할지, 그리고 어떤 유형의 세포에서 작동할지를 알려줍니다. 이것들이 없다면 간 세포는 독소를 여과하는 법을 알 수 없을 것이고, 혈액 세포는 산소를 운반하는 법을 알 수 없을 것입니다. 수십 년 동안 과학자들은 이 스위치들을 읽어낼 수는 있었지만, 치료나 연구를 위해 세포를 제어할 새로운 스위치를 처음부터 설계하는 것은 심오한 과제로 남아 있었습니다. 그것은 마치 문법은 보이지 않고 단어가 사는 동네에 따라 규칙이 변하는 새로운 언어를 쓰려고 노력하는 것과 같습니다.
이제 한 연구팀이 이러한 유전적 스위치를 설계하는 새로운 방법을 개발하여, 한때 블랙박스였던 과정을 투명하고 조종 가능한 여정으로 바꾸어 놓았습니다. DNA 서열이 설계되는 동안 그것이 어떻게 진화하는지를 관찰하는 시스템을 구축함으로써, 그들은 생명의 '문법'이 어떻게 나타나는지를 정확히 볼 수 있게 되었습니다. 이 접근 방식은 특정 인간 세포 유형에서 높은 정밀도로 작동하는 합성 스위치를 제작할 수 있게 해주었으며, 우리 건강을 제어하는 유전 회로를 공학적으로 설계하는 데 더 명확한 길을 제시했습니다.
밍치안 마(Mingqian Ma)와 동료들이 이끄는 연구진은 GO-CRE(Guided Optimization of Cis-Regulatory Elements, cis-조절 요소의 유도 최적화)라고 부르는 프레임워크를 만들었습니다. 이 방식이 어떻게 작동하는지 이해하기 위해, 특정 세포 유형이 원하는 방식으로 반응하게 만드는 문장을 쓰려는 컴퓨터 프로그램을 상상해 보십시오. 과거에 과학자들은 인공지능이 수천 개의 DNA 서열을 생성하고, 이를 테스트한 뒤, 가장 좋은 것들이 작동하기를 바랐습니다. 이는 종종 시행착오 과정이었으며, 컴퓨터가 우연히 작동하는 해결책을 찾아내거나, 생물학을 진정으로 이해하지 못한 채 테스트를 속이는 단순하고 반복적인 패턴을 사용할 수도 있었습니다. 새로운 시스템은 설계 과정을 결승선을 향한 경주가 아니라, 여정의 지도처럼 다룸으로써 이 점을 변화시켰습니다.
그들의 방법의 핵심은 HybriDNA라고 불리는 강력한 컴퓨터 모델에 의존합니다. 이 모델은 수백 종의 방대한 DNA 컬렉션을 학습하여, 유전 정보가 어떻게 저장되고 읽히는지 규정하는 미묘한 패턴을 익혔습니다. 연구진은 이 모델을 사용하여 새로운 DNA 서열을 생성했지만, 거기서 멈추지 않았습니다. 그들은 컴퓨터가 서열을 개선하려고 시도할 때 발생하는 모든 작은 변화를 추적하는 관찰 레이어를 추가했습니다. 그들은 이러한 변화를 아주 작은 구성 요소들로 나누어, 특정 글자 조합의 빈도와 알려진 생물학적 태그의 존재가 시간이 지남에 따라 어떻게 변화하는지를 살펴보았습니다. 이를 통해 그들은 무작위 DNA 문자열에서 기능적인 스위치로 진화하는 서열이 거쳐온 궤적, 즉 경로를 재구성할 수 있었습니다.
연구팀이 HepG2라고 알려진 간 세포 유형에서 이러한 경로가 펼쳐지는 것을 관찰했을 때, 예상치 못한 사실을 발견했습니다. 서열들이 함정에 빠지고 있었던 것입니다. 컴퓨터는 단일 문자의 긴 반복 구간, 구체적으로는 G의 연속된 문자열을 만드는 방식으로 지름길을 찾고 있었는데, 모델은 이를 좋은 해결책이라고 잘못 판단했습니다. 이는 컴퓨터의 점수 체계는 만족시키지만 실제 작동하는 생물학적 스위치를 만들지는 못하는 저품질의 답이었습니다. 연구진은 이것이 실시간으로 일어나는 것을 볼 수 있었기에 개입할 수 있었습니다. 그들은 게임의 규칙을 조정하여 이러한 반복적인 문자열에 대한 페널티를 추가했습니다. 이 간단한 수정은 컴퓨터의 경로를 재지정하여, 함정에서 벗어나 더 복잡하고 생물학적으로 의미 있는 해결책으로 유도했습니다.
여정의 중간에서 설계 과정을 진단하고 수정할 수 있는 이러한 능력은, 성공적인 스위치 생성이 세 가지 뚜렷한 단계로 이루어진다는 것을 밝혀냈습니다. 첫째, 컴퓨터는 다양한 조합을 시도하며 넓게 탐색합니다. 다음으로, 컴퓨터는 특정 방향을 결정하며, 목표 세포 유형에 속하는 일련의 생물학적 특징들에 고정됩니다. 마지막으로, 컴퓨터는 서열의 핵심 정체성을 유지하면서 결과를 미세하게 조정합니다. 간 세포의 경우, 시스템은 정밀한 순서로 특정 조절 태그 팀을 조립하여 작고 효율적인 스위치를 만드는 법을 배웠습니다. 혈액 세포인 K562의 경우, 그 환경에 적합한 다른 태그 팀을 조립했습니다.
컴퓨터가 생성한 스위치들이 실제로 작동하는지 증명하기 위해, 연구진은 실험실에서 테스트를 진행했습니다. 그들은 해롭지 않은 바이러스를 사용하여 새로운 DNA 서열을 살아있는 간 및 혈액 세포에 삽입했습니다. 그런 다음 이 새로운 스위치들이 빛을 내는 리포터 유전자를 얼마나 잘 켜는지 측정했습니다. 결과는 놀라웠습니다. 간 세포를 위해 설계된 스위치는 간 세포에서 밝게 빛났지만 혈액 세포에서는 어두웠고, 그 반대의 경우도 마찬가지였습니다. 이는 컴퓨터가 세포 유형 특이적인 지시를 쓰는 법을 성공적으로 학습했음을 확인시켜 주었습니다. 나아가, 새로운 간 스위치는 평균적으로 인간 게놈에서 발견되는 자연적인 스위치보다 더 활발했는데, 이는 컴퓨터가 유전 코드를 조직하는 더 효율적인 방법을 찾아냈음을 시사합니다.
이 연구는 또한 모든 세포 유형을 설계하기가 똑같이 쉽지는 않다는 점을 강조했습니다. 시스템은 간과 혈액 세포에서는 눈부시게 성공했지만, 신경 세포 유형을 위한 특정 스위치를 만드는 데는 어려움을 겪었습니다. 이 경우, 컴퓨터의 경로는 흩어진 상태로 머물렀고 명확한 패턴에 안착하지 못했습니다. 이러한 실패는 성공만큼이나 유익한 정보를 제공했습니다. 즉, 시스템은 해당 특정 세포 유형에 대해 가용한 데이터의 품질과 양에 의해 제한된다는 것을 보여주었습니다. 이는 컴퓨터가 세포의 문법을 배우기 위해서는 공부할 수 있는 풍부한 예시 라이브러리가 필요하며, 충분한 데이터 없이는 설계 과정이 안정적인 경로를 찾을 수 없음을 드러냈습니다.
설계 과정을 가시화하고 조절 가능하게 만듦으로써, 이 연구는 과학자들이 유전 공학에 접근하는 방식을 변화시킵니다. 단순히 운 좋은 결과를 바라는 대신, 이제 그들은 서열이 진화하는 과정을 지켜보고, 경로를 벗어날 때 이를 포착하여 생산적인 경로로 다시 유도할 수 있습니다. 그 결과물인 스위치들은 단순히 우연히 작동하는 무작위 서열이 아닙니다. 그것들은 압축적이고 효율적이며 매우 특이적인 생물학적 프로그램을 향해 수렴하는 유도된 진화의 산물입니다. 이 접근 방식은 미래의 치료를 위해 필요한 정밀한 유전적 제어를 만드는 강력한 새로운 도구를 제공하며, DNA를 쓰는 추상적인 과업을 구체적이고 이해 가능하며 통제 가능한 과정으로 바꾸어 놓았습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.