Forecasting viral evolution from phylogenetic trees
이 논문은 SARS-CoV-2, 인플루엔자, 뎅기열을 포함한 여러 병원체에 걸쳐 미래의 바이러스 변이를 정확하게 예측하기 위해 계통수(phylogenetic trees)를 활용함으로써 팬데측 대비 태세와 치료제 개발을 강화하는 머신러닝 모델인 antiGen을 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
바이러스는 끊임없이 형태를 바꾸는 존재입니다. 숙주 내부에서 증식하면서 바이러스는 자신의 유전 암호에 아주 작은 복제 오류를 만들어내며 새로운 버전의 자신을 생성합니다. 이러한 변화 중 대부분은 아무런 영향을 미치지 않지만, 때때로 발생하는 돌연변이는 더 빠르게 확산하거나 면역 체계를 피하는 것과 같은 새로운 이점을 바이러스에게 부여합니다. 이러한 지속적인 진화 때문에 작년에 맞은 독감 예방 주소가 올해는 당신을 보호하지 못할 수 있으며, 코로나19와 같은 질병의 새로운 변이가 예기치 않게 등장할 수 있는 것입니다. 이러한 위협에 앞서 나가기 위해 과학자들은 다음에 어떤 변화가 일어날 가능성이 높은지 예측해야 합니다. 전통적으로 연구자들은 실험실에서 단백질이 어떻게 행동하는지 연구하거나, 기존의 방대한 유전 서열 라이브러리를 살펴보는 컴퓨터 모델을 사용하여 미래의 돌연변이를 추측하려고 노력해 왔습니다. 그러나 이러한 방법들은 바이러스가 시간과 인구 사이를 실제로 어떻게 이동하는지에 대한 전체적인 그림을 보는 데 종종 어려움을 겪습니다.
스탠퍼드 대학교와 아크 연구소(Arc Institute)의 연구팀은 바이러스의 가족사를 살펴봄으로써 그 미래를 예측하는 새로운 접근 방식을 개발했습니다. 그들은 antiGen이라는 머신러닝 모델을 만들었는데, 이 모델은 단순히 현재의 유전 코드를 학습하는 것이 아니라 바이러스의 진화 경로를 학습합니다. 모델은 단순히 서열을 암기하는 대신, 마치 역사학자가 주요한 역사적 변화를 이끈 구체적인 사건들을 연구하듯, 바이러스가 한 버전에서 다른 버전으로 넘어가기 위해 거친 구체적인 단계들을 연구합니다. 바이러스의 '가계도'(다양한 변종들이 서로 어떻게 연관되어 있고 언제 갈라졌는지를 보여주는 도표)를 분석함으로써, 이 모델은 어떤 돌연파가 다음에 나타날 가능성이 높은지를 결정하는 규칙을 학습합니다. 이 방식은 시스템이 이전에 본 적 없는 변화까지도 예측할 수 있게 하여, 새로운 변이가 퍼지기도 전에 백신과 치료제를 준비할 수 있는 강력한 도구를 제공합니다.
연구진은 이 시스템을 먼저 코로나19 팬데믹의 원인인 SARS-CoV-2 바이러스에 대해 테스트했습니다. 그들은 팬데믹 첫해 동안 수집된 수백만 개의 유전 서열을 모델에 입력하고, 그 이후 몇 년 동안 나타날 돌연변이를 예측하도록 했습니다. 이 모델은 바이러스가 인간 세포에 침투할 수 있게 하는 부분인 스파이크 단백질의 다음 예상 변화를 예측하는 데 있어 기존의 어떤 방식보다 뛰어난 성능을 보였습니다. 결정적으로, 이 모델은 훈련 데이터에서 관찰되지 않았던 돌연변이까지 예측하는 데 성공했는데, 이는 모델이 단순히 과거의 사건을 암기한 것이 아니라 바이러스 진화의 근본적인 원리를 학습했음을 시사합니다. 이러한 예측이 생물학적으로 실제인지 확인하기 위해 연구팀은 예측된 바이러스 변종들을 실험실에서 직접 제작했습니다. 그 결과, 컴퓨터가 생성한 돌연변이 대부분이 여전히 세포를 감염시킬 수 있는 바이러스를 만들어냈으며, 이는 모델이 무작위적인 오류가 아닌 실행 가능하고 기능적인 변화를 제안하고 있음을 입증했습니다.
antiGen의 성공은 코로나바이러스에만 국한되지 않았습니다. 연구팀은 동일한 모델을 계절성 인플루엔자, 호흡기 세포융합 바이러스(RSV), 덴기 바이러스를 포함한 세 가지 다른 흔한 바이러스에 적용했습니다. 이 바이러스들에 대해서는 SARS-CoV-2에 비해 훨씬 적은 양의 유전 데이터가 사용 가능했음에도 불구하고, 모델은 미래의 돌연변이를 예측하는 데 있어 기존 방식보다 우수한 성능을 보였습니다. 이는 이 접근 방식이 가용한 감시 데이터의 양에 관계없이 광범위한 바이러스에 걸쳐 작동함을 시사합니다. 또한 연구진은 데이터가 더 많이 수집될수록 모델의 정확도가 향 향상된다는 것을 발견했는데, 이는 우리가 바이러스의 진화를 계속 추적할수록 모델이 더욱 강력한 도구가 된다는 것을 의미합니다. 어떤 경우에는 모델의 예측을 기존의 통계적 방법과 결합하여, 데이터가 풍부한 시나리오와 데이터가 부족한 시나리오 모두를 처리할 수 있는 더욱 견고한 예측 시스템을 구축할 수 있었습니다.
이 모델이 어떤 돌연변이가 발생할 가능성이 높은지 예측하는 데 매우 정확하지만, 연구진은 이 모델이 위험한 새로운 병원체를 만들어내는 것은 아니라고 강조합니다. 모델이 예측하는 변화는 자연적인 진화 과정의 일부인 작은 단일 단계 돌연변이들입니다. 이러한 예측은 공중보건 관계자와 백신 개발자들이 한발 앞서 나갈 수 있도록 돕기 위한 것입니다. 어떤 돌연변이가 나타날 가능성이 높은지 미리 알게 됨으로써, 과학자들은 오늘날 유행하는 바이러스뿐만 아니라 내일 지배적일 버전까지 겨냥한 백신을 설계할 수 있습니다. 이러한 선제적인 접근 방식은 감염병 관리를 대응 중심에서 예방 중심으로 전환할 수 있습니다. 이 연구는 바이러스의 유전 코드에 기록된 역사를 경청함으로써, 우리가 그 미래를 읽기 시작할 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.