Tree-aware conditional language modeling recovers mutational patterns of viral evolution
이 논문은 계통 발생적 맥락을 통합하여 바이러스 변이 패턴과 계통 특이적 진화 궤적을 정확하게 예측함으로써 실험적 기능적 제약 조건과 강력한 일치성을 입증하는 트리 인식 조건부 언어 모델인 evoPLM-Tree를 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
바이러스는 변화의 명수입니다. 바이러스는 자신이 감염시킨 숙주의 면역 체계를 피하기 위해 자신의 유전적 지침을 끊임없이 다시 쓰고, 단백질의 일부를 교체함으로써 생존합니다. 이 과정은 무작위적인 혼돈이 아니라, 일정한 경로를 따릅니다. 오늘날 바이러스에 도움이 되는 돌연변이가 내일은 무용하거나 심지어 해로울 수도 있는데, 이는 해당 특정 가계도에서 이미 일어난 다른 변화들에 달려 있습니다. 과학자들은 단백질의 언어를 읽는 컴퓨터 모델을 사용하여 이러한 변화를 예측하려고 오랫동안 노력해 왔으며, 단백질을 특정 단어들이 서로 더 잘 어울리는 문장처럼 취급했습니다. 그러나 이러한 모델 대부분은 최종 결과에만 주목할 뿐, 그 여정에는 주의를 기울이지 않습니다. 그들은 목적지는 보지만 바이러스가 그곳에 도달하기까지의 경로인 지도는 무시하며, 바이러스의 역사가 다음에 안전하게 할 수 있는 변화가 무엇인지를 결정한다는 사실을 놓칩니다.
한 연구팀은 이 문제를 바라보는 새로운 방법을 개발했으며, 이는 컴퓨터가 가족 계보에 주목하도록 강제합니다. 그들은 진화를 이해하는 언어 모델처럼 작동하는 evoPLM-Tree라는 시스템을 만들었습니다. 이 모델은 단순히 단백질 서열이 어떻게 보일지 추측하는 대신, 조상 바이러스 서열과 특정 가계도를 시작점으로 삼습니다. 그런 다음, 시간이 흐름에 따라 바이러스가 어떻게 변해왔는지에 대한 역사를 가이드로 삼아 계보의 다음 단계를 예측하는 법을 배웁니다. 연구진은 이 접근 방식을 SARS-CoV-2 바이러스의 스파이크 단백질, 즉 바이러스가 인간 세포에 침투할 수 있게 하는 부분을 사용하여 테스트했습니다. 그들은 계통 발생 나무(서로 다른 바이러스 변종 사이의 진화적 관계를 나타내는 도표)상의 위치를 기반으로, 오미크론 변이의 초기 버전 서열과 그 조상들을 짝지었습니다.
연구팀이 모델에게 자손 서열을 생성하도록 요청했을 때, 모델은 표준 모델이 따라올 수 없는 수준의 정확도로 성과를 냈습니다. 연구진은 진화적 맥락을 모델에 입력함으로써, 컴퓨터가 일반적인 패턴에 기반해 추측하기보다는 실제 입력 정보에 훨씬 더 많이 의존한다는 것을 발견했습니다. 모델이 생성한 서열은 단순한 무작위 변이가 아니었습니다. 그것들은 실제 세상에서 돌연변이가 실제로 발생하는 단백질의 특정 지점들을 정확하게 재현했습니다. 모델이 다양한 위치에서 돌연변이가 나타날 빈도를 예측한 것은 관찰된 데이터와 강한 상관관관계를 보였으며, 이는 컴퓨터가 예측한 것과 자연이 실제로 행한 것 사이에 명확한 연결 고리가 있음을 보여주었습니다. 이는 스파이크 단백질 전체와 인간 세포에 달라붙는 부분인 수용체 결합 도메인 모두에서 나타났습니다.
또한 이 연구는 바이러스가 시작점에서 시간적으로 더 멀어질 때 예측이 얼마나 잘 유지되는지를 조사했습니다. 진화적 거리가 멀어짐에 따라 모델이 정확한 단일 문자 변화를 예측하는 정밀도는 떨어졌지만, 전체 단백질에 걸친 변화의 전반적인 패턴을 포착하는 데는 여전히 놀라울 정도로 뛰어났습니다. 이러한 패턴이 실제 의미가 있는지 확인하기 위해, 연구진은 모델의 예측을 바이러스가 구조를 깨뜨리지 않고 견딜 수 있는 돌연변이를 테스트한 실험실 실험과 비교했습니다. 모델이 높은 확률을 부여한 돌연변이들은 과학자들이 이미 실험실 환경에서 생존할 수 있음을 확인한 것들과 동일한 것으로 밝혀졌습니다. 모델은 훈련 과정에서 실험 데이터를 전혀 보여주지 않았음에도 불구하고, 바이러스가 인간 세포에 결합하는 능력을 유지할 수 있게 하는 돌연변이들을 성공적으로 식별해 냈습니다.
이 작업은 컴퓨터 모델에게 바이러스의 가족사를 명확하게 보여주는 것이 해당 계보의 진화에 관한 고유한 규칙을 학습하게 한다는 것을 입증합니다. 조상의 경로를 명시적으로 포함함으로써, 모델은 바이러스가 시간이 지남에 따라 어떻게 변하는지를 정의하는 고유한 돌연변이 패턴을 회복할 수 있습니다. 이 결과는 이 접근 방식이 단백질 진화를 이해하는 신뢰할 수 있는 프레임워크를 제공하며, 우리가 이미 가지고 있는 게놈 데이터를 바탕으로 어떤 미래의 돌연변이가 나타날 가능성이 가장 높은지 과학자들이 우선순위를 정하는 데 도움을 줄 수 있음을 시사합니다. 이는 단순히 바이러스가 무엇이 될 것인가를 넘어, 조상의 실제 역사를 근거로 바이러스가 어떻게 그곳에 도달할 것인지에 대한 통찰을 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.