Direct estimation of genotype fitness from time series
이 논문은 에피스타시스(epistasis)에 대한 가설이나 반복적인 최적화 과정을 요구하지 않고도 표준 선형 대수를 사용하여 노이즈가 포함된 시계열 데이터로부터 개별 유전자형의 적응도를 직접 추정하는 단순한 폐쇄형 수학적 방법을 소개하며, 실험실 진화에서부터 전 세계적 팬데믹에 이르기까지 다양한 시뮬레이션 모델과 실제 데이터 세트 전반에 걸친 효과를 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
수백만 명의 작고 보이지 않는 시민들이 끊임없이 직업을 바꾸고, 이웃을 옮겨 다니며, 자원을 두고 경쟁하는 북적이는 도시를 상상해 보십시오. 어떤 시민들은 자연적으로 생존하고 '자손'을 남기는 데 더 유리합니다. 생물학에서 우리는 이러한 이점을 '적응도(fitness)'라고 부릅니다. 박테리아, 효모 또는 바이러스의 집단이 진화할 때, 이는 마치 가장 빠른 주자들이 앞서 나가는 혼란스럽고 빠른 속도의 경주를 지켜보는 것과 같습니다. 하지만 이 경주는 매우 무질서합니다. 갑작스러운 교통 정체, 무작위적인 사고, 그리고 매 초마다 새로운 주자들이 트랙에 합류하기도 합니다. 과학자들은 오랫동안 관중석에서 경주를 지켜보는 것만으로 각 주자의 속도가 정확히 얼마인지 알고 싶어 했습니다. 만약 그들이 누가 진정으로 가장 빠른지를 알아낼 수 있다면, 바이러스가 어떻게 더 강해질지 혹은 암이 어떻게 의학을 따돌릴지를 예측할 수 있을 것입니다. 문제는 경주가 소음이 많고, 붐비며, 뜻밖의 일들로 가득 차 있어서, 군중을 보는 것만으로 모든 개별 주자의 진짜 속도를 측정하기가 매우 어렵다는 점입니다.
이것이 바로 바이브 아 모한티(Vaibhav Mohanty)와 유진 I. 샤크노비치(Eugene I. Shakhnovich)가 새로운 논문에서 다룬 퍼즐입니다. 그들은 놀라울 정도로 간단한 수학적 기법인 '폐쇄형 공식(closed-form formula)'을 발견했습니다. 이 공식은 이러한 진화적 경주를 위한 마법의 해독 반지 역할을 합니다. 복잡하고 느린 컴퓨터 시뮬레이션을 통해 답을 찾아가며 추측하는 대신, 그들의 방법은 직접적인 행렬 연산(숫자를 스프레드시트에 정리하는 특정한 방식)을 사용하여 인구 집단의 시계열 영상으로부터 모든 유전자형(각 주자의 고유한 유전적 'ID 카드')의 적응도를 즉각적으로 계산합니다. 그들은 네 가지 다른 유형의 진화 경주에 대해 이 방법을 테스트했으며, 심지어 군중 속에서 거의 보이지 않을 정도로 희귀한 주자들에 대해서도 놀라운 정확도로 작동한다는 것을 발견했습니다. 그 후, 이들은 이를 실제 효모 실험, 생쥐 바이러스, 그리고 SARS-CoV-2의 전 세계적 확산 데이터에 적용했습니다. 결과는 어떠했을까요? 그들의 단순한 공식은 훨씬 더 복잡한 방법들과 동일한 신뢰도로 적응도 지형을 재구성할 수 있었으며, 이는 진화의 속도를 이해하기 위해 반드시 슈퍼컴퓨터가 필요한 것은 아니며, 때로는 적절한 방정식 하나면 충분하다는 것을 증명했습니다.
삶의 경주와 군중 속의 소음
이것이 왜 중요한 일인지 이해하기 위해, 진화가 보통 어떻게 작동하는지 살펴보겠습니다. 박테리아 집단을 거대한, 소음이 가득한 경기장 안의 사람들로 상상해 보십시오. 각 사람은 약간씩 다른 티켓(유전자형)을 가지고 있습니다. 어떤 티켓은 소지자가 더 빨리 달리고 더 많이 번식할 수 있게 해주는 '황금 티켓'이고, 다른 티켓은 소지자를 더 느리게 만드는 '동티켓'입니다. 완벽하고 조용한 세상이라면 황금 티켓 소지자들이 빠르게 경기장을 장악할 것이고, 우리는 누가 이기고 있는지 쉽게 알 수 있을 것입니다. 이것은 한 명이 명확하게 더 빠른 두 명의 주자 사이의 단순한 경주와 같습니다.
하지만 실제 삶은 결코 그렇게 단순하지 않습니다. 현실 세계의 경기장은 혼란스럽습니다. 무작위적인 새로운 티켓을 가진 새로운 사람들이 계속 들어옵니다(돌연변이). 때때로 군중이 너무 빽빽해져서 빠른 주자들이 서로 부딪혀 속도가 느려지기도 합니다(클론 간섭). 때로는 무작위적인 바람이 운 좋게 느린 주자를 맨 앞으로 밀어 올리기도 합니다(유전적 부동). 그리고 우리의 관찰은 종종 흐릿합니다. 왜냐하면 우리는 모든 사람을 완벽하게 셀 수 없기 때문입니다(샘플링 노이즈).
수십 년 동안 과학자들은 군중이 시간이 지남에 따라 어떻게 변하는지를 관찰함으로써 각 티켓 소지자가 얼마나 빨리 달리고 있는지 알아내려고 노력해 왔습니다. 문제는 수천 명의 서로 다른 주자들이 동시에 경쟁할 때 수학이 믿을 수 없을 정도로 복잡해진다는 점입니다. 기존의 대부분의 방법은 "주자들이 오직 쌍으로만 상호작용한다고 가정하자"라거나 "소음이 그리 크지 않다고 가정하자"와 같은 큰 가정을 세워 이 문제를 해결하려 합니다. 다른 방법들은 강력한 컴퓨터를 사용하여 수백만 번의 추측을 실행하며 최적의 적합성을 찾으려 하는데, 이는 오랜 시간이 걸리고 많은 기술적 노하우를 필요로 합니다.
마법의 공식
모한티와 샤크노비치는 다른 질문을 던졌습니다. 그러한 단순한 가정을 하지 않고도 소음을 뚫고 나갈 방법이 있을까? 그들은 선택, 돌연변이, 그리고 무작위 소음에 의해 빈도가 어떻게 변하는지를 설명하는 인구 유전학의 고전 방정식(키무라 방정식)에서 시작했습니다. 보통 이 방정식은 무작위 소음 항 때문에 풀기가 매우 까다롭습니다.
그러나 저자들은 인구 집단의 평균적인 행동을 관찰하고, 데이터를 거대한 숫자 격자(행렬)로 취급한다면 복잡성을 제거할 수 있다는 사실을 깨달았습니다. 그들은 다음과 같은 형태의 간단한 공식을 도출했습니다:
쉬운 말로 설명하자면, 그들의 방법은 매 순간 누가 어디에 있었는지에 대한 이력을 가져와서, 그것을 거대한 표로 정리한 다음, '의사역행렬'(역설계 계산기와 같은 것)이라는 표준 수학 도구를 사용하여 특정 움직임 패턴을 만들어내기 위해 각 유전자형의 적응도가 반드시 어떠했어야 하는지를 계산해 냅니다.
이 접근 방식의 아름다움은 상호작용이 얼마나 복잡하든 상관하지 않는다는 점에 있습니다. 돌연변이가 오직 쌍으로만 발생한다고 가정하지도 않고, 환경이 조용하다고 가정하지도 않습니다. 그저 데이터를 보고 이렇게 말하는 것입니다. "인구가 이런 식으로 움직였다면, 이 움직임을 만들어내는 속도는 이것이다."
해독 반지의 테스트
그들의 마법 공식이 실제로 작동하는지 확인하기 위해, 저자들은 단순히 추측만 한 것이 아니라 이를 혹독하게 시험했습니다.
1. 시뮬레이션 실험실:
먼저, 그들은 컴퓨터를 통해 네 가지 다른 유형의 가상 진화 경주를 만들었습니다:
- Wright-Fisher: 다음 세대가 현재 세대의 무작위 샘의 형태를 띠는 고전적인 모델.
- Moran: 개체들이 서로를 대체하기 위해 일대일으로 경쟁하는 모델.
- ProSeD: 실험실에서 박테리아가 희석되고 배양되는 시뮬레이션.
- Fit-Seq2.0: 배양액 속에서 바코드가 있는 세포가 성장하는 시뮬레이션.
이 모든 시뮬레이션에서 저자들은 '지면 진실(ground truth)'을 알고 있었습니다. 즉, 모든 가상의 유전자형이 정확히 얼마나 빠른지 알고 있었다는 것입니다. 그런 다음, 이 시뮬레이션에서 나온 노이즈가 섞인 지저난 시계열 데이터를 공식에 입력했습니다. 결과는 어떠했을까요? 공식은 놀라운 정확도로 적응도 지형을 재구성했습니다. 심지어 수백만 명의 바다 속에 단 몇 번만 나타나는 극도로 희귀한 유전자형에 대해서도, 공식은 그 속도를 정확하게 맞출 수 있었습니다. 실제 속도와 추정 속도 사이의 상관관계는 종종 0.95 이상이었는데, 이는 통계학의 세계에서 매우 높은 점수입니다.
2. 실제 세계 테스트:
다음으로, 그들은 실제 속도를 알 수 없는 실제 데이터를 사용해 보았습니다. 그들은 다음을 조사했습니다:
- 효모: 서로 다른 바코드를 가진 효모가 서로 다른 액체에서 자라는 두 가지 실험.
- 생쥐 노로바이러스(MNV-1): 바이러스를 막으려는 항체가 있는 경우와 없는 경우의 생쥐 내 바이러스 진화.
- SARS-CoV-2: 다양한 변이들이 시간에 따라 전 세계적으로 어떻게 확산되었는지에 대한 글로벌 데이터.
이 경우, 그들은 자신들의 결과를 훨씬 더 복잡한 방법을 사용한 다른 과학자들의 최선의 추정치와 비교했습니다. 그들의 단순한 공식은 이러한 복잡한 방법들과 거의 완벽하게 일치했습니다. 효모와 바이러스 데이터의 경우, 상관관계가 매우 강력했는데, 이는 이 공식이 복잡한 계산 과정이나 제한적인 가정을 필요로 하지 않고도 필수적인 정보를 추출할 수 있음을 보여주었습니다.
이것이 왜 중요한가
이 발견의 가장 놀라운 부분은 이 공식이 유전적 부동(보통 진화를 예측하기 어렵게 만드는 무작위 변동)의 "소음"을 무시함에도 불구하고 작동한다는 점입니다. 저자들은 서로 다른 유전자형 간의 상관관계를 관찰함으로써, 유한한 인구 집단 내에서도 자연 선택의 신호가 소음을 뚫고 빛을 발한다는 것을 발견했습니다. 이는 마치 혼란스러운 군중 속에서 개별 주자를 명확히 볼 수는 없더라도, 집단 전체가 어떻게 움직이는지를 관찰하면 각 개인이 얼마나 빨리 달리고 있는지 수학적으로 추론할 수 있는 것과 같습니다.
이 방법은 또한 매우 실용적입니다. 다른 방법들이 복잡한 소프트웨어, 반복적인 최적화(추측과 확인), 그리고 깊은 프로그래밍 기술을 요구하는 반면, 이 새로운 공식은 마이크로소프트 엑셀과 같은 표준 스프레드시트나 몇 줄의 파이썬 코드로 실행할 수 있습니다. 이는 보통 슈퍼컴퓨터를 필요로 하는 문제를 노트북을 가진 고등학생도 해결할 수 있는 수준으로 바꿔놓습니다.
결론
모한티와 샤크노비치는 단순히 적응도를 측정하는 새로운 방법을 찾은 것이 아니라, 진화의 수학이 우리가 생각했던 것보다 더 단순하다는 것을 보여주었습니다. 직접적인 폐쇄형 방정식을 사용함으로써, 그들은 돌연변이의 정확한 세부 사항이나 인구 규모를 알 필요 없이, 또한 상호작용이 얼마나 복잡한지에 대한 가정을 하지 않고도 시계열 데이터로부터 유전자형의 적응도를 추론할 수 있습니다.
그들은 이 도구가 진화 생물학자, 미생물학자, 그리고 공중 보건 전문가들에게 게임 체인저가 될 수 있다고 제안합니다. 실험실에서 바이러스를 추적하든 전 세계적인 팬데믹을 모니터링하든, 이 공식은 삶의 경주에서 누가 이기고 있는지, 그리고 왜 이기고 있는지를 이해할 수 있는 빠르고 정확하며 쉬운 방법을 제공합니다. 이는 진화의 혼란스러운 소음을 명확하게 읽을 수 있는 적응도의 지도로 바꾸어 놓으며, 때로는 가장 강력한 도구가 가장 단순한 것임을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.