← 최신 논문
📄 evolutionary biology

Ancestral Sequences Cannot be Accurately Reconstructed via Interpolation in a Variational Autoencoder's Latent Space

이 연구는 변이형 오토인코더가 에피스타시스 상호작용을 모델링할 수 있는 잠재력에도 불구하고, 디코딩 과정에서의 내재적인 정보 손실로 인해 표준 우도 기반 방식 및 절약법에 지속적으로 뒤처짐으로써 조상 서열을 정확하게 재구성하는 데 한계가 있음을 보여준다.

원저자: Gorstein, E., Tang, M., Bruzzone, H., Solis-Lemus, C.

게시일 2026-09-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gorstein, E., Tang, M., Bruzzone, H., Solis-Lemus, C.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

생명의 역사 깊은 곳에서, 모든 생명체는 조상들의 분자적 기록을 간직하고 있습니다. 과학자들은 오랫동안 이 기록을 읽어내는 과정, 즉 조상 서열 재구성(ancestral sequence reconstruction)을 시도해 왔습니다. 수많은 증손주들이 보유한 복사본만을 근거로, 증조부모가 쓴 편지의 정확한 단어들을 추측하려는 상황을 상상해 보십시오. 생물학에서 이 "글자"들은 모든 세포의 일꾼인 단백질을 구성하는 아미노산 사슬입니다. 수십 년 동안 연구자들은 각 사슬의 글자가 전체의 의미에 영향을 주지 않고 단어 하나가 바뀌는 것처럼, 서로 독립적으로 변한다고 가정하며 누락된 단어를 채우기 위해 통계 모델을 사용해 왔습니다. 이 접근 방식은 단백질이 수백만 년 동안 어떻게 진화했는지 이해하기 위한 표준적인 도구였습니다.

하지만 생물학은 좀처럼 그렇게 단순하지 않습니다. 실제로 단백질 사슬의 글자들은 서로 의존하는 경우가 많습니다. 즉, 특정 아미노산의 변화는 근처의 다른 특정 변화가 함께 일어나야만 안전할 수 있습니다. 이러한 복잡한 상호 의존성은 '에피스타시스(epistasis, 상위성)'라고 알려져 있으며, 전통적인 통계 도구로는 포착하기 어렵습니다. 최근에는 변이형 오토인코더(variational autoencoder)라 불리는 일종의 딥러닝 모델인 새로운 세대의 인공지능 도구들이 다른 길을 제시했습니다. 이 모델들은 방대한 양의 데이터에서 숨겨진 패턴을 찾는 데 탁월합니다. 이들은 긴 단백질 서열을 압축된 수학적 요약본인 '임베딩(embedding)'으로 변환한 뒤, 그 요약본으로부터 원래의 서열을 재구성하려고 시나리오를 짭니다. 이 모델들은 글자 사이의 연결 관계를 무시하도록 학습되지 않고 데이터로부터 직접 학습하기 때문에, 많은 과학자는 이 모델들이 에피스타시스 문제를 해결하고 전례 없는 정확도로 고대 단백질을 재구성할 수 있기를 희망했습니다.

한 연구팀이 이 희망을 직접 테스트하기 위해 나섰습니다. 그들은 이 AI 모델들을 사용하여 고대 단백질의 서열을 추측하는 파이프라인을 구축했습니다. 아이디어는 간단했습니다. 오늘날 우리가 가진 현대 단백질들을 가져와 이 수학적 요약본으로 압축한 다음, 단백히의 계통도를 사용하여 고대 조상의 요약본이 어떤 모습이었을지 보간(interpolate), 즉 추측하는 것입니다. 일단 이 추측된 요약본을 얻으면, 이를 다시 AI에 입력하여 실제 아미노산 서열을 생성하게 됩니다. 만약 이것이 성공한다면, 이는 딥러닝이 전통적인 통계의 한계를 뛰어넘어, 비록 그 역사가 분자의 서로 다른 부분들 사이의 복잡한 상호작용에 의해 형성되었을지라도 진정한 단백질의 역사를 밝혀낼 수 있음을 의미할 것입니다.

연구진은 컴퓨터 시뮬레이션을 통해 이 아이디어를 시험했습니다. 그들은 먼저 전통적 모델이 가정하는 단순하고 독립적인 규칙을 사용하여, 그다음에는 자연에서 발견되는 상호 의존적 변화를 포함한 복잡한 규칙을 사용하여, 시간이 흐름에 따라 진화하는 수천 개의 가짜 단백질 가족을 만들었습니다. 그런 다음 두 가지 방법, 즉 새로운 AI 방식과 기존의 통계적 방식을 모두 사용하여 이 가짜 가족들의 조상을 재구성하려고 시도했습니다. 결과는 명확하고 일관적이었습니다. 단백질이 단순하게 진화했든 복잡한 의존성을 가지고 진화했든 상관없이, 모든 시나리오에서 전통적인 통계적 방법이 AI 방식보다 우수한 성능을 보였습니다. 딥러닝 모델은 자신이 빛을 발해야 할 바로 그 상황에서도 정확한 조상 서열을 생성하는 데 실패했습니다.

연구진은 왜 AI가 실패했는지 이해하기 위해 더 깊이 파고들었습니다. 문제는 AI가 가족 계통 구조를 놓쳤기 때문이 아니었습니다. 연구진이 수학적 요약본을 살펴보았을 때, AI가 단백질들을 진화적 관계를 반영하는 방식으로 조직하는 법을 실제로 학습했다는 것을 발견했습니다. 실패는 재구성 단계 자체에 있었습니다. AI 모델은 데이터를 작은 요약본으로 압축하는 과정에서 필연적으로 원래 서열의 미세한 세부 사항들을 잃어버렸습니다. 연구진이 이 요약본으로부터 고대 단백질을 재구축하려고 했을 때, 정보는 너무 흐릿해져 있었습니다. 모델은 실제 역사와 일치할 만큼 충분한 정밀도를 가진 서열을 생성할 수 없었습니다. 심지어 더 많은 정보를 유지하기 위해 수학적 요약본의 크기를 키웠음에도 불구하고, 개선 효과는 미미했으며 모델은 일반적인 진화 법칙을 배우기보다는 단순히 현대의 단백질들을 암기하기 시작했습니다.

연구진은 또한 훈련 과정에서 계통도를 명시적으로 학습한 더 발전된 버전의 AI를 테스트했습니다. 이러한 추가적인 가이드가 도움이 될 것이라 희망했지만, 결과는 나아지지 않았습니다. 근본적인 병목 현상은 여전히 동일했습니다. 서열을 요약본으로 압축하고 이를 다시 확장하는 과정이 정교한 과거를 추측하기에는 너무 많은 정보를 손실하는(lossy) 작업이었습니다. 이 연구는 AI 임베딩이 단백질 가족을 시각화하고 현대 단백질의 거동을 예측하는 데는 강력한 도구이지만, 과거를 재구성하는 데 있어서는 아직 기존의 통계적 방법을 대체할 준비가 되지 않았다고 결론지었습니다. 딥러며가 복잡한 진화적 상호작作用을 용이하게 해결할 수 있을 것이라는 기대는, 이 특정 응용 분야에서는 막다른 길이었던 것입니다. 더 단순한 가정을 바탕으로 함에도 불구하고, 전통적인 방식이 생명의 분자적 역사를 읽어내는 데 여전히 더 신뢰할 수 있는 방법으로 남아 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →