← 최신 논문
🧬 biology

Shetti-AI: Precise prediction of protein sequence mutational landscapes to accelerate functional assays

Shetti-AI는 물리화학적 특성, 유전적 거리, 그리고 생성적 적대 신경망을 통합하여 단백질 변이 지형을 예측하고 최적화된 모티프 유사 변이체를 생성함으로써, 합성 생물학과 바이러스학 분야에서 기능 분석을 가속화하고 실험적 탐색 공간을 줄이는 계산 프레임워크이다.

원저자: Haitham Sobhy

게시일 2026-09-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haitham Sobhy

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

단백질은 생명의 일꾼이며, 특정 과업을 수행하기 위해 복잡한 형태로 접히는 아미노산 사슬으로 이루어진 작은 기계들이다. 이 긴 사슬 안에는 단 몇 개의 아미노산으로 이루어진 짧은 서열이 종종 결정적인 스위치나 도킹 지점 역할을 하는데, 이를 모티프(motif)라고 부른다. 이 작은 영역들은 단백질이 다른 분자들과 어떻게 상호작용할지를 결정하며, 이 글자 중 단 하나만 바뀌어도 단백질의 전체 행동이 달라질 수 있다. 과학자들은 단백질을 이해하기 위해서는 그 모티프를 이해해야 한다는 것을 오래전부터 알고 있었다. 그러나 실험실에서 이러한 짧은 서열의 가능한 모든 변이를 테스트하는 것은 느리고 비용이 많이 들며, 종종 불가능한 작업이다. 잠재적인 변화의 공간이 인간의 손으로 탐색하기에는 너무나 방대하기 때문에, 연구자들은 어떤 변이가 작동하고 어떤 것이 실패할지를 추측하는 데 의존할 수밖에 없었다.

이를 해결하기 위해, 하이탐 소비(Haitham Sobby)라는 연구자는 셰티-AI(Shetti-AI)라고 불리는 새로운 계산 도구를 개발했다. 이 시스템은 과학자가 실험실에 들어가기도 전에 단백질의 짧은 모티프에 가해질 변화가 성공할 가능성이 높은지 예측하도록 설계되었다. 자연이 과거에 단백질을 어떻게 진화시켜 왔는지에만 의존하는 대신, 셰티-AI는 단백질이 미래에 어떻게 변할지를 시뮬레이션하며 앞을 내다본다. 이 시스템은 이미 검증된 작동 모티프에서 시작하여 새롭고 유사한 후보군 목록을 생성한다. 시스템은 세포의 유전 코드가 해당 변화를 만들기 얼마나 쉬운지, 그리고 새로운 아미노산이 단백질 기능에 필요한 물리적 특성을 얼마나 잘 보존하는지라는 두 가지 주요 요소를 균형 있게 고려함으로써 이 작업을 수행한다. 셰티-AI는 가능성이 낮은 옵션들을 걸러내고 가장 유망한 것들을 강조함으로써, 거대한 탐색 공간을 관리 가능한 실험 목록으로 축소하는 것을 목표로 한다.

이 논문은 생물학에 사용되는 기존 인공지능 도구들의 구체적인 문제를 강조한다. 단백-언어 모델(protein language models)이라고 불리는 많은 현대 프로그램들은 방대한 유전 데이터에서 일반적인 패턴을 포착하는 데는 매우 뛰어나다. 그러나 이들은 이러한 짧은 모티프의 미세한 디테일에는 취약하다. 예를 들어, 이 도구들은 광범한 규모에서는 비슷해 보일지라도 매우 다른 두 서열을 거의 동일하게 취급할 수 있는데, 이는 아주 작은 변화만으로도 단백질이 표적에 결합하는 능력을 파괴할 수 있음에도 그러하다. 저자는 기존의 도구들이 전하를 띤 입자를 중성 입자로 바꾸는 것과 같이, 단백질의 기능을 완전히 망가뜨릴 수 있는 아미노산 사이의 미묘한 물리적 차이를 놓치는 경우가 많다고 지적한다. 셰티-AI는 이러한 작은, 결정적인 영역을 지배하는 정밀한 물리적 및 유전적 규칙에 집중함으로써 이러한 사각지대를 해결하기 위해 특별히 구축되었다.

이 프레임워크는 먼저 검증된 모티프(자연계에서 작동하는 것으로 알려진 짧은 서열)를 가져와 그 특성을 상세한 수치 프로필로 매핑하는 방식으로 작동한다. 이 프로필은 크기, 전하, 물과의 상호작용 등 아미노산의 18가지 서로 다른 물리적 특성을 고려한다. 시스템은 일련의 수학적 모델을 사용하여 새로운 변이들을 생성한다. 시스템의 한 부분은 보수적인 필터 역할을 하여, 단일 변화가 유전적으로 접근 가능한지, 그리고 원래의 것과 물리적으로 유사한지를 확인한다. 또 다른 부분은 더 발전된 생성적 접근 방식을 사용하여, 자연에는 존재하지 않을 수도 있지만 여전히 물리학의 법칙을 따르는 완전히 새로운 아미노산 조합을 상상한다. 이렇게 생성된 후보들은 그것이 작동할 가능성과 그것을 유전적으로 만드는 데 드는 난이도를 가중치로 둔 점수에 따라 순위가 매겨진다.

시스템을 테스트하는 과정에서 연구진은 인간 단백질을 조절하는 데 관여하는 알려진 모티프를 벤치마크로 사용했다. 이 도구는 자연에서 작동하는 것으로 알려진 변이들, 즉 형태와 행동은 유지하면서 단 한두 글자만 다른 서열들을 성공적으로 식별해 냈다. 더 중요한 것은, 시스템의 생성적 부분이 원래의 모티프와 동일한 물리적 특성을 공유하면서도 새롭고 독창적인 서열들을 제안했다는 점이다. 서로 다르다고 알려진 대조 서열과 비교했을 때, 이 도구는 새로운 후보들이 작동하는 원래의 것과 훨씬 더 가깝다는 것을 정확히 식별했다. 결과에 따르면, 일부 모델은 작고 안전한 변화를 찾는 데 더 뛰어났지만, 다른 모델들은 더 먼 가능성을 탐색할 수 있어 연구자가 필요로 하는 바에 따라 다양한 옵션을 제공할 수 있음을 보여주었다.

이 논문은 이러한 접근 방식이 새로운 변체를 테스트할 시간이 매우 부족한 신종 바이러스를 연구하는 데 특히 유용할 수 있다고 제안한다. 관련 바이러스로부터 얻은 알려진 모티프를 시작점으로 사용함으로써, 이 도구는 실험실에서 테스트할 가능성이 높은 후보 목록을 빠르게 생성하여 발견 과정을 가속화할 수 있다. 또한, 이는 합성 생물학을 위한 맞춤형 단백질을 설계하는 방법도 제공하여, 연구자들이 수천 개의 실패한 버전을 합성할 필요 없이 특정 물리적 특성을 가진 새로운 도구를 만들 수 있게 해준다. 저자는 시스템이 유연하여, 연구자들이 원래의 것과 거의 동일한 변화만을 찾는 매우 엄격한 설정이나, 대담한 새로운 설계를 찾는 더 탐색적인 설정 중 선택할 수 있다고 언급한다.

궁극적으로 셰티-AI는 실험실 실험의 필요성을 대체하는 것이 아니라, 실험이 일어나는 순서를 바꾼다. 무작위적인 추측을 테스트하는 대신, 과학자들은 이 도구를 사용하여 가장 유망한 후보들의 우선순위를 정함으로써 시간과 자원을 절약할 수 있다. 이 시스템은 유전의 경직된 규칙과 단백질 설계의 유동적인 가능성 사이의 간극을 메우며, 잠재적인 돌연변이의 방대한 풍경을 확신을 가지고 항해할 수 있는 방법을 제공한다. 단지 통계적 패턴에 의존하는 것이 아니라 단백질이 작동하는 물리적 실체에 집중함으로써, 이 도구는 생명이 어떻게 적응하는지, 그리고 우리가 미래를 위해 어떻게 그것을 설계할 수 있는지에 대한 더 명확한 경로를 제시한다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →