← 최신 논문
🧬 biology

Deciphering the Language of Nature: A transformer-based language model for deleterious mutations in proteins

이 논문은 인간 단백질의 해로운 미스센스 돌연변이를 예측하기 위해 셀프 어텐션(self-attention)과 컨볼루션 레이어를 결합한 트랜스포머 기반 모델인 MutFormer를 소개하며, 단거리 및 장거리 서열 의존성을 효과적으로 포착함으로써 기존 도구들과 대등하거나 더 나은 성능을 입증한다.

원저자: Theodore Jiang, Li Fang, Kai Wang

게시일 2026-07-15✓ Author reviewed
📖 4 분 읽기☕ 가벼운 읽기

원저자: Theodore Jiang, Li Fang, Kai Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

당신의 몸이 거대한 지침서로 만들어진 거대하고 북적이는 도시라고 상상해 보세요. 이 지침서는 네 글자의 코드(A, C, T, G)로 쓰여 있으며, 당신의 세포가 생명을 유지하는 데 필요한 기계들을 어떻게 만드는지 알려줍니다. 때때로 이 지침서의 단 한 글자에서 오타가 발생하기도 합니다. 대부분의 경우 이러한 오타는 해롭지 않습니다. 마치 레시피에 오타가 있어도 맛은 여전히 괜찮은 것과 같습니다. 하지만 가끔은 이 오타가 중요한 재료를 바꾸어 놓아, 맛있는 케이크를 벽돌로 만들어 버리기도 합니다. 단백질을 만드는 지침서의 일부에서 발생하는 이러한 "오타"를 미스센스 돌연변이(missense mutations)라고 부릅니다. 과학자들은 해로운 오타와 해롭지 않은 오타를 구별해 내기 위해 디지털 탐정을 구축하려고 오랫동안 노력해 왔지만, 지침서가 매우 복잡하고 문맥 의존적이기 때문에 이는 까다로운 작업입니다.

이 논문에서 설명하는 새로운 도구를 이해하려면 두 가지를 알아야 합니다. 첫째, 단백질은 아미노산이라고 불리는 구성 블록들의 긴 사슬입니다. 이 블록들의 순서가 단백질이 어떻게 접히고 어떤 기능을 할지를 결정합니다. 둘째, 컴퓨터의 세계에는 "트랜스포머(transformer)"라고 불리는 일종의 인공지능이 있습니다. 여러분은 이 기술이 똑똑한 챗봇이나 멀리 떨어진 단어들 사이의 관계를 이해하는 번역 앱의 두뇌라는 것을 알고 있을 것입니다. 과학자들은 최근 이러한 "언어" 두뇌를 사용하여 생물학의 "언어"를 읽기 시작했으며, 단백질 사슬을 문장으로, 아미노산을 단어로 취급하고 있습니다. 문제는, 인간의 언어를 읽도록 학습된 컴퓨터가 생명의 언어를 충분히 잘 읽어서 어떤 유전적 오타가 질병을 유발할지 예측할 수 있느냐는 것입니다.

여기, Theodore T. Jiang, Li Fang, 그리고 Kai Wang 연구진이 만든 새로운 디지털 탐정인 MutFormer가 등장합니다. 그들은 단백질의 "문법"을 이해하도록 특별히 훈련된 트랜스포머 모델을 구축하기로 결정했습니다. MutFormer는 단순히 고립된 하나의 돌연변이만을 보는 대신, 전체 단백질 서열을 읽으며 근처에 있는 것뿐만 아니라 멀리 떨어져 있는 모든 아미노산이 서로 어떻게 상호작용하는지에 주목합니다.

연구진은 MutFormer에게 방대한 학습 계획을 가르치는 것으로 시작했습니다. 그들은 128,000개가 넘는 인간 단백질 서열을 모델에 입력했는데, 여기에는 "정상적인" 버전과 일반 인구에서 발견되는 흔하고 해롭지 않은 돌연변이가 포함된 버전이 모두 포함되었습니다. 이것은 AI에게 어떤 것이 "틀렸는지" 알려주지 않고도 단백질 문법의 규칙을 배울 수 있도록 수백만 개의 문장을 보여주는 것과 같습니다. 훈련 과정 동안, MutFormer는 누락되거나 뒤섞인 부분의 서열을 예측하는 법을 배웠으며, 결과적으로 생명의 "통사론(syntax)"을 학습하게 되었습니다.

모델의 사전 훈련이 끝나자, 연구진은 MutFormer에게 어떤 돌연변이가 위험한지 식별하는 구체적인 테스트를 부여했습니다. 그들은 알려진 질병 유발 돌연변이와 해롭지 않은 돌연변이 데이터셋을 사용하여 MutFormer를 미세 조정(fine-tuning)했습니다. 그들은 모델에게 일을 수행하도록 요청하는 세 가지 다른 방식을 실험했습니다:

  1. 잔기별(Per Residue): 모델에게 사슬의 모든 아미노산을 "안전" 또는 "위험"으로 라벨링하도록 요청합니다.
  2. 단일 서열(Single Sequence): 모델에게 돌연변이가 일어난 단백질 하나만 보여주고, "이 전체가 고장 났는가?"라고 묻습니다.
  3. 쌍 서열(Paired Sequence): 모델에게 원래의 단백질과 돌연변이된 버전을 나란히 보여주고, 두 개를 비교하여 변화가 해로운지 결정하도록 합니다.

결과는 명확했습니다: 쌍 서열(Paired Sequence) 방식이 가장 효과적이었습니다. 그것은 마치 탐정에게 원래의 설계도와 변형된 설계도를 모두 주어 차이점을 찾아내게 하는 것과 같았습니다.

하지만 여기서 MutFormer는 정말 영리해집니다. 이 작업을 수행하는 대부분의 기존 AI 모델은 변하지 않는 고정된 "단어 사전"(아미노산 패턴)을 사용했습니다. 그러나 MutFormer는 **합성곱 계층(convolutional layers)**을 사용하는 특별한 기술을 사용합니다. 이것을 모델이 단백질을 스캔할 때 사용하는 일련의 조절 가능한 렌즈라고 상상해 보세요. 미리 만들어진 사전에 의존하는 대신, MutFormer는 훈련하는 동안 중요한 패턴의 자신만의 "어휘"를 학습하기 위해 이 렌즈들을 사용합니다. 이는 탐정이 단순히 사전을 암기한 것이 아니라, 단백질 자체의 독특한 필체와 스타일을 인식하는 법을 배웠다는 것과 같습니다.

연구진이 MutFormer를 기존의 도구들(현재 분야의 "탐정들")과 테스트했을 때, MutFormer는 충분히 제 역할을 해냈습니다. 훈련 데이터와 유사한 일반 데이터셋에서 MutFormer는 기존의 최고 방법들과 대등하거나 더 나은 성능을 보였습니다. 모델이 데이터를 많이 접해보지 못한 특정 유전자의 돌연변이를 살펴보는 것과 같이 매우 다른 데이터셋에서도, 여전히 다른 최상위 도구들의 성능을 따라잡는 데 성공했습니다.

논문은 또한 MutFormer가 단순히 다른 도구들의 말을 반복하는 것이 아니라고 시사합니다. 연구진이 MutFormer의 예측을 진화적 역사(수백만 년 동안 종이 어떻게 변했는지 관찰하는 것)에 의존하는 EVE라는 도구와 비교했을 때, 두 도구가 항상 일치하지는 않는다는 것을 발견했습니다. 이는 MutFormer가 진화적 도구들이 놓칠 수 있는, 즉 단백질 서열의 즉각적인 "문법"과 같은 다른 단서들을 포착하고 있음을 시사합니다.

연구진은 MutFormer가 강력한 새로운 경쟁자이긴 하지만, 모든 것을 해결하는 마법 지팡이는 아니라는 점을 주의 깊게 언급합니다. 모델은 특정 데이터셋을 바탕으로 훈련되었으며, 학생과 마찬가지로 본 적 없는 질문에는 어려움을 겪을 수 있습니다. 그들은 또한 현재 모델이 주로 글자 서열에 의존하고 있으며, 3D 구조나 메틸화(methylation)와 같은 다른 생물학적 요인을 아직 완전히 통합하지 못했다는 점을 지적했습니다. 이는 향로 모델을 더욱 똑똑하게 만들 수 있는 요소들입니다.

요약하자면, MutFormer는 단백질을 하나의 언어로 취급하고 자신만의 어휘를 배울 수 있는 정교한 "언어 모델"을 사용함으로써, 어떤 유전적 오타가 위험한지를 파악하는 새롭고 강력한 관점을 제공할 수 있음을 보여줍니다. 이는 의사와 과학자들이 어떤 유전적 변이에 가장 많은 주의를 기울여야 하는지 우선순위를 정하는 데 도움을 줄 수 있는 유망한 단계이며, 인간 건강에 대한 더 명확한 그림을 제공하기 위해 기존 도구들을 보완할 수 있습니다. 코드와 모델은 다른 사람들이 사용하고 발전시킬 수 있도록 공개되어 있으며, 이를 통해 이 "자연의 언어"를 얼마나 잘 해독할 수 있는지에 대한 더 많은 실험의 문을 열어두고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →