← 최신 논문
📄 molecular biology

FlexRibbon: Joint Sequence and Structure Pretraining for Protein Modeling

FlexRibbon은 마스크 언어 모델링과 확산 기반 디노이징의 결합을 사용하여 아미노산 서열과 3차원 구조를 공동으로 사전 학습함으로써, 다중 서열 정렬(MSA)에 의존하지 않고도 기존의 MSA 기반 방식들이 어려움을 겪는 변이가 풍부한 영역을 중심으로 다양한 작업에서 최첨단 성능을 달성하는 새로운 단백질 파운데이션 모델입니다.

원저자: Zhu, J., Shi, Y., Bi, R., Jin, P., Liu, C., Zhang, Z., Huang, H., Guo, Z., Hu, P., Ju, F., Huang, L., Tai, X., Li, C., Gao, K., Wei, X., Xia, H., Zhang, J., Min, Y., Wang, Z., Wang, Y., He, L., Liu, H
게시일 2026-07-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhu, J., Shi, Y., Bi, R., Jin, P., Liu, C., Zhang, Z., Huang, H., Guo, Z., Hu, P., Ju, F., Huang, L., Tai, X., Li, C., Gao, K., Wei, X., Xia, H., Zhang, J., Min, Y., Wang, Z., Wang, Y., He, L., Liu, H., Qin, T.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

단백질의 세계를 거대하고 북적이는 도시라고 상상해 보십시오. 오랫동안 이 도시를 이해하려 노력했던 과학자들은 매우 다른 두 가지 종류의 지도 중 하나를 선택해야만 했습니다.

첫 번째 지도는 문법 교과서와 같았습니다. 이 지도는 단백질을 구성하는 글자(아미노산)의 서열만을 바라보았고, 도시가 실제로 어떻게 생겼는지는 무시했습니다. 이는 생명의 "언어"를 이해하는 데는 탁월했지만, 건물의 3D 형태를 파악하려고 할 때는 길을 잃기 일쑤였습니다.

두 번째 지도는 크라우드소싱 설문조사와 같았습니다. 이 지도는 수천 개의 유사한 도시(진화적 친척들)를 관찰하여 새로운 도시가 어떤 모습일지 추측하는 방식에 의존했습니다. 이는 표준적인 건물들을 파악하는 데는 매우 정확했지만, 만약 아주 새롭고 기괴한 모양의 마천루나 레이아웃이 너무 많이 변해버린 도시를 지도화하려고 한다면, 비교할 만한 유사한 사례가 없기 때문에 설문조사는 실패했습니다.

이때, 문법과 설문조사 사이에서 하나를 선택하는 대신, 문법을 읽는 동시에 설계도까지 함께 파악하기로 결정한 새로운 종류의 지도 제작자, FlexRibbon이 등장했습니다.

비결: 양방향 통행

기존의 대부분의 모델은 일방통행 도로와 같았습니다. 즉, 글자의 서열을 입력받아 그 형태를 추측하는 방식이었습니다. 하지만 FlexRibon은 양방향 통행로를 구축했습니다. 이 모델은 글자가 형태를 결정한다는 점뿐만 아니라, 형태 또한 어떤 글자가 와야 하는지를 알려준다는 사실을 학습했습니다.

이를 가르치기 위해 연구진은 영리한 훈련 게임을 사용했습니다. 그들은 단백질을 가져온 뒤, 노이즈를 섞어 3D 형태를 뒤섞어 놓았습니다(마치 스노우볼을 흔드는 것처럼). 그리고 모델에게 이를 다시 깨끗하게 정리하도록 요청했습니다. 동시에 서열에서 일부 글자를 숨긴 뒤, 모델에게 그 글자들을 맞히도록 요구했습니다. 여기서 핵심적인 반전은, 모델이 올바른 답을 맞히기 위해 반드시 지저리진(messy) 3D 형태를 힌트로 사용해야 했다는 점입니다. 이 과정을 통해 모델은 서열과 구조가 서로 분리될 수 없는 자물쇠와 열쇠처럼 단단히 결합되어 있다는 것을 강제로 학습하게 되었습니다.

왜 중요한가: "지저분한" 부분들

진정한 마법은 도시의 지저리진 부분에서 일어납니다. 생물학에서 어떤 단백질들은 유연하고 흐느적거리는 팔(항체의 루프 같은 것)을 가지고 있거나, 무언가를 붙잡을 때 형태가 변하기도 합니다. 기존의 "설문조사" 모델들(진화적 친척들에게 의존하는 모델들)은 이런 부분에서 종종 막히곤 하는데, 왜냐하면 이 흐느적거리는 부분들은 진화적 데이터에서 명확한 패턴을 찾을 수 없을 만큼 너무 많이 변하기 때문입니다.

하지만 FlexRibbon은 이러한 까다로운 영역을 다르게 처리합니다. 패턴을 찾기 위해 "친척들의 군중"에 의존하는 대신, 그 설문조사의 필요성을 완전히 우회합니다. 개별 서열과 구조 사이의 연결 고리를 직접 모델링함으로써, 진화적 신호가 약하거나 사라진 경우에도 이러한 유연하고 변이가 심한 영역을 놀라운 정확도로 예측할 수 있습니다.

증거: 12가지의 도전 과제

팀은 단순히 작동한다고 말하는 데 그치지 않고, 실제 현실 문제를 해결할 수 있는지 확인하기 위해 FlexRibbon을 12가지의 서로 다른 과제라는 가혹한 시험대에 올렸습니다. 결과는 다음과 같습니다.

  • 항체 설계: 바이러스에 달라붙는 항체(우리 몸의 방어군)를 설계하도록 요청했을 때, FlexRibbon은 표준 항체에 대해 61.3%, 나노바디(작은 항체)에 대해 **51.1%**의 성공률을 기록했습니다. 이는 이전의 최고 방법들이 각각 **46.7%**와 44.0% 수준에 머물러 있던 것에 비해 큰 도약입니다.
  • 펩타이드 결합: 작은 단백질 사슬(펩타이드)이 더 큰 단백질에 어떻게 달라붙는지 예측하는 데 있어, FlexRibbon은 **91.4%**의 성공률을 달성하며 다음으로 뛰어난 방법보다 7.0%에서 10.2% 더 높은 성적을 냈습니다.
  • 신약 개발: 약물 분자가 단백질에 얼마나 잘 결합하는지 추측할 때, FlexRibbon은 0.848의 상관계수와 1.150의 오차율을 기록하며 테스트된 모든 다른 방법들을 능가했습니다.
  • 형태 변화: 이 모델은 약물이 결합할 때 단백질이 어떻게 형태를 바꾸는지도 예측할 수 있었으며, 한 테스트 케이스에서 실제와 매우 흡사한 0.985의 구조적 유사도(TM-score)를 달려냈습니다.

이것이 "아닌" 것

FlexRibbon이 하지 못하는 것을 아는 것도 중요합니다. 이 모델은 기존 모델들이 예측을 위해 사용했던 "크라우드소싱 설문조사"(다중 서열 정렬, MSA)에 의존하지 않습니다. 만약 진화적 친척이 거의 없는 단백질을 준다면, 기존 모델들은 데이터가 부족하여 어려움을 겪을 수 있지만, FlexRibbon은 서열과 구조 사이의 직접적인 연결에 대한 내부적 이해를 바탕으로 성공하며, 정렬 신호가 약한 영역에서도 길을 찾아냅니다.

결론

이 논문은 모델에게 서열과 구조를 차례대로 배우게 하는 것이 아니라, 함께 배우도록 가르치는 것이 훨씬 더 유연하고 정확한 도구를 만들어낸다는 점을 시사합니다. 이것은 단순히 더 나은 추측기가 아니라, 더 나은 '설계자'입니다. 질병과 싸우기 위한 새로운 항체를 만들든, 약물이 표적에 어떻게 들어맞는지 알아내든, FlexRibbon은 서열과 구조가 서로 대화하게 할 때 전체 시스템이 더 잘 작동한다는 것을 보여줍니다.

저자들은 CASP15 챌린지와 PoseBusters V1 데이터셋 같은 특정 벤치마크를 통해 결과를 측정했으며, Flex-Ribbon이 특히 다른 방법들이 자주 넘어지는 까다롭고 변이가 많은 영역에서 지속적으로 새로운 최고 기록을 경신함을 발견했습니다. 이는 우리가 문장을 쓰는 것만큼이나 쉽게 단백질을 처음부터 설계할 수 있는 미래를 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →