← 최신 논문
🧬 biology

AMix-1: A Pathway to Test-Time Scalable Protein Foundation Model

이 논문은 체계적인 훈련 스케일링 법칙, MSA 기반 인컨텍스트 학습, 그리고 진화적 테스트 타임 스케일링을 활용하여 야생형 대비 최대 50배의 활성 향상을 보이는 AmeR 변이체를 생성함으로써 강력한 단백질 설계를 달성한, 베이지안 흐름 네트워크(Bayesian Flow Networks) 기반의 17억 파라미터 단백질 파운데이션 모델인 AMix-1을 소개한다.

원저자: Changze Lv, Jiang Zhou, Siyu Long, Lihao Wang, Jiangtao Feng, Dongyu Xue, Yu Pei, Hao Wang, Zherui Zhang, Yuchen Cai, Zhiqiang Gao, Ziyuan Ma, Jiakai Hu, Chaochen Gao, Jingjing Gong, Yuxuan Song, Shuy
게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Changze Lv, Jiang Zhou, Siyu Long, Lihao Wang, Jiangtao Feng, Dongyu Xue, Yu Pei, Hao Wang, Zherui Zhang, Yuchen Cai, Zhiqiang Gao, Ziyuan Ma, Jiakai Hu, Chaochen Gao, Jingjing Gong, Yuxuan Song, Shuyi Zhang, Xiaoqing Zheng, Deyi Xiong, Lei Bai, Wanli Ouyang, Ya-Qin Zhang, Wei-Ying Ma, Bowen Zhou, Hao Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

당신이 컴퓨터에게 새로운 단백질을 설계하는 법을 가르치고 있다고 상상해 보세요. 단백질은 우리 몸속에서 소화를 돕거나 바이러스와 싸우는 등 온갖 일을 수행하는 작고 복잡한 기계입니다. 새로운 단백질을 설계하는 것은 본 적 없는 자물쇠에 딱 맞는 새로운 열쇠를 발명하려는 것과 같습니다. 하지만 열쇠의 모양을 완벽하게 맞추지 못하면 작동하지 않기 때문에 아주 정교해야 합니다.

이 논문은 이 작업을 마스터하기 위해 특별히 설계된 새로운 "슈퍼 선생님" AI인 AMix-1을 소개합니다. 저자들은 단순히 더 큰 모델을 만든 것이 아니라, 이를 학습시키는 더 똑똑한 방법을 구축했습니다. 다음은 이 과정을 쉬운 비유를 통해 설명한 것입니다.

1. 엔진: "노이즈를 제거하는" 라디오

대부분의 AI 모델은 명확한 텍스트를 읽으며 학습합니다. 반면 AMix-1은 **베이지안 흐름 네트워크(Bayesian Flow Network)**라고 불리는 구조를 기반으로 합니다. 이것은 마치 잡음만 가득한 상태로 시작하는 라디오와 같습니다.

  • 작동 원리: AI는 완전히 뒤섞이고 노이즈가 가득한 단백질 서열에서 시작합니다. 그런 다음 단계적으로 노이즈를 "정화"하여 그 아래에 숨겨진 선명한 단백질을 드러내려고 노력합니다.
  • 비유: 아주 흐릿한 라디오 채널을 들으며 노래를 추측하는 상황을 상상해 보세요. 처음에는 잡음만 들립니다. 신호가 점점 뚜렷해지면(노이즈가 줄어들면), 멜로디가 들리고 그다음에는 가사가 들리기 시작합니다. AMix-1은 순수한 노이즈로부터 단백질을 완벽하게 재구성할 수 있을 때까지 이 "정화" 과정을 반복하며 연습함으로써 학습합니다.

2. 로드맵: 스케일링 법칙 ("크기가 중요하다"는 규칙)

연구진은 "AI를 더 크게 만들고 더 많은 데이터를 제공하면 정말 더 좋아질까?"라는 질문을 던졌습니다.

  • 발견: 그들은 이 AI를 위한 예측 가능한 "물리 법칙"을 발견했습니다. 자동차 엔진이 더 많은 연료를 넣으면 더 강력해지는 것처럼, AMix-1은 크기와 데이터 양을 늘릴수록 단백질 구조를 이해하는 능력이 향상됩니다.
  • 비유: 이것은 산을 오르는 것과 같습니다. 연구진은 AI가 얼마나 높이 올라갈 수 있는지(얼마나 좋아질 수 있는지)를 '연료'(컴퓨팅 파워)의 양만 알면 정확히 예측할 수 있도록 경로를 매우 정밀하게 그려놓았습니다. 그들은 이 지도를 사용하여 17억 개의 "뇌세포"(파라미터)를 가진 가장 큰 버전인 AMix-1을 구축했습니다.

3. "아하!" 모먼트: 창발적 능력 (Emergent Abilities)

여기서 가장 흥 excitement한 부분이 등장합니다. 연구진은 AI가 단순히 조금씩 좋아지는 것이 아니라, 성장함에 따라 이전에는 몰랐던 것을 갑자기 이해하기 시작한다는 것을 발견했습니다.

  • 비유: 수학을 배우는 학생을 상상해 보세요. 처음에는 숫자들을 단순히 암기합니다. 그러다 어느 순간, 충분한 연습을 거치면 갑자기 "깨달음"을 얻습니다. 숫자의 뒤에 숨겨진 논리를 이해하게 되어 한 번도 본 적 없는 문제도 풀 수 있게 되는 것입니다.
  • 결과: AMix-1은 훈련 과정에서 단백질의 글자(서열)만을 학습했음에도 불구하고, 갑자기 단백질의 형태(구조)를 이해하기 시작했습니다. 기하학을 명시적으로 배우지 않았음에도, 서열을 충분히 많이 읽음으로써 3D 형태를 스스로 알아낸 것입니다.

4. 지름길: 인컨텍스트 학습 ("말 대신 보여주기" 기술)

보통 AI에게 새로운 작업을 가르치려면 처음부터 다시 훈련시켜야 합니다. 하지만 AMix-1은 다릅니다. 이 모델은 자신의 뇌를 바꾸지 않고도 몇 가지 예시를 보는 것만으로 새로운 직무를 배울 수 있습니다.

  • 비유: 숙련된 요리사를 생각해 보세요. 만약 당신이 그에게 특정 지역의 음식을 요리하도록 하고 싶다면, 요리 학교에 다시 보낼 필요가 없습니다. 그저 그 음식의 사진 몇 장을 보여주며 "이것과 비슷하게 만들어 보세요"라고 말하면 됩니다. 요리사는 기존의 지식을 활용해 이를 해냅니다.
  • AMix-1의 방식: 연구진은 AI에게 유사한 단백질들의 "앨범"(다중 서열 정렬, Multiple Sequence Alignment)을 제공합니다. AI는 이 앨범 속의 패턴을 살펴보고, 올바른 형태와 기능을 유지하면서 그 흐름에 딱 맞는 새로운 단백질을 생성합니다.

5. 실전 테스트: "슈퍼 효소"

팀은 시뮬레이션만 돌린 것이 아니라, 실제 실험실에서도 테스트를 진행했습니다.

  • 도전 과제: 그들은 유전자 회로에서 스위치 역할을 하는 AmeR라는 단백질을 개선하고자 했습니다. 자연 상태의(wild-type) 버전도 괜찮았지만, 그들은 훨씬 더 강력한 버전을 원했습니다.
  • 결과: AMix-1의 "말 대신 보여주기" 방식을 사용하여 새로운 AmeR 버전을 설계했습니다. 실험실에서 테스트한 결과, 이 새로운 버전은 원래의 단백질보다 50배 더 활발하게 반응했습니다. 이는 AI가 실제 작동하는 생물학적 도구를 설계할 수 있음을 증명하는 엄청난 도약입니다.

6. 진화적 루프: 테스트 타임 스케일링 ("시행착오" 엔진)

마지막으로, 그들은 재학습 없이도 작업 중에 AI를 더욱 발전시킬 수 있는 EvoAMix-1이라는 시스템을 만들었습니다.

  • 비유: 100개의 점토 조각상을 만드는 조각가를 상상해 보세요. 심사위원이 그중 가장 좋은 5개를 뽑습니다. 그러면 조각가는 그 5개의 우승작을 새로운 "틀"로 삼아 다음 100개의 조각상을 만듭니다. 조각가의 손기술을 바꾸지 않고도, 이 과정을 반복하며 매 라운드마다 점점 더 나은 작품을 만들어내는 것입니다.
  • 작동 방식: AI가 수많은 단백질 후보를 생성합니다. 그러면 "검증기"(컴퓨터 프로그램 또는 실험실 테스트)가 가장 우수한 것들을 골라냅니다. AI는 이 우승작들을 새로운 예시로 사용하여 다음 라운드에서 훨씬 더 나은 단백질을 생성합니다.
  • 이점: 이 시스템에 더 많은 "체크"(예산)를 허용할수록 결과는 계속해서 좋아집니다. 계속 시도하게 두는 한, 성능은 끊임없이 향상됩니다.

요약

AMix-1은 다음과 같은 새로운 종류의 단백질 설계자입니다:

  1. 노이즈를 정화하며 학습합니다 (라디오 주파수를 맞추는 것처럼).
  2. 규모가 커질수록 더 좋아진다는 예측 가능한 지도를 따릅니다.
  3. 서열을 읽는 것만으로 3D 형태를 갑자기 "이해"합니다.
  4. 예시를 보는 것만으로 새로운 작업을 즉각적으로 배울 수 있습니다.
  5. 실제 실험실에서 자연 상태보다 50배 더 강력한 단백질을 성공적으로 만들어냈습니다.
  6. 시행착오의 진화적 루프를 통해 계속해서 발전할 수 있습니다.

이 논문은 AI와 실제 실험이 결-합되어 생명을 구하는 단백질을 그 어느 때보다 빠르게 설계하는 "랩-인-더-루프(lab-in-the-loop)" 미래를 향한 중요한 진전이라고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →