← 최신 논문
🧬 biology

Adaptive Protein Tokenization

이 논문은 단백질 표현에 세부 사항을 점진적으로 추가함으로써 기존의 국소적 접근 방식의 한계를 극복하고, 생성, 재구성 및 분류 작업에서의 성능을 향상시키는 동시에 적응형 추론과 제로샷 단백질 축소와 같은 새로운 응용을 가능하게 하는 글로벌 토큰화 방법인 적응형 단백질 토큰화(Adaptive Protein Tokenization)를 소개한다.

원저자: Rohit Dilip, Ayush Varshney, David Van Valen

게시일 2026-02-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rohit Dilip, Ayush Varshney, David Van Valen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

당신이 복잡한 3D 조각상을 친구에게 전화로 설명하여 친구가 똑같은 복제품을 만들 수 있도록 하려고 한다고 상상해 보세요.

과거의 방식 (로컬 토큰화 - Local Tokenization):
대부분의 기존 AI 모델은 이 작업을 모자이크처럼 조각을 하나씩 설명하는 방식으로 시도했습니다. 그들은 "여기는 코를 위한 찰흙 조각이고, 여기는 귀를 위한 조각이고, 여기는 턱을 위한 조각이야"라고 말하곤 했습니다. 즉, 단백질의 작은 국소적 영역(local neighborhoods)에 집중했습니다.

  • 문제점: 만약 코를 설명할 때 아주 작은 실수라도 하면, 머리 전체가 삐뚤어질 수 있습니다. 또한, 만약 조각상이 거대하다면(예: 거대한 단백질 복합체), 수천 개의 작은 조각들을 보내야 하므로 느리고 비효율적입니다. 만약 조각 하나를 빠뜨리면 전체 그림이 무너져 버립니다.

새로운 방식 (적응형 단백질 토큰화 - Adaptive Protein Tokenization):
이 논문의 저자인 로힛 딜립(Rohit Dilip)과 동료들은 이 조각상을 설명하는 더 스마트한 방법을 제안합니다. 수천 개의 작은 모자이크 타일을 보내는 대신, 단계별로 점점 더 상세해지는 일련의 "글로벌 스냅샷(global snapshots)"을 보냅니다.

지도를 확대하는 것과 같다고 생각해보세요:

  1. 토큰 1: "이것은 크고 둥근 물체입니다." (전체적인 큰 그림).
  2. 토큰 2: "길고 굽은 형태를 가지고 있습니다." (맥락 추가).
  3. 토큰 3: "왼쪽에 나선형 구조가 있습니다." (세부 사항 추가).
  4. 토큰 4: "나선형에는 특정한 질감이 있습니다." (미세한 디테일 추가).

이것을 **적응형 토큰화(Adaptive Tokenization)**라고 부릅니다. AI는 단순히 한 지점만을 보는 것이 아니라, 새로운 토큰이 추가될 때마다 단백질 전체 구조에 디테일 층을 쌓아 올립니다.

작동 원리 (마법의 재료들)

이 논문은 APT(Adaptive Protein Tokenizer)라는 도구를 소개합니다. 이 도구가 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

  • "거친 단계에서 정교한 단계로(Coarse-to-Fine)" 이어지는 계층 구조: 노래를 듣는다고 상상해 보세요. 먼저 베이스 드럼 소리(리듬/전체적인 형상)가 들립니다. 그다음 멜로디가 들립니다. 마지막으로 하이햇 심벌즈 소리(미세한 디테일)가 들립니다. APT도 이와 똑같이 작동합니다. 처음 몇 개의 토큰은 단백질의 전체적인 모양을 설명합니다. 토큰이 추가됨에 따라 AI는 미세한 디테일을 채워 넣습니다.
  • "스마트 중단(Smart Stop)" 버튼: 기존 방식에서는 제대로 된 그림을 얻기 위해 모든 타일을 다 보내야 했습니다. 하지만 APT를 사용하면, AI는 당면한 작업에 충분한 정보가 모였다고 판단되면 토큰 전송을 중단할 수 있습니다. 단순히 단백질의 일반적인 모양만 알면 된다면 16개의 토큰만으로 멈출 수 있습니다. 만약 정밀한 약물을 설계해야 한다면 64개의 토큰을 사용할 수 있습니다. 이는 시간을 절약하고 오류를 줄여줍니다.
  • "노이즈 캔슬링(Noise-Canceling)" 기능: AI가 "큰 그림"에서부터 "세부 사항"으로 내려가며 단백질을 구축하기 때문에, 전체를 망치는 실수를 할 가능성이 낮습니다. 작은 디테일이 약간 어긋나더라도 전체적인 형태는 올바르게 유지됩니다.

입증된 성과 (결과)

연구팀은 이 새로운 방법이 현재 최고의 모델들(ESM3 및 DPLM2 등)을 세 가지 측면에서 테스트했습니다.

  1. 재구축 (Reconstruction): 토큰으로부터 단백질을 다시 재구축하려고 했을 때, APT는 기존의 가장 우수한 모델들과 대등한 정확도를 보이면서도 훨씬 적은 수의 토큰만으로 이를 수행할 수 있었습니다.
  2. 새로운 단백질 생성 (Generation): AI에게 완전히 새로운 단백질을 발명하도록 요청했습니다. 이 새로운 방법은 기존 방식보다 더 "설계 가능(designable)"한(즉, 실험실에서 물리적으로 만들어졌을 때 무너지지 않고 존재할 수 있는) 단백질을 만들어냈습니다. 실제로 약 87%의 성공률을 기록하며 기존의 선두 모델들을 크게 앞질렀습니다.
  3. 기능 이해 (Representation): AI가 단백질의 토큰 설명만 보고 그 단백질이 어떤 기능을 하는지 이해할 수 있는지 테스트했습니다. 연구 결과, APT의 "글로벌 뷰(global view)"는 국소적인 조각들만 보는 모델보다 단백질 유형을 분류하는 데 더 뛰어난 성능을 보였습니다.

이 방법이 가능하게 한 멋진 새로운 기술들

이 방식 덕분에 컴퓨터가 단백질의 크기와 모양의 설명을 분리할 수 있게 되었으며, 저자들은 두 가지 구체적인 "마법 같은 기술"을 시연했습니다.

  • 단백질 축소 (Protein Shrinking): 큰 단백질을 가져와서 AI에게 "모양은 그대로 유지하되, 크기만 작게 만들어줘"라고 명령할 수 있습니다. AI는 핵심 구조를 온전히 유지하면서 헤모글로빈과 같은 단백질을 성공적으로 축소했습니다. 이는 세포에 더 잘 들어갈 수 있는 약물을 만드는 데 유용합니다.
  • 친화도 성숙 (Affinity Maturation - 결합력 강화): 만약 표적에 겨우 붙는 수준의 "약한 결합 단백질"이 있다면, AI를 사용하여 더 잘 붙는 변형체를 생성할 수 있습니다. AI는 더 나은 성능을 내는 버전을 찾기 위해 가능성들을 "탐색"하며, 사실상 몇 초 만에 단백질을 진화시킵니다.

핵심 요약

이 논문은 컴퓨터가 단백질의 형태에 대해 "말하는" 새로운 방식을 제시합니다. 단백질을 작고 깨지기 쉬운 벽돌 더미로 설명하는 대신, 진화하는 청사진의 연속으로 설명합니다. 이를 통해 AI는 더 빠르고, 정확하며, 과학 및 의학 분야에서 실제로 사용할 수 있는 새로운 단백질을 만들어낼 수 있게 되었습니다.

참고: 이 논문은 계산적 방법론과 단백질 구조를 생성하고 축소하는 능력에 초점을 맞추고 있습니다. 이 단백질들이 현재 인간 임상 시험에서 사용되고 있거나 승인된 의약품이라는 주장은 아니며, 이 방법이 단백질을 "설계 가능하게(실험 및 테스트가 가능하도록)" 만든다는 점을 강조합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →