← 최신 논문
💻 bioinformatics

ProtBLIP2-SST: Protein Function Prediction via BLIP2 with Sequence, Structure, and Text

ProtBLIP2-SST는 구조 인식 언어 모델과 Q-Former 프로젝터를 통해 단백질 서열 및 3D 구조 정보를 통합함으로써, 대규모 언어 모델이 유연하고 개방적인 기능적 캡션을 생성할 수 있도록 하여 기존의 경직된 유전자 온톨로지 분류의 한계를 극복하는 새로운 2단계 프레임워크이다.

원저자: Chen, Z., Luo, Q.

게시일 2026-07-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chen, Z., Luo, Q.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

당신은 단백질을 가지고 있다고 상상해 보세요. 단백질은 기본적으로 긴 아미노산 사슬로 이루어진 작고 복잡한 기계와 같습니다. 오랫동안 이 기계들이 무엇을 하는지 알아내려 했던 과학자들은 "라벨 맞히기" 게임을 해왔습니다. 그들은 문자열을 보고 "DNA와 결합하는가? 예/아니오"와 같이 딱딱한 체크리스트의 항목을 체크하려고 노력했습니다. 이는 마치 영화 전체를 보고 "액션", "코미디", "드라마"라고 체크 표시만 하며 영화를 설명하려는 것과 같습니다. 당신은 줄거리와 등장인물, 그리고 느낌을 놓치게 됩니다.

다른 연구자들은 거대 AI 챗봇(대규모 언어 모델)을 사용하여 단백질에 대한 자유로운 형식의 이야기를 쓰도록 시도했습니다. 하지만 함정이 있었습니다. 이 AI 모델들은 오직 아미노산 문자열만을 보고 있었다는 점입니다. 그들은 레시피를 읽고 있었지만, 그 레시피가 만들어낼 케이크의 3D 형태는 무시하고 있었습니다. 단백질의 기능은 종종 어떻게 접히느냐(folding)라는 특정 3D 구조에 달려 있기 때문에, 구조를 무시하는 것은 자동차 엔진을 이해하기 위해 부품 목록만 읽고, 그 부품들이 어떻게 맞물려 돌아가는지는 전혀 보지 않는 것과 같습니다.

핵심 아이디어: ProtBLIP2-SST
이 논문의 저자들은 이를 해결하기 위해 ProtBLIP2-SST라는 새로운 시스템을 구축했습니다. 이것은 단순히 재료(서열)를 읽는 것을 넘어, 설계도(3D 구조)를 손에 쥐고 이야기를 쓰는 매우 똑똑한 번역기라고 생각하면 됩니다.

이들이 이를 어떻게 구축했는지 단계별로 살펴보겠습니다.

1. "구조 인지형" 사전
먼저, 아미노산 문자열과 3D 형태를 모두 AI에 입력할 방법이 필요했습니다. 그들은 SaProt라는 도구를 사용했습니다. SaProt를 아미노산(예: "A" 또는 "B")에 대한 단어뿐만 아니라 3D 형태(예: "접힌 모양" 또는 "뒤틀린 모양")에 대한 특수 토큰까지 갖춘 사전이라고 상상해 보세요. 이는 서열과 구조를 하나의 매우 상세한 묘사로 융합합니다.

2. "번역기" (Q-Former)
다음으로, AI에게 이 새로운 복잡한 단백질 언어를 가르쳐야 했습니다. 그들은 Q-Former라는 "번역기" 모듈을 사용했습니다(BLIP-2라는 모델에서 빌려온 것입니다).

  • 설정: 그들은 이미 알고 있는 것을 잊어버리지 않도록 단백질 인코더(SaProt)와 텍스트 인코더(BiomedBERT)를 고정(freeze)했습니다.
  • 학습: 그들은 Q-Former가 가교 역할을 하도록 가르쳤습니다. 이 과정에서 세 가지 다른 기술을 사용했습니다.
    • 대조 학습(Contrastive Learning): "이 단백질과 이 텍스트 설명은 서로 어울리지만, 저것은 그렇지 않다."
    • 매칭(Matching): "이 특정 단백질이 이 문단에서 설명하는 그 단백질인가? 예 또는 아니오."
    • 캡셔닝(Captioning): "여기 단백질이 있다; 이것에 대해 짧은 이야기를 써라."
  • 결과: Q-Former는 단백질의 가장 중요한 "특징"을 추출하여 큰 AI가 이해할 수 있는 형식으로 변환하는 법을 배웠습니다.

3. "스토리텔러" (Galactica)
마สุดท้าย, 그들은 이 번역기를 Galactica-1.3B라는 과학용 AI에 연결했습니다. 거대한 뇌 전체를 다시 학습시키는 것은 너무 비용이 많이 들기 때문에, 대신 LoRA라는 가벼운 어댑터를 사용하여 단백질 특징을 듣는 법을 가르쳤습니다. 이제 당신이 단백질을 입력하면, 모델은 단순히 체크리스트를 내뱉는 것이 아니라, 그 단백질이 무엇을 하는지, 세포 어디에 사는지, 어떤 가문에 속하는지를 포함한 풍부한 자유 텍형 설명을 작성합니다.

그들이 발견한 것 (증거)
팀은 441,000개의 Swiss-Prot 단백질-텍스트 쌍과 AlphaFold 데이터베이스의 3D 구조를 사용하여 테스트를 진행했습니다.

  • 점수: 그들의 새로운 모델인 ProtBLIP2-SST는 거의 모든 테스트에서 이전의 최고 모델들(ProtT3 등)을 이겼습니다.
    • 검색(Retrieval)(단백질에 맞는 텍스트 찾기)의 경우, 650M 버전의 모델은 평균 90.83점을 기록하며 서열 전용 모델들을 앞질렀습니다.
    • **설명 쓰기(Captioning)**의 경우, 서열 전용 모델에 비해 BLEU-4 (58.53) 및 **ROUGE-L (68.23)**과 같은 지표에서 더 높은 점수를 받았습니다.
  • "아하!" 모먼트: 그들은 왜 이것이 더 잘 작동하는지 확인하기 위해 심층 분석을 수행했습니다. 그들은 3D 구조를 추가하는 것이 단백질의 기능(예: "이 효소는 당을 분해한다")을 설명하는 데 가장 큰 도움이 된다는 것을 발견했습니다. 이는 기능이 흔히 3D 형태에 달려 있기 때문에 타당합니다.
  • 한계: 그러나 3D 구조는 유사성(Similarity) 라벨(예: "이것은 X 가문과 닮았다")에는 큰 도움이 되지 않았습니다. 논문은 이것이 유사성이 형태가 아닌 주로 서열의 글자들에 관한 것이기 때문이라고 제안합니다.

그들이 배제한 것들
이 논문은 몇 가지 사항에 대해 명시적으로 반박합니다.

  • 서열만으로는 부족하다: 그들은 3D 구조 없이 아미노산 문자열만 보는 모델이 일관되게 낮은 점수를 기록함을 보여주었습니다.
  • 별도의 인코더는 투박하다: 그들은 서열과 구조를 별도로 인코딩한 후 나중에 합치려고 시도하는 모델에 반대했습니다. 그들의 방식은 처음부터 이들을 융합하며, 이것이 더 효과적이었습니다.
  • 원시 데이터를 그대로 붙여넣는 것은 작동하지 않는다: 그들은 Q-Former 번역기 없이 아미노산 문자열을 AI에 직접 입력해 보았으나, 결과는 처참했습니다(일부 테스트에서 정확한 일치도가 0.00이었습니다). "번역" 단계가 결정적입니다.

얼마나 확신하는가?
저자들은 이전에 본 적 없는 9,239개의 단백질에 대해 검증된 세트(held-out set)를 사용하여 테스트했으므로 자신들의 수치에 상당히 확신하고 있습니다. 그들은 단순히 추측한 것이 아니라 측정했습니다.

  • 그들은 35M 규모에서 서열 전용 모델보다 24개 더 많은 정확한 일치를 찾아냈고, 650M 규모에서는 22개 더 많은 일치를 찾아냈습니다.
  • 그들은 3D 구조의 이점이 "작업 의존적(task-dependent)"이라고 제안합니다. 즉, 어떤 작업(기능)에는 큰 도움이 되지만 다른 작업(유사성)에는 그렇지 않다는 뜻입니다.

결론
ProtBLIP2-SST는 만약 AI가 단백질의 이야기를 진정으로 이해하게 하고 싶다면, 단순히 레시피만 주어서는 안 되며 3D 형태도 보여주어야 한다는 점을 시사합니다. 서열, 구조, 그리고 똑똑한 번역기를 결합함으로써, 그들은 경직된 체크리스트를 넘어 단백질 기능에 대한 유연하고 인간이 읽을 수 있는 설명을 생성하는 시스템을 만들어냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →