← 최신 논문
🧬 biology

Viral Proteins Reveal Geometry of Protein Language Models

본 연구는 단백질 언어 모델이 재구성 퍼플렉서티(reconstruction perplexity)를 기반으로 바이러스 및 세포 서열을 지배적인 '자연성(nativeness)' 축을 따라 정렬함에도 불구하고, 그 임베딩이 단순한 제로샷 지표를 넘어 선형 분리 가능성을 허용할 만큼 충분한 바이러스 특이적 신호를 여전히 유지하고 있음을 입증한다.

원저자: Arthur Bigot, Harmon Bhasin, Core Francisco Park, Eugene Shakhnovich, Dianzhuo Wang

게시일 2026-06-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Arthur Bigot, Harmon Bhasin, Core Francisco Park, Eugene Shakhnovich, Dianzhuo Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

개요: AI가 생명의 "언어"를 배우는 법

당신에게 생물학에 관한 거의 모든 책을 읽은 초지능 AI가 있다고 상상해 보세요. 이 AI는 **단백질 언어 모델(Protein Language Model, pLM)**입니다. 인간이 수백만 권의 책을 읽으며 영어를 배우는 것처럼, 이 AI는 수백만 개의 유전 서열을 읽으며 단백질의 "언어"를 배웁니다.

연구자들은 다음과 같은 의문을 가졌습니다: 만약 이 AI가 주로 인간, 식물, 박테리아에 관한 책을 읽었다면, 이 AI는 바이러스가 사용하는 "방언"을 이해할 수 있을까?

바이러스는 까다롭습니다. 거대한 도서관 속에 있는 작고 시끄러운 소수 집단과 같습니다. 바이러스는 빠르게 돌연변이를 일으키고, 게놈이 매우 작으며, 생존을 위해 숙주에 의존합니다. 연구 결과, AI는 바이러스를 이해하고 있었지만, 매우 특정한 '기하학적' 방식으로 이해하고 있었습니다.


1. "토착적" vs "외래적" 축

연구자들은 AI의 뇌 내부에는 모든 단백질을 분류하는 거대한 보이지 않는 자(수학적 선)가 있다는 것을 발견했습니다. 이를 **"토착성 척도(Nativeness Scale)"**라고 불러보겠습니다.

  • 왼쪽 끝 (홈 팀): 척도의 한쪽 끝에는 인간, 박테리아, 식물의 단백질이 놓여 있습니다. 이들은 "토착적(native)"인 단백질입니다. AI는 이들에 대해 수십억 번이나 읽었습니다. 이들은 AI의 기대치에 완벽하게 부합합니다.
  • 중간 (손님): 척도의 중간에는 바이러스 단백질이 놓여 있습니다. 이들은 "틀린" 것은 아니지만, 마치 현지 관습을 잘 모르는 손님처럼 느껴집니다. 홈 팀과는 구별되지만 여전히 말이 되는 수준입니다.
  • 오른쪽 끝 (횡설수설): 척도의 먼 끝에는 무작위로 뒤섞인 아미노산 문자열이 있습니다. 이는 단어가 순서에 맞지 않거나 지어낸 단어로 이루어진 문장과 같습니다. AI는 이를 헛소리로 간주합니다.

발견된 사실: AI는 바이러스를 단순히 "나쁜 것"이나 "무작위적인 것"으로 보는 것이 아닙니다. AI는 바이러스를 "완벽하게 정상적인" 세포 단백질과 "완전한 헛소리" 사이의 특정하고 조직된 그룹으로 인식합니다.

2. "혼란도" (Perplexity)

AI는 어떻게 단백질을 이 척도의 어디에 배치할지 결정할까요? AI는 **퍼플렉시티(Perplexity, 혼란도)**라는 점수를 사용합니다.

  • "다음 단어 맞히기" 게임을 생각해 보세요. 만약 당신이 "고양이가 매트 위에..."라고 말한다면, AI는 다음 단어가 "매트"일 것이라고 매우 확신합니다. 이때 혼란도는 낮습니다.
  • 만약 "고양이가 매트 위에..."라고 했는데 다음 단어가 "바나나"라면, AI는 매우 혼란스러워합니다(높은 혼란도).

연구에 따르면 세포 단백질은 "매트"와 같습니다(예측하기 쉬움). 바이러스 단백질은 "바나나"와 같습니다(예측하기 조금 더 어렵지만, 여전히 실재하는 단어임). 무작위 쓰레기는 "플리버(flibber)"와 같습니다(완전한 헛소리).

AI의 내부 척도는 이 "혼란도"와 거의 완벽하게 일치합니다. AI가 더 혼란스러울수록, 그 단백질은 척도의 오른쪽 멀리 위치하게 됩니다.

3. 모델을 키운다고 해서 모든 것이 해결되지는 않는다

보통 AI의 규모를 키우면(더 많은 뇌 용량과 데이터를 주면) 모든 분야에서 성능이 좋아집니다. 연구자들은 AI 모델을 점점 더 크게 만들면서 이 점을 테스트했습니다.

  • 결과: 더 큰 모델이 바이러스를 이해하는 데 도움이 되긴 했지만, 모든 바이러스에 대해 똑같이 적용되지는 않았습니다.
  • 비유: 새로운 억양을 배우려는 선생님을 상상해 보세요.
    • 어떤 바이러스 군(예: 레트로바이러스과, Retroviridae)은 선생님의 모국어와 매우 유사한 방언을 사용하는 학생과 같습니다. 선생님이 더 똑똑해질수록, 이 학생들을 거의 완벽하게 이해하게 됩니다.
    • 다른 바이러스 군(예: 독감을 포함하는 오르토믹스바이러스과, Orthomyxoviridae)은 완전히 다르고 복잡한 방언을 사용하는 학생과 같습니다. 선생님이 초지능이 되더라도, 이 특정 학생들을 이해하는 데는 여전히 어려움을 겪습니다.

따라서 AI를 크게 만드는 것이 도움이 되기는 하지만, 모든 바이러스를 갑자기 "정상적"으로 보이게 만들지는 못합니다. 어떤 바이러스들은 여전히 독특하고 "외래적인" 상태로 남습니다.

4. AI는 단순히 "혼란" 이상의 것을 알고 있다

여기 놀라운 사실이 있습니다. 연구자들은 다음과 같이 물었습니다: AI가 바이러스를 구분하는 것이 단순히 그들이 "혼란스러워서(높은 퍼플렉시티)"인가, 아니면 실제로 무엇이 바이러스를 바이러스답게 만드는지를 이해하고 있는 것인가?

그들은 간단한 테스트를 설계했습니다:

  1. 방법 A: "혼란도"만을 사용하여 단백질이 바이러스인지 추측합니다.
  2. 방법 B: AI의 깊은 내부 "생각"(임베딩, embeddings)을 사용하여 추측합니다.

결과: 방법 B(깊은 생각)가 방법 A보다 훨𝙩 훨씬 더 뛰어났습니다.
AI가 바이러스를 너무 잘 이해하게 되어 더 이상 "혼란스럽게(낮은 퍼플렉시티)" 보이지 않을 때조차도, AI의 내부 지도는 어떤 것이 바이러스인지 정확히 알고 있었습니다.

비유: 군중 속에서 스파이를 찾아내는 상황을 상상해 보세요.

  • 방법 A는 사람들이 불안해 보이는지(높은 혼란도)를 보는 것입니다.
  • 방법 B는 그들의 몸짓, 걸음걸이, 손을 어떻게 움직이는지(임베딩)를 보는 것입니다.
    연구 결과, 스파이가 더 이상 불안해 보이지 않더라도, AI는 단순한 혼란을 넘어선 미묘하고 특정한 "바이러스 시그니처"를 학습했기 때문에 여전히 그들을 찾아낼 수 있다는 것을 발견했습니다.

연구 결과 요약

  1. "토착성" 선이 존재함: AI는 단백질을 "매우 정상적"인 것부터 "매우 이상한" 것까지 하나의 선 위에 배치합니다. 바이러스는 그 중간에 위치합니다.
  2. 규모가 항상 모두에게 좋은 것은 아님: 더 큰 AI 모델은 일부 바이러스를 더 "정상적"으로 보이게 만들지만, 다른 바이러스들은 여전히 독특하게 남습니다.
  3. AI는 차이를 알고 있음: AI는 단순히 예측하기 어렵기 때문에 바이러스를 분리하는 것이 아닙니다. AI는 일반적인 단백질과 매우 유사해 보일 때조차도 바이러스를 식별할 수 있는 특정한 "바이러스 신호"를 유지하고 있습니다.

이것이 중요한 이유 (논문에 따르면):
이는 이 강력한 AI 도구들이 생물학적 세계를 어떻게 "보는지" 이해하는 데 도움을 줍니다. 이 모델들이 주로 인간과 동물의 데이터로 훈련되었음에도 불구하고, 변화가 빠르고 독특한 바이러스의 세계를 처리하기 위한 구조화된 방식을 개발했다는 것을 보여줍니다. 이는 우리가 언제 AI의 예측을 믿어도 될지, 그리고 언제 주의해야 할지를 아는 데 매우 중요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →