The Complex Geometry of Biological Knowledge in Artificial Intelligence: Manifolds, Spectra, and Concept Structure in Foundation-Model Representations
이 연구는 단백질 언어 모델이 선형적으로 해독 가능한 생물학적 의미 정보를 인코딩하고 있음에도 불구하고, 단일 세포 파운데이션 모델에서 발견되는 복잡한 저차원 매니폴드, 다중 스케일 스펙트럼 구조, 그리고 계층적 개념 기하학은 결여되어 있으며, 대신 서열 데이터의 이산적이고 동형성 중심적인 특성에 의해 형성된 기하학적으로 단순하고 고선형 차원적인 공간을 통해 지식을 표현한다는 것을 밝혀냈다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
거대한 도서관이 책을 어떻게 정리하는지 이해하려고 노력하고 있다고 상상해 보십시오. 인공지능의 세계에는 특정 주제의 규칙을 배우기 위해 방대한 양의 데이터로 훈련된 거대한 컴퓨터 프로그램인 "파운데이션 모델(foundation models)"이 있습니다. 이 중 한 가지 인기 있는 유형은 세포의 유전 코드나 단백질 서열과 같은 생물학적 데이터로 훈련됩니다. 과학자들은 최근 일부 모델, 특히 세포 데이터로 훈련된 모델들이 매우 정교한 내부 지도를 가지고 있다는 사실을 발견했습니다. 이 모델들은 정보가 매끄럽고 구부러진 경로(이를 "매니폴드(manifold)"라고 부릅니다)를 따라 조직되어 있는 것처럼 보이며, 마치 아름답고 복잡한 조각품처럼 다층적이고 복잡한 구조를 가진 것으로 나타납니다. 이는 흥로운 일입니다. 만약 컴퓨터가 지식을 복잡한 조각품처럼 조직한다면, 우리가 그 모델이 어떻게 생각하는지 이해하고 심지어 그 구조를 사용하여 새로운 생물학을 발견하는 것이 더 쉬워질 수 있기 때문입니다.
하지만 여기 큰 질문이 있습니다. 모든 생물학적 AI 모델이 이런 방식으로 지식을 조직할까요? 그렇다면 단백질에 대해 훈련된 모델들은 어떨까요? 단백질은 우리 몸 안에서 대부분의 일을 수행하는 작은 기계이며, 그들의 "언어"는 아미노산으로 이루어진 긴 문자열입니다. 만약 이 단백질 모델들 또한 그와 같은 정교하고 구부러진 기하학적 구조를 가지고 있다면, 이는 과학자들이 그들을 해독하려는 데 있어 엄청난 승리가 될 것입니다. 만약 그렇지 않다면, 우리는 보물 지도를 찾고 있는 것이 아니라 그저 평평하고 탁 트인 들판을 보고 있는 것일지도 모릅니다. 이 논문은 이 단백질 모델들을 돋보기로 자세히 들여다보고, 그들이 세포 중심의 모델들과 같은 비밀스럽고 복잡한 건축물을 정말로 가지고 있는지, 아니면 그들의 내부 세계가 완전히 다른 종류의 논리에 의해 구축되었는지 확인하고자 합니다.
위대한 단백질 지도 탐사: 곡선 대 구름의 이야기
단백질 언어 모델(pLM)을 만나보십시오. 이들을 세상의 모든 레시피(수억 개의 단백질 서열)를 맛본 뒤, 완성된 요리를 단 한 번도 본 적 없으면서도 요리의 규칙을 배운 매우 똑똑한 요리사라고 생각하십시오. 이들은 단백질이 3D 구조로 어떻게 접힐지, 혹은 체내에서 어떤 역할을 할지를 예측할 수 있을 정도로 뛰어납니다. 과학자들은 질문해 왔습니다: "이 요리사는 자신의 뇌 속에 지식을 어떻게 조직하고 있는가?"
한동안 그 답은 "복잡하고 구부러진 미로 속"인 것처럼 보였습니다. 세포(단번의 단일 세포) 데이터로 훈련된 다른 생물학적 AI 모델들은 정보가 고차원적인 방을 가로질러 휘감겨 있는 리본처럼, 매끄럽고 저차원적인 곡선 위에 저장되어 있음이 밝혀졌습니다. 그들은 "스펙트럼"(무지개의 뚜렷한 색 띠와 같은 것)과 "개념 계층 구조"(아이디어가 깔끔하게 가지를 치는 가계도와 같은 것)를 가지고 있었습니다. 이는 다음과 같은 큰 가설로 이어졌습니다: 아마도 모든 생물학적 AI는 이러한 정교하고 복형적인 기하학적 모양 안에 지식을 조직할 것이다.
리우 첸(Liu Chen) 연구원이 이끄는 이 논문은 그 가설을 테스트하기로 했습니다. 그들은 ESM-2 제품군(800만 개의 파라미터 규모의 작은 모델부터 30억 개의 파라미터를 가진 거대 모델까지 포함)과 ProtBERT, Ankh 같은 다른 모델들을 포함한 8가지 서로 다른 단백질 모델의 뇌를 검사하기 위해 "세 가지 렌즈 배터리"를 구축했습니다. 그들은 단순히 관찰한 것이 아니라, 세 가지 특정 요소를 측정하기 위해 엄격한 도구 세트를 사용했습니다:
- 모양 (매니폴드): 데이터가 매끄럽고 구부러진 표면 위에 조직되어 있는가?
- 스펙트럼: 데이터가 무지개처럼 뚜렷하게 분리된 정보의 띠를 가지고 있는가?
- 개념: 아이디어들이 깔끔한 계층 구조나 가계도로 배열되어 있는가?
그들은 또한 복잡한 모양(예: 꼬인 도넛이나 나선형)을 가진 것으로 알려진 "합성 제어 데이터(synthetic controls)"에 대해서도 동일한 테스트를 실시했습니다. 만약 그들의 도구가 제대로 작동한다면, 가짜 데이터에서도 복잡한 모양을 발견해야 했습니다.
결론: 그것은 곡선 미로가 아니라 평평하고 선형적인 구름이다
결과는 다소 놀라웠지만 매우 명확했습니다. 저자들은 단백질 언어 모델이 세포 모델이 가진 복잡하고 구부러진 기하학적 구조를 가지고 있지 않다는 것을 발견했습니다. 대신, 그들의 내부 지식은 "실재하지만 단순합니다."
1. 모양: 리본이 아닌 구름
연구진이 단백질 데이터가 존재하는 매끄럽고 구부러진 표면(매니폴드)을 찾으려 했을 때, 아무것도 찾지 못했습니다.
- 발견된 사실: 데이터가 저차원의 곡선 위에 있는 것처럼 보일 수는 있지만(큰 모델들의 비선형 내재 차원은 약 26), 실제 현실은 다릅니다. 데이터는 실제로 거대하고 고차원적인 공간에 퍼져 있습니다(선형 차원은 약 131).
- 비유: 구겨진 종이를 펴려고 한다고 상상해 보십시오. 만약 그것이 매끄러운 리본이라면 쉽게 펼 수 있을 것입니다. 하지만 이 단백질 모델들은 거대하고 폭신폭신한 솜사탕 구름과 같습니다. 멀리서 보면 작아 보이지만, 이를 평평한 모양으로 압착하려고 하면 그냥 사방으로 퍼져 버립니다.
- 증거: 연구진이 데이터를 시각화하기 위해 (2D 그림을 만드는 데 인기 있는 UMAP과 같은) 정교하고 구부러진 수학적 방법을 사용했을 때, 결과는 형편없었습니다. 모델은 단백질 특성을 예측하는 능력을 상실했습니다. 그러나 단순하고 직선적인 수학(선형 프로브)은 완벽하게 작동했습니다. 저자들은 단백질 지식의 "기하학"이 매끄럽고 구부러진 매니폴드가 아니라, "근사적으로 선형적인 고차원 구름"이라고 결론지었습니다.
2. 스펙트럼: 무지개가 아닌 하나의 매끄러운 슬라이드
다음으로, 그들은 노래의 주파수를 보는 것과 같은 데이터의 "스펙트럼"을 살펴보았습니다.
- 발된다 사실: 그들은 멱법칙(지수가 1에 가까운 특정 수학적 곡선)을 따르는 단일하고 매끄러운 데이터 슬라이드를 발견했습니다. 서로 다른 생물학적 개념을 구분하는 뚜렷한 "띠"나 간극은 없었습니다.
- 비유: 세포 모델이 뚜렷한 빨강, 주황, 파랑 띠가 있는 무지개라면, 단백질 모델은 단일하고 매끄러운 회색 그라데이션과 같습니다. 데이터의 내부 구조에서 한 유형의 단백질과 다른 유형을 구분 짓는 날카로운 경계선은 없습니다.
- 미묘한 차이: 복잡한 구조는 없었지만, 그 매끄러운 슬라이드의 기울기(지수)는 실제로 매우 유용했습니다. 그것은 "품질 점수"처럼 작동했습니다. 슬라이드가 더 평평할수록(지수가 1에 가까울수록), 모델은 실제 작업에서 더 나은 성능을 보였습니다. 즉, 구조는 복잡하지 않았지만, 그것은 모델이 얼마나 우수한지를 나타내는 신뢰할 수 있는 지표였습니다.
3. 개념: 계층적이지 않고 평평함
마지막으로, 그들은 모델이 "이것이 막 단백질인가?" 또는 "이것의 2차 구조는 무엇인가?"와 같은 "개념"을 어떻게 조직하는지 확인했습니다.
- 발견된 사실: 모델은 단순하고 직선적인 방법을 사용하여 이러한 질문에 답하는 데 탁 ఎ이스였습니다. 만약 선형 프로브에게 "이것이 막 단백질입니까?"라고 묻는다면, 모델은 높은 정확도로 "예"라고 답했습니다. 그러나 이러한 개념들 사이의 관계는 평평했습니다.
- 비유: 도서관을 상상해 보십시오. 복잡한 계층 구조에서는 책이 대륙, 국가, 도시, 거리 순으로 배치됩니다. 이 단백질 모델들에서 책은 그저 거대하고 평평한 테이블 위에 흩어져 있습니다. 당신은 올바른 책을 쉽게 찾을 수 있지만(선형 디코더 능력), 그들을 연결하는 깔끔한 가계도는 존재하지 않습니다. "유추" 테스트(A가 B인 관계가 C와 D의 관계와 같은지 확인하는 것) 또한 실패했습니다. 관계가 약했고, 언어 모델에서처럼 평행한 방향으로 정렬되지 않았습니다.
- 혼란 변수: 저자들은 또한 일부 겉으로 드러나는 구조가 깊은 생물학적 의미보다는 단백질의 길이 나 특정 아미노산의 함량과 같은 기본적인 특징에 반응한 결과라는 것을 발견했습니다.
왜 차이가 나는가? 데이터의 본질
이 논문은 왜 단백질 모델이 세포 모델과 다른지에 대한 매혹적인 이유를 제시합니다.
- 세포 데이터: 세포는 연속적으로 변화합니다. 줄기 세포는 서서히 혈구 세포로 변합니다. 이는 데이터 상에서 매끄럽고 휘감기는 경로(매니폴드)를 만들어냅니다.
- 단백질 데이터: 단백질은 불연속적입니다. 단백질은 20가지 가능한 아미노산의 문자열로 구성됩니다. 가능한 모든 단백질의 공간은 거대하고 "덩어리져" 있으며, 매끄러운 전이가 아닌 진화적 역사(상동성)에 의해 조직됩니다.
- 결론: 데이터 자체가 불연속적이고 클러스터 형태로 흩어져 있기 때문에, AI 모델은 매끄럽고 구부러진 지도를 구축할 필요가 없습니다. 모델은 단지 지식을 고차원의 선형 구름 형태로 펼쳐 놓을 뿐입니다. 세포 모델에서 보고된 "복잡한 기하학"이 단백질로 전이되지 않는 이유는 근본적인 현실이 다르기 때문입니다.
핵심 요약
저자들은 단백질 모델의 생물학적 지식이 실재하며 접근 가능하지만, 기하학적으로는 단순하다고 결론지었습니다.
- 효과적인 것: 단순한 선형 도구(선형 프로브 및 PCA와 같은 것)가 이 모델들을 읽는 가장 좋은 방법입니다.
- 효과적이지 않은 것: 이 모델들을 복잡하고 구부러진 모양에 억지로 끼워 맞추거나, 내부 구조에서 깊고 계층적인 가계도를 찾는 것은 막다른 길입니다.
- 희망적인 부분: 지식이 선형적이고 단순하다는 사실은 오히려 좋은 일입니다. 이는 우리가 신비롭고 구부러진 미로를 해독할 필요 없이, 모델로부터 직선적인 답변을 얻을 수 있다는 것을 의미합니다. 세포 모델에는 아름답게 적용되었던 "복잡한 기하학" 가설이 단백질의 세계에는 맞지 않습니다. 이 논문은 단백로에 있어서는 지도가 휘감긴 리본이 아니라, 광활하고 탁 트인, 그리고 놀라울 정도로 단순한 들판임을 확인해 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.