In Search of Manifolds Inside Protein Language Models: A Largely Negative Report
이 논문은 포괄적인 기하학적 및 위상학적 진단 도구 세트를 사용하여 단백질 언어 모델(pLM)에서의 매니폴드 가설을 체계적으로 조사하며, 단일 세포 파운데이션 모델과는 달리 pLM 표현은 저차원 매니폴드를 중심으로 조직되기보다 주로 고차원적이고 선형적이라는 결론을 내린다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
당신이 거대하고 혼란스러운 도서관을 이해하려고 노력하고 있다고 상상해 보십시오. 이 도서관에서는 모든 책이 단백질, 즉 생명체를 만들고 운영하는 아주 작은 분자 기계입니다. 오랫동안 과학자들은 이 책들을 읽기 위해 '단백질 언어 모델'이라고 불리는 매우 똑똑한 컴퓨터 프로그램들을 사용해 왔습니다. 이 프로그램들은 수십억 개의 단백질 서열을 읽고 단백이 어떻게 접히는지, 어떤 기능을 하는지, 그리고 어떻게 변할 수 있는지를 예측하는 데 익숙한 디지털 탐정들과 같습니다.
하지만 여기 큰 질문이 하나 있습니다. 컴퓨터는 실제로 단백질에 대해 어떻게 "생각"할까요? 컴퓨터가 단백질을 볼 때, 그것을 무질서한 데이터의 더미로 볼까요, 아니면 숨겨진 매끄러운 형상으로 볼까요? 과학자들에게는 '매니폴드 가설(manifold hypothesis)'이라는 아주 좋아하는 아이디어가 있습니다. 이것은 마치 3차원 공간에 떠 있는 거대하게 구겨진 종이 한 장을 상상하는 것과 같습니다. 비록 그 종이가 3차원 공간에 떠 있지만, 만약 당신이 그 위를 걷는 개미라면 세상은 평평한 2차원으로 느껴질 것입니다. '매니폴드 가설'은 컴퓨터의 뇌(고차원)는 거대하고 복잡하지만, 단백질에 대한 중요한 정보는 사실 이 평평한 종이처럼 매끄럽고 낮은 차원의 표면에 숨겨져 있을 것이라고 제안합니다. 이 아이디어는 세포가 어떻게 성장하고 변화하는지를 연구하는 다른 분야에서도 큰 인기를 끌었는데, 과학자들이 그곳에서 세포가 따라가는 매끄럽고 낮은 차원의 "길"을 발견했기 때문입니다. 이제 큰 질문은 이것입니다. 이 단백질을 감지하는 컴퓨터들 또한 그들의 뇌 안에 이러한 매끄럽고 숨겨진 길을 가지고 있을까요?
올리비아 데니스(Olivia Denvis)라는 연구자는 이 단백질 언어 모델 내부의 숨겨진 길을 찾기 위해 보물 찾기에 나서기로 했습니다. 그녀는 단순히 추측만 한 것이 아니라, 일종의 초고성능 금속 탐지기이자 지도 제작기 역할을 하는 거대한 "탐지 배터리"를 구축했습니다. 그녀는 이 도구를 유명한 ESM-2 제품군(800만 개의 파라미터부터 30억 개의 파라미터에 이르는 다양한 크기 포함)과 ProtBERT, ProtT5 같은 다른 모델들에 테스트했습니다. 그녀는 데이터가 실제로 매끄러운 저차원 표면에 놓여 있는지 확인하기 위해 다양한 영리한 기술들을 사용했습니다. 그녀는 데이터가 특정 "고유 차원(intrinsic dimension)"(데이터를 설명하기 위해 실제로 몇 개의 방향이 필요한지를 묻는 세련된 방식)을 가졌는지 확인했고, 패턴이 나타나는지 보기 위해 데이터를 2D 지도로 펼쳐보기도 했으며, 데이터가 특정 물체의 형태(도넛의 구멍처럼)를 띠고 있는지 확인하기 위해 위상학적 루프(topological loops)를 조사하기도 했습니다.
그 결과는 어땠을까요? 대체로 부정적인 보고서였습니다. 보물 찾기는 빈손으로 끝났습니다.
데니스는 이러한 단백질 모델 내부에 매끄러운 저차원의 길이 있다는 아이디어가 아마도 틀렸다는 것을 발견했습니다. 매끄러운 종이가 3차원 공간에 떠 있는 모습 대신, 그녀는 데이터가 광활하고 고차원적인 공간에 퍼져 있다는 것을 발견했습니다. 그녀가 "고유 차원"(데이터를 설명하는 데 필요한 방향의 수)을 측정했을 때, 그것은 2나 3처럼 작고 관리 가능한 숫자가 아니었습니다. 중간 크기의 모델(ESM-2 650M)의 경우 차원은 약 63이었고, 거대한 30억 파라미터 모델의 경우 88로 뛰어올랐습니다. 더욱 결정적인 것은, 모델이 더 커지고 똑똑해질수록 차원도 커졌다는 점입니다. 만약 단 하나의 매끄러운 길이 있었다면, 모델이 개선됨에 따라 차원은 일정하게 유지되거나 더 단순해졌어야 합니다. 대신, 모델은 정보를 저장하기 위해 점점 더 많은 방향을 사용하는 것처럼 보였으며, 이는 구조가 단순한 곡선이라기보다 복잡하고 "고차원적"임을 시사합니다.
그녀는 또한 단일 세포 데이터에서 하는 것처럼 데이터를 2D로 펼치는 "지도 제작" 도구들을 사용해 보았습니다. 하지만 그렇게 했을 때 유용한 정보들이 파괴되었습니다. 그것은 마치 복잡하고 여러 층으로 된 케이크를 팬케이크로 펴려고 하는 것과 같았으며, 그 과정에서 맛(생물학적 정보)이 사라졌습니다. 그녀가 이 펼쳐진 지도들이 단백질의 안정성이나 구조를 예측할 수 있는지 테스트했을 때, 성능은 형편없었습니다. 실제로 가장 단순한 방법, 즉 직선(linear probe)을 이용해 원본 고차원 데이터를 직접 보는 것이 가장 잘 작동했습니다. 컴퓨터는 휘어진 저차원의 길이 필요한 것이 아니라, 수십 개의 차선을 가진 넓고 평평한 고속도로를 필요로 했던 것입니다.
나아가 그녀는 데이터 속에 "루프"나 구멍이 있는지 살펴보았습니다. 이는 데이터가 도넛이나 원 같은 특정한 모양을 하고 있는지를 나타냅니다. 그녀는 아무것도 발견하지 못했습니다. 데이터는 위상학적으로 "자명(trivial)"했습니다. 즉, 흥미로운 모양이 없는 그냥 크고 덩어리진 덩어리였다는 뜻입니다. 그녀는 또한 2D 지도상에서 깔끔한 그룹을 형성하는 것처럼 보였던 단백질 클러스터들이 사실은 착시 현상이라는 것도 발견했습니다. 단백질의 길이와 같은 기본적인 요소들이나 구성 성분(아미노산)의 영향을 제거하자, 그 그룹들은 무너져 내렸습니다. 사람들이 보았다고 생각했던 그 "매니폴드"는 깊은 숨겨진 구조가 아니라, 이러한 기본적이고 지루한 사실들의 반영일 뿐이었습니다.
그녀는 자신의 도구가 고장 난 것인지 확인하기 위해, 매끄러운 길을 가지고 있다고 이미 알고 있는 대상인 합성 "스위스 롤(Swiss roll)" 형태와 실제 단일 세포 데이터를 테스트했습니다. 그녀의 도구들은 완벽하게 작동하여 저차원과 루프를 찾아냈습니다. 이는 그녀의 방법론이 훌륭했다는 것을 증명했습니다. 문제는 도구가 아니라 단백질 데이터 자체에 있었던 것입니다.
그렇다면 이것은 무엇을 의미할까요? 단백질 언어 모델은 세포 발달의 매끄럽고 연속적인 지도와는 다릅니다. 그보다는 길이, 구성 성분, 그리고 가문(family)의 역사가 복잡하게 섞여 모든 책이 정리되어 있는 거대한 고차원 도서관에 더 가깝습니다. 정보는 그곳에 존재하며 믿을 수 없을 정도로 유용하지만, 그것은 단순한 저차원 표면에 숨겨져 있는 것이 아닙니다. 정보는 고차원적인 공간에 퍼져 있으며, 이를 단순한 2D 지도로 강제로 구겨 넣으려 하는 것은 가장 중요한 세부 사항들을 버리는 일이 됩니다. 논문은 결론적으로, 단백질 모델에 대해서는 매끄럽고 휘어진 길을 찾는 것을 멈추고, 그들이 실제로 달리고 있는 넓고 고차원적인 고속도로를 인정해야 한다고 말합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.