Geometric Representations of Knowledge Inside Biological Large Language Models: an Empirical Analysis
이 실증적 연구는 생물학적 거대 언어 모델(SCFMs)이 생물학적 지식을 위한 실제적이고 저차원이며 부분적으로 선형화된 기하학적 구조를 인코딩하고는 있으나, 이 구조는 미미하고 종종 비선형적으로 얽혀 있으며 PCA와 같은 고전적인 발현 기반 방법들이 이미 회복할 수 있는 것과 상당 부분 중첩되어 자연어 모델에서 관찰되는 명료하고 규칙적인 기하학적 구조에는 미치지 못한다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
당신이 상상해 보세요. 모든 책이 인간 몸의 단일 살아있는 세포인 거대하고 마법 같은 도서관이 있습니다. 수년 동안 과학자들은 우리 몸이 어떻게 작동하는지 이해하기 위해 이 책들을 읽으려고 노력해 왔지만, 텍스트는 엉망이고 해독하기 어려웠습니다. 최근, 이 '생물학적 대규모 언어 모델(Biological Large Language Model 또는 Biological LLM)'이라 불리는 새로운 종류의 '슈퍼 리더(super-reader)'가 발명되었습니다. 이들은 수백만 개의 세포 '책'을 학습하여, 마치 당신의 휴대폰 키보드가 다음에 입력할 단어를 예측하는 법을 배우는 것처럼 패턴을 찾아내는 컴퓨터 프로그램입니다.
과학자들이 던진 큰 질문은 이것입니다. 이 슈퍼 리더들이 지식을 깔끔하고 직선적인 방식으로 조직하고 있는가? 에세이를 쓰거나 당신과 대화하는 일반적인 언어 모델(LLM)의 경우, 연구자들은 '왕'과 '여왕' 같은 개념이 직선 위에 놓여 있으며, 반대 개념들은 단순히 한 단계만큼 떨어져 있다는 것을 발견했습니다. 그것은 마치 모든 개념이 자신만의 명확한 거리를 가진 완벽하게 정리된 지도와 같습니다. 과학자들은 이 생물학적 슈퍼 리절러들이 '건강함 vs 아픔'이나 '성장 중 vs 휴식 중'과 같은 것들에 대해 똑같이 깔끔한 직선형 지도를 가지고 있기를 희망했습니다. 만약 그렇다면, 우리는 질병이나 발달 과정을 이해하기 위해 컴퓨터의 사고방식을 쉽게 조정할 수 있을 것이기 때문입니다. 하지만, 우리가 곧 보게 될 것처럼, 이 생물학적 모델 내부의 지도는 깔끔한 도시의 도로보다는 구불구불하고 언덕이 많은 숲길에 가깝습니다.
기계 내부의 지도: 고속도로가 아닌 숲
이 연구에서 올리비아 데니스(Olivia Denvis)라는 연구자는 네 가지 생물학적 슈퍼 리더(scBERT, Geneformer, scGPT, UCE라고 명명됨)를 심층 조사하여, 이들이 정말로 그 깔끔한 직선형 조직을 가지고 있는지 확인하기로 했습니다. 그녀는 이 모델들을 탐험가처럼 취급하여, 세포가 무엇인지, 어디에 사는지, 무엇을 하고 있는지에 대한 상세한 기록이 담긴 420,000개의 세포로 이루어진 방대한 데이터셋 속으로 보냈습니다. 그런 다음 그녀는 모델들의 내부 '지도'를 PCA와 같은 과학자들이 수십 년 동안 사용해 온 오래되고 신뢰할 수 있는 도구들과 비교했습니다.
그녀가 발견한 결과는 다음과 같습니다. 모델들은 지도를 가지고 있지만, 모두가 기대했던 것처럼 선명하고 곧은 고속도로는 아니었습니다.
1. 지도는 조밀하지만, 붐빈다
첫째, 연구진은 모델이 정보를 저장하기 위해 얼마나 많은 공간을 사용하는지 확인했습니다. 1,280개의 선반을 담을 수 있는 거대한 창고(모델의 전체 크기)를 상상해 보세요. 연구 결과, 모델은 지식을 저장하기 위해 실제로 약 12개에서 26개의 선반만을 사용한다는 것을 발견했습니다. 이는 매우 낮은 차원의 공간이며, 이는 모델이 효율적이라는 점에서 좋은 신호입니다. 그러나 이 공간은 '이방성(anisotropic)'을 띠는데, 이는 전문 용어로 말하자 둥근 공 모양이 아니라 길고 좁은 원뿔 모양이라는 뜻입니다. 더 작은 모델들은 이 좁은 원뿔 안에 훨씬 더 꽉 끼어 있었으며, 이는 그들의 사고 방식이 다소 '답답함'을 시사합니다.
2. 쉬운 것은 직선이지만, 어려운 것은 곡선이다
연구자가 모델에게 "이 세포가 남성인가 여성인가?" 또는 "면역 체계에 속하는가?"와 같은 단순한 것을 식별하도록 요청했을 때, 모델들은 놀라운 성능을 보였습니다. 모델들은 일반 언어 모델들처럼 이 그룹들을 분리하기 위해 직선을 그릴 수 있었습니다. 실제로 이러한 쉬운 카테カテゴリ에 대해 모델들은 거의 완벽했습니다.
하지만 반전이 있었습니다. 그녀가 "이 세포가 아픈가?" 또는 "이것은 어떤 구체적인 하위 유형인가?" 또는 "발달 과정 중 어느 단계에 와 있는가?"와 같이 흥미로운 질문을 던졌을 때, 직선은 더 이상 작동하지 않았습니다. 지식은 여전히 존재했지만, 곡선 속에 뒤엉켜 있었습니다.
- 증거: 연구자가 단순한 직선을 사용하여 세포의 발달 시간을 예측하려고 했을 때, 정답률은 약 61%에 불에 그쳤습니다. 하지만 그녀가 컴퓨터가 데이터의 자연스러운 곡선 경로를 따르도록 허용했을 때(마치 들판을 가로지르는 대신 굽이진 길을 따라 걷는 것처럼), 정확도는 80%로 급증했습니다.
- 시사점: 모델은 복잡한 내용을 알고 있지만, 이를 단순한 직선으로는 쉽게 도달할 수 없는 곡선적이고 비선형적인 방식으로 저장하고 있습니다. 이는 복잡한 아이디어조차도 종종 직선 위에 놓이는 언어 모델과는 다른 점입니다.
3. "스티어링 휠(조종 핸들)"은 약간 흔들린다
언어 모델에서 단어의 의미를 바꾸고 싶다면(예를 들어 '행복한'을 '슬픈'으로 바꾸는 것), 특정 벡터(방향)를 더하기만 하면 완벽하게 작동합니다. 연구자는 이를 생물학적 모델에도 시도해 보았습니다. 그녀는 방향 벡터를 더함으로써 세포의 정체성을 '조정(steer)'하려고 시도했습니다.
- 결과: 효과는 있었지만, 약 54%에서 66% 정도만 성공했습니다. 동전 던지기보다는 나았지만, 언어 모델에서 보이는 완벽한 제어에는 훨씬 못 미쳤습니다. 한 가지를 바꾸려고 하면 의도치 않게 다른 무언가가 바뀌기도 했습니다. 서로 다른 아이디어들을 위한 방향들은 어느 정도 평행했지만 완벽하지는 않았으며, 정렬 상태도 약했습니다.
4. 모델들은 서로 동의하지만, "진실"에는 동의하지 않는다
연구자는 또한 네 가지 모델이 서로 같은 방식으로 생각하는지 확인했습니다. 모델들은 서로 상당히 유사했습니다(약 55%~74% 유사). 이는 긍정적인 부분입니다. 하지만 그녀가 모델들을 '골드 스탠다드(Gold Standard)'인 생물학적 지식(세포 유형이 실제 생물학적으로 어떻게 연관되어 있는지에 대한 상세한 지도)과 비교했을 때는, 모델 간의 유사성이 약 36%에서 45%에 불과했습니다.
- 놀라운 점: 모델들은 실제 생물학적 진실보다는 오래된 수학적 도구(PCA)와 더 닮아 있었습니다. 모델들은 복잡한 생물학적 현실보다는 기본적인 수학에 더 가까운, 공유된 단순화된 뷰(view)로 수렴했습니다.
5. "깊은" 지식은 중간에 있다
마지막으로, 그녀는 모델의 층(즉, 모델의 '뇌') 중 어디에 이 지식이 존재하는지 살펴보았습니다.
- 단순 정체성: "어떤 종류의 세포"인지 아는 능력은 모델의 층이 깊어질수록 강해집니다.
- 질병 상태: 세포가 아픈지를 아는 능력은 중간 층에서 정점을 찍은 후, 모델이 깊어짐에 따라 사라졌습니다.
- 배치 효과(Batch Effects): 모델은 초기 층에서 기술적 노이즈(예: 어떤 기계가 사진을 찍었는지)를 무시하는 데 능숙했지만, 이를 완전히 잊지는 못했습니다.
결론
그래서, 판결은 무엇입니까? 생물학적 대규모 언어 모델은 실재하며, 지식의 기하학적 지도를 보유하고 있습니다. 하지만 그것은 우리가 언어 모델에서 보았던 깔끔하고 직선적이며 완벽하게 정리된 지도가 아닙니다. 대신, 그것은 "부분적으로 선형화된 저차원"의 지도입니다.
모델들은 쉬운 것(예: 남성 세포와 여성 세포를 구분하는 것)에는 뛰어나지만, 임상적으로 중요한 어려운 것(예: 질병이나 발달)에 대해서는 지식이 곡선적이고 뒤엉켜 있습니다. 모델이 가진 대부분의 "직선형" 지식은 사실 우리가 이미 오래된 수학적 도구들로부터 얻을 수 있었던 것들입니다. 모델이 새로 학습한 것들은 존재하지만, 곡선 속에 숨겨져 있어 읽고 사용하기가 더 어렵습니다.
이 연구는 이러한 모델들이 유용하기는 하지만, 우리가 기대했던 마법 같은 "직선형" 돌파구는 아니라는 결론을 내립니다. 미래의 과제는 단순히 더 큰 모델을 만드는 것이 아니라, 가장 중요한 생물학적 비밀들이 실제로 숨어 있는 그 곡선지고 구불구불한 길을 읽어낼 수 있는 더 나은 도구를 만드는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.