TheBioCollection: Unified Pre-Training Scale LLM Corpus for Biology
이 논문은 다양한 생물학적 자원을 계산된 속성과 지시 과제로 풍부하게 구성된 응집된 형식으로 통합하여, 160억 개의 파라미터를 가진 모델의 일반적인 언어 능력은 유지하면서도 여러 도메인에 걸친 생물학적 이해도와 성능을 크게 향상시킨 526억 토큰 규모의 통합 사전 학습 코퍼스인 TheBioCollection을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
생물학의 세계를 흩어진 책들이 사방에 널려 있는 거대하고 혼란스러운 도서관이라고 상상해 보십시오. 어떤 것은 아주 작은 분자 설계도이고, 어떤 것은 거대한 단백질 설명서이며, 또 어떤 것은 세포들이 서로 어떻게 대화하는지를 보여주는 복잡한 지도입니다. 문제는 무엇일까요? 이 "책"들은 수천 가지의 서로 다르고 혼란스러운 언어로 쓰여 있다는 점입니다. 어떤 것은 그저 숫자 목록일 뿐이고, 어떤 것은 그래프이며, 많은 것들은 초지능형 컴퓨터 두뇌(거대언어모델, LLM)가 실제로 읽을 수 없는 형식 속에 갇혀 있습니다.
이때 등장한 것이 바로 THEBIOCOLLECTION입니다. 이들은 이 난장판을 정리하기로 결심한 디지털 사서들입니다. 그들은 단순히 흩어진 자원들을 모으는 데 그치지 않고, 그 모든 지저분한 형식들을 하나의 읽기 쉬운 언어로 변환하는 526억 개의 토큰(정보의 개별 단어 또는 조각)을 포함하는 거대하고 통합된 학습 세트를 구축했습니다.
위대한 번역 작업
연구진은 작은 분자, 단백질, DNA 서열, 심지어 세포 전체에서 데이터를 가져와 영리한 작업을 수행했습니다. 그들은 단순히 데이터를 복사해서 붙여넣은 것이 아닙니다. 그들은 특수한 "번역 도구"를 사용하여 새로운 사실들을 계산하고 이를 자연스러운 문장으로 써 내려갔습니다.
- 분자에 단순히 화학 코드를 부여하는 대신, 시스템은 그 분자의 무게, 고리(ring)의 개수, 그리고 얼마나 "약물 같은지(drug-like)"를 계산하여 이 모든 것을 설명하는 문장을 작성했습니다.
- 단백질의 서열을 단순히 나열하는 대신, 그 형태와 세포 내 어디에 존재하는지에 대한 세부 정보를 추가했습니다.
- 그들은 심지어 이전에 누락되었던 기능들(예: 새로운 단백질 결합체 설계하기 또는 DNA 가닥의 특정 지점 찾기)을 위한 새로운 "퀴즈 문제"(지시 과업)까지 만들어냈습니다.
실험: 두뇌 가르치기
이 새로운 도서관이 실제로 작동하는지 확인하기 위해, 연구진은 생물학 데이터를 전혀 본 적이 없는 Gravity-16B-A3B라는 기본 컴퓨터 두뇌를 가져와 이 새로운 컬렉션을 학습시켰습니다. 결과가 순수하게 새로운 데이터 때문인지, 아니면 두뇌 자체를 변경했기 때문인지를 확실히 하기 위해 그들은 두뇌의 아키텍처를 동일하게 유지했습니다.
결과: 두 자릿수의 도약
결과는 놀라울 정도로 강력했습니다. 이 새로운 컬렉션을 학습한 후, 모델의 생물학적 과업 수행 능력은 두 배 이상 향상되었습니다.
- 전체 점수는 0.223에서 0.499로 뛰어올랐습니다.
- 작은 분자 이해, 단백질 설계, DNA 내 위치 찾기, 심지어 세포가 변화에 어떻게 반응하는지 파악하는 것까지 모든 분야에서 눈에 띄게 좋아졌습니다.
- 가장 큰 개선은 도구를 통해 구조화되고 계산된 데이터가 포함된 영역에서 나타났습니다 (예: 특정 DNA 조절 부위 찾기: 0.134에서 0.516으로 상승, 단백질 결합체 설계: 0.234에서 0.645로 상승).
하지 않은 것 (The "No-Go" Zone)
이 논문이 무엇을 밝혀내지 못했는지(혹은 시도하지 않았는지)를 주목하는 것도 중요합니다. 연구진은 이 모든 생물학 데이터를 추가하는 것이 컴퓨터 두뇌가 일반적인 인간의 언어를 말하거나 일반적인 퍼즐을 푸는 능력을 "망각"하게 만드는지 명시적으로 테스트했습니다. 그들은 자신들의 새로운 모델을 일반 과학 기사와 웹 텍스트만을 읽은 모델과 비교했습니다.
- 결과는 어떠했을까요? 생물학 학습 모델은 일반적인 언어 과업에 대해 웹 텍스트만 읽은 모델과 거의 동일한 수준의 능력을 유지했습니다.
- 이 논문은 일반적인 똑똑함을 희생해야만 생물학적 똑똑함을 얻을 수 있다는 생각에 대해 **반박(rule out)**합니다. 모델은 세상에 대해 대화하거나 추론하는 능력을 잃지 않으면서도 생물학을 학습했습니다.
- 또한 이 논문은 단순히 과학 기사(PubMed 등)를 읽는 것이 약간의 도움은 되지만, 텍스트를 읽는 것만으로는 충분하지 않다고 주장합니다. 구조화되고 도구로 계산된 데이터인 THEBIOCOLLECTION이, 특히 정밀하고 비텍스트적인 사실을 요구하는 과업에서 훨씬 더 큰 상승 효과를 제공했습니다.
교차 도메인의 마법
가장 멋진 발견 중 하나는 모델이 단순히 한 가지 일을 잘하게 된 것이 아니라, 서로 다른 분야 간의 점들을 연결하기 시작했다는 점입니다. 단백질의 기능을 그것이 속한 경로(pathway)와 연결하거나, 약물을 그것이 영향을 미치는 유전자와 연결하도록 요청했을 때, 모델의 정확도는 0.313에서 0.507로 급증했습니다. 이는 모델이 단순히 사실을 암기하는 것이 아니라, 다양한 생물학적 층위를 가로질러 "생각"하는 법을 배우고 있음을 시사합니다.
결론
이 논문은 생물학에 정통한 AI를 구축하는 비결이 반드시 새롭고 복잡한 두뇌 아키텍처에 있는 것이 아니라고 제안합니다. 대신, 고품질의 통합되고 도구로 풍부해진 데이터 라이브러리를 갖추는 것이 핵심입니다. 흩어져 있고 지저한 생물학적 데이터를 응집력 있고 읽기 쉬운 이야기로 변환함으로써, 연구진은 일반적인 AI에게 세상의 나머지 부분을 이해하는 능력을 깨뜨리지 않고도 생명의 깊고 복잡한 언어를 이해하도록 가르칠 수 있음을 보여주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.