BOTANIC-1: a series of long-context plant genomic foundation models in the agentic era
이 논문은 미주석 식물 데이터로 학습되어 형질 관련 영역을 예측하는 데 있어 기존 모델보다 뛰어난 성능을 보이고 기계론적 해석 가능성을 통해 생물학적 통찰력을 제공하며, 기후 탄력적 작물 개발을 가속화하기 위해 연구 커뮤니티에 공개된, 장문 맥락 및 에이전트 통합형 유전체 언어 모델 제품군인 Botanic1을 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
생명의 코드가 A, C, G, T라는 네 개의 글자로 이루어진 언어로 쓰여 있는 세상을 상상해 보십시오. 이 글자들은 식물이 어떻게 자라고, 어떻게 가뭄을 견디며, 어떻게 질병과 싸우는지를 결정하는 DNA 서열을 형성합니다. 수십 년 동안 과학자들은 이 언어를 읽으려 노력해 왔지만, 이는 수십억 개의 단어로 이루어진 거대하고 복합적인 텍스트이며, 그 중 상당 부분은 종마다 다르게 나타나는 방언으로 쓰여 있습니다. 식물이 혹독한 기후나 새로운 해충에 직면했을 때, 그 해결책은 종종 이 코드의 아주 작은 변화, 즉 작물을 더 강하게 만들 수 있는 단 하나의 글자 교체에 달려 있습니다. 이러한 특정한 변화를 찾는 것은 마치 건초더미에서 바늘을 찾는 것과 같지만, 그 건초더미는 도서관 규모만큼 거대하며 바늘은 육안으로는 보이지 않습니다. 전통적인 방식은 많은 식물을 비교하여 패턴을 찾는 데 의존하지만, 이는 느리고 비용이 많이 들며, 종종 연구자들에게 단 하나의 명확한 답 대신 수천 가지의 가능성만을 남겨줍니다.
파리의 한 연구팀은 이제 이 생물학적 텍스트를 읽는 새로운 방법을 도입했습니다. 그들은 식물 DNA의 문법을 이해하도록 특별히 설계된 '보타닉1(Botanic1)'이라 불리는 인공지능 모델 제품군을 구축했습니다. 이 모델들은 인간이 생물학적 규칙을 가르쳐주지 않아도 스스로 언어를 학습했습니다. 모델에는 이끼부터 거대한 나무에 이르기까지 320종의 다양한 식물 유전 서열이 입력되었고, 서열에서 누락된 글자를 예측하도록 요청되었습니다. 이 과정을 수백만 번 반복하면서, 모델은 DNA가 어떻게 구조화되는지, 유전자가 어떻게 켜지고 꺼지는지, 그리고 코드의 미세한 변화가 식물에 어떤 영향을 미치는지에 대한 숨겨진 규칙을 학습했습니다. 그 결과, 이 시스템은 긴 DNA 구간을 보고 어떤 부분이 식물의 생존에 결정적인지, 그리고 어떤 변화가 해롭거나 유익할지를 즉각적으로 감지할 수 있게 되었습니다.
연구진은 단순히 하나의 모델을 만든 것이 아니라, 모델의 학습과 테스트 전 과정을 관리하기 위해 지능형 소프트웨어 에이전트를 사용하는 '공장'을 만들었습니다. 이 에이전트들은 데이터 정리, 실험 실행, 오류 수정 등의 힘든 작업을 처리하여, 인간 과학자들이 거대한 아이디어에 집중할 수 있도록 해줍니다. 이러한 접근 방식 덕분에 연구진은 최대 128,000개의 글자에 달하는 DNA 서열을 읽을 수 있는 모델을 훈련할 수 있었으며, 이는 이전에는 함께 분석하는 것이 불가능했던 게놈의 서로 다른 부분들 사이의 장거리 상호작용을 포착할 수 있는 길이입니다. 테스트 결과, 이 모델들은 훨씬 더 크고 훨씬 더 많은 데이터로 훈련된 기존의 도구들을 포함하여 식물 유전학을 이해하기 위한 모든 기존 도구보다 뛰어난 성능을 보였습니다. 이들은 유전자의 시작과 끝을 알리는 경계와 같은 DNA의 가장 중요한 부분을 식별해 냈으며, 심지어 세포가 자신의 유전적 지침을 어떻게 편집(cut and paste)할지 알려주는 특정 신호까지 찾아냈습니다.
이 발견이 특히 강력한 이유는 모델이 그 규칙들을 배우기 전까지는 그것들이 무엇인지 알지 못했다는 점에 있습니다. 연구진이 모델 내부를 들여다보며 모델이 무엇을 배웠는지 확인했을 때, AI는 '스플라이스 사이트(splice sites)'와 같이 유전자가 단백질이 되기 전 어떻게 편집되는지에 대한 지침을 독립적으로 발견했습니다. 한 가지 놀라운 사례로, 모델은 표준 과학 데이터베이스가 20년 넘게 잘못 표시해 온 유전자 내의 특정 위치를 식별해 냈습니다. 모델의 내부 논리는 다른 지점을 가리켰고, 연구진이 해당 유전자의 역사를 확인했을 때 1999년의 원래 설명이 실제로 옳았으며 모델이 이후 업데이트 과정에서 소실되었던 진실을 재발견했음을 확인했습니다. 이는 이 모델들이 데이터 속에 숨겨져 있지만 인간의 주석(annotation)에서는 놓쳐진 생물학적 진실을 밝혀내는 새로운 종류의 현미경 역할을 할 수 있음을 시사합니다.
연구팀은 또한 이 모델들이 새로운 방식으로 인간 연구자와 협력할 수 있음을 입증했습니다. 그들은 일반 목적의 AI 에이전트에게 멜론의 특정 형질의 원인을 찾는 임무를 부여했습니다. 즉, 왜 어떤 식물은 암꽃만 피우고 다른 식물은 암수 꽃을 모두 피우는지에 대한 이유를 찾는 것입니다. 에이전트는 수천 개의 유전적 차이 목록을 전달받았고, 그중 책임이 있는 하나를 찾으라는 요청을 받았습니다. 에이전트가 표준 도구만을 사용하여 이를 해결하려 했을 때는 목록을 좁힐 수는 있었지만 정답을 고를 수는 없었습니다. 그러나 연구진이 에이전트에게 Botanic1 모델을 도구로 사용할 수 있는 권한을 주자, 에이전트는 즉시 올바른 유전적 변화를 1순위 후보로 선정했습니다. 모델은 유전적 변화가 얼마나 '놀라운지'에 대한 연속적인 척도를 제공함으로써, 에이전트가 노이즈 속에서 진짜 원인을 구별할 수 있도록 도왔습니다.
이 연구는 우리가 식물을 연구하는 방식에 있어 중요한 진전을 의미합니다. 기계에게 DNA의 언어를 읽는 법을 가르침으로써, 연구진은 변화하는 기후를 견딜 수 있는 작물을 찾는 과정을 가속화할 수 있는 도구를 만들어냈습니다. 이 모델들은 단순히 더 빠를 뿐만 아니라, 더 정확하며 이전에는 보이지 않았던 패턴을 볼 수 있습니다. 이들은 어떤 유전자가 중요한지 추측하는 단계에서 벗어나, 어떤 유전자가 중요한지 높은 확신을 가지고 알 수 있는 길을 열어줍니다. 연구진이 이 도구들을 과학계에 공개함에 따라, 복잡한 생명의 코드를 이전에는 도달할 수 없었던 속도와 정밀도로 이해하고 개선할 수 있는 새로운 식물 생물학의 시대가 열리고 있습니다. 이 모델들은 이제 다른 과학자들이 사용할 수 있도록 공개되어, 더 나은 작물을 육종하고 식물계의 근본적인 메커리즘을 이해하는 데 도움을 줄 것을 약속합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.