AI Scientists for Building Virtual-Cell Models
이 논문은 인간의 개입 없이도 문헌 검토와 가설 설정부터 코드 생성 및 검증에 이르기까지 전체 과학적 사이클을 독립적으로 완수하여, 섭동에 대한 단일 세포 반응을 예측하기 위한 경쟁력 있는 가상 세포 모델을 구축하는 자율형 멀티 에이전트 시스템인 CellForge를 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
살아있는 세포의 광대하고 복잡한 세계에서, 수천 개의 유전자는 세포가 어떻게 행동하고, 성장하며, 환경에 반응하는지를 결정하는 정교한 지침서 역할을 합니다. 과학자들은 특정 유전자가 꺼지거나, 약물이 추가되거나, 화학적 신호가 도입되었을 때 세포가 정확히 어떻게 변화할지 예측할 수 있는 디지털 시뮬레이션인 '가상 세포'를 구축하기 위해 오랫동안 노력해 왔습니다. 이러한 능력은 질병을 이해하고 새로운 치료법을 발견하는 데 매우 중요하지만, 그러한 모델을 만드는 것은 전통적으로 엄청난 과제였습니다. 여기에는 세포의 메커니즘을 이해하는 생물학자, 노이즈가 섞인 데이터를 처리하는 통계학자, 수학적 프레임워크를 설계하는 컴퓨터 과학자 등 인간 전문가 팀이 필요합니다. 새로운 유형의 실험이나 데이터셋이 나올 때마다 이 팀은 처음부터 다시 시작하여, 컴퓨터가 데이터로부터 학습하는 방식에 대한 구체적인 청사진인 모델 아키텍처를 수동으로 설계해야 하는 경우가 많습니다. 이 과정은 느리고 노동 집약적이며, 가공되지 않은 생물학적 데이터와 작동 가능한 예측 도구 사이의 간극을 메우기 위해 연구자의 전문적인 직관에 크게 의존합니다.
이제 한 연구팀은 조정된 인공지능 에이전트 그룹이 이 전체 설계 과정을 스스로 수행할 수 있음을 입증했습니다. 그들은 '셀포지(CellForge)'라고 불리는 시스템을 개발했는데, 이는 단일 프로그램이 아니라 특화된 AI 에이전트들로 구성된 가상의 연구 팀처럼 작동합니다. 단일 세포 측정 데이터와 함께, 예를 들어 새로운 약물에 세포가 어떻게 반응할지 예측하라는 것과 같은 구체적인 질문이 주어지면, 셀포지는 전체 과학적 워크플로우를 넘겨받습니다. 시스템은 먼저 데이터를 읽고 기존 과학 문헌을 조사하여 문제를 이해합니다. 그런 다음, 데이터 모델링, 생물학, 딥러닝 분야의 전문가 역할을 하는 서로 다른 에이전트들이 다양한 모델 설계를 제안하고 비판하는 피어 리뷰(동료 검토) 과정을 시뮬레이션합니다. 이러한 구조화된 토론을 통해 시스템은 단일하고 최적화된 모델 청사진에 수렴합니다. 마지막으로, 시스템은 컴퓨터 코드를 작성하고, 데이터를 바탕으로 모델을 훈련시키며, 결과를 검증하여, 보이지 않는 섭동(perturbation)에 대한 세포의 반응을 예측할 수 있는 완전히 기능적인 예측기를 반환합니다.
연구진은 이 자율적인 팀을 유전자 편집, 화학적 처치, 면역 체계 신호를 포함하여 다양한 생물학적 맥락을 나타내는 6가지 서로 다른 데이터셋을 대상으로 테스트했습니다. 이 데이터셋은 표준적인 유전자 발현 측정부터 RNA와 단백질, 또는 세포핵 내 DNA의 접근성을 모두 포함하는 더 복잡한 데이터에 이르기까지 다양했습니다. 모든 경우에 대해, 셀포지는 특정 데이터의 특성에 맞춤화된 고유한 모델 아키텍처를 성공적으로 생성했습니다. 예를 들어, 세포가 약물 처리를 받은 데이터를 분석할 때, 시스템은 물리 법칙에서 빌려온 개념인 '상태의 흐름(flow of states)'으로 문제를 취급하는 모델을 설계했습니다. DNA 접근성에 관한 희소한 데이터에 직면했을 때는, 흐릿한 이미지로부터 선명한 이미지를 재구성할 때 흔히 사용되는 기술인 노이즈를 점진적으로 제거하는 설계를 선택했습니다. 시스템은 단순히 기존 모델을 복사한 것이 아니라, 각 데이터셋의 특정 과제에 적합한 구성 요소들을 새롭게 합성해 냈습니다.
이 AI 생성 모델들의 성능은 과학계에서 사용 가능한 최고의 인간 설계 모델들과 경쟁할 만한 수준이었습니다. 유전자 편집 후 유전자 발현 변화를 예측하는 확립된 벤치마크에서, 셀포지가 생성한 모델은 인간 전문가가 만든 것과 대등하거나 때로는 이를 능가하는 정확도를 달성했습니다. 쌍을 이룬 RNA 및 단백질 데이터에서의 반응을 예측하거나 시간에 따른 변화를 추적하는 것과 같이 특화된 인간 모델이 존재하지 않는 시나리오에서도, 이 자율 시스템은 범용적인 기성 알고리즘보다 뛰어난 모델을 구축해 냈습니다. 이는 시스템이 단순히 일상적인 작업을 자동화하는 것이 아니라, 모델을 어떻게 구조화할지에 대한 가설을 세우고 코드 실행을 통해 그 가설을 테스트하는 진정한 과학적 추론을 수행할 수 있음을 시사합니다.
시스템이 단순히 추측하는 것이 아니라 타당한 과학적 선택을 하고 있는지 확인하기 위해, 연구진은 셀포지가 생성한 연구 계획을 블라인드 평가(blind evaluation)에 부쳤습니다. 연구진은 이 계획들을 다른 고급 AI 시스템 및 단일 대규모 언어 모델이 생성한 결과와 비교했습니다. 어떤 시스템이 계획을 만들었는지 알지 못하는 단일 세포 생물학 분야의 독립적인 전문가 패널들은, 셀포지의 제안이 다른 시스템들보다 더 과학적으로 타당하고 혁신적이며 개연성이 높다고 평가했습니다. 전문가들은 과학 컨퍼런스의 엄격한 비판 과정을 모방한 다중 에이전트 토론이 더 견고하고 정당한 근거를 갖춘 연구 전략을 이끌어낸다는 점을 발견했습니다. 이는 특화된 AI 에이전들 간의 협업이 단일 AI 도구가 복제할 수 없는 비판적 사고의 층위를 더해준다는 것을 나타냅니다.
이 연구는 계산 생물학이 미래에 어떻게 수행될지에 대한 중요한 변화를 강조합니다. 현재 이 시스템은 디지털 영역 내에서 작동하며 기존 실험 데이터에 의해 검증된 모델을 생성하지만, 이는 모델 설계라는 핵심적인 지적 작업(보통 인간 전문가 팀이 필요했던 부분)이 자동화될 수 있음을 보여줍니다. 연구진은 시스템이 아직 완벽하지 않으며, 때때로 인간의 개입이 필요한 복잡한 코드 오류로 인해 어려움을 겪고, 현재의 설계가 관찰된 데이터에 국한되어 있다는 점을 인정합니다. 그러나 문헌을 읽고, 가설을 세우고, 코드를 작성하며, 검증된 과학적 도구를 생산할 수 있는 AI 팀의 능력은 자율적인 과학적 발견을 향한 중대한 진전입니다. 이는 미래에 생물학 연구의 병목 현상이 더 이상 데이터의 가용성이나 컴퓨팅 파워가 아니라, 그 데이터를 이해할 수 있는 모델을 설계하고 테스트하는 속도가 될 것임을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.