기술 요약: BrainPilot – 에이전트 기반 연구를 통한 뇌 과학 발견의 자동화
문제 정의
뇌를 이해하는 것은 점점 더 다양한 규모, 양상(modality), 학문 간의 증거를 통합하는 것을 요구하고 있습니다. 뇌 과학에서 단일 연구 질문을 수행하는 과정은 선행 연구 조사, 실험 설계, 분석 실행, 그리고 특정 도메인 맥락 내에서의 결과 해석을 포함하는 조율된 일련의 작업들로 구성됩니다. AI 에이전트가 이 과정을 가속화할 것으로 기대되지만, 현재의 시스템들은 뇌 과학 분야에서 다음과 같은 결정적인 한계에 직면해 있습니다:
- 도메인 전문 지식의 부재: 범용 에이전트는 뇌 과학에 필요한 구체적인 실험실 수준의 지식이 부족한 경우가 많습니다.
- 신뢰성 문제: 에이전트는 근거 없는 주장을 조작하거나, 다단계 추론 과정에서 논리가 이탈하거나, 증거에 의해 뒷받침되지 않는 결과를 생성할 수 있습니다.
- 불투명성: 기존의 워크플로우는 전문가가 개입할 수 있는 정의된 지점이 거의 없어, 인간 연구자가 중간 단계나 방법론적 오류를 검사하거나 수정하기 어렵습니다.
- 비용 및 효율성: 고성능 에이전트 프레임워크는 상당한 계산 비용과 금전적 비용을 발생시킵니다.
본 논문은 AI 지원 가속화가 뇌 과학 분야에서 실효성을 갖기 위해서는 연구 과정이 신뢰할 수 있어야 하며, 인간의 전문성이 의사결정 지점에 통합되어야 하고, 증거와 주장에 대한 명확한 감사 추적(audit trail)이 존재해야 한다고 주장합니다.
방법론
저자들은 뇌 과학 연구를 가속화하기 위해 설계된 완전한 오픈 소스 기반의 인간 참여형(human-in-the-loop) 멀티 에이전트 시스템인 BrainPilot을 제시합니다. 이 시스템은 세 가지 핵심 기둥을 기반으로 구축되었습니다:
1. 멀티 에이전트 아키텍처
BrainPilot은 전문 에이전트 팀을 조율하는 책임 연구자(Principal Investigator, PI) 에이전트를 채택합니다. 기본 팀 구성은 다음과 같습니다:
- PI 에이전트: 작업을 조율하고, 사용자의 의도를 명확히 하며, 하위 작업을 위임하고, 결과를 합성하며, 산출물을 전달합니다.
- 사서(Librarian): 문헌을 조사하고 지식 근거(주요 발견, 공백, 가설)를 제공합니다.
- 실험가(Experimentalist): 조작화, 대조군, 프로토콜을 포함한 과학적 절차를 설계합니다.
- 엔지니어(Engineer): 설계를 재현 가능한 코드로 변환하고, 이를 실행하며, 출력값을 보고합니다.
- 작가(Writer): 전문 에이전트 간의 인수인계 내용을 바탕으로 과학적 문서를 작성하고 다듬습니다.
- 감사관(Auditor): 독립적으로 출력을 검증하여 허위 사실 여부를 확인하며, 전달 전 세션 증거를 바탕으로 수치적 주장, 파일 참조, 인용을 대조합니다.
모든 에이전트는 메시징 계약(messaging contract)과 중앙 트레이스(trace)에 유형 가능한 출력물을 기록하는 자가 기록 계약(self-recording contract)을 공유합니다.
2. 큐레이션된 도메인 지식
에이전트들을 뇌 과학에 정착시키기 위해, BrainPilot은 파라미터 메모리에만 의존하는 대신 서비스 형태로 노출되는 두 가지 오프라인 구축 자산을 활용합니다:
- 통합 지식 베이스(Unified Knowledge Base): 11개 학문 그룹(예: 정신의학, 시스템 신경과학, AI/ML)에 걸쳐 7,233개의 인덱싱된 항목(교과서 및 논문)을 포함하는 검색 코퍼스입니다. 이는 OCR, 청킹(chunking), BAAI bge-m3 모델을 이용한 임베딩을 통해 구축되었으며, 관련성 향상을 위해 교차 인코더 리랭커(cross-encoder reranker)를 사용합니다.
- 기술 라이브러리(Skill Library): 7개 연구 도메인(예: 세포, 인지, 임상)에 걸친 72개의 재사용 가능한 방법론 단위 모음입니다. 기술은 기술적(방법론적 처방)이거나 실행 가능(코드 루틴)합니다. 이들은 LLM이 작성한 명세로부터 유도되고, 논문에서 추출되었으며, 확립된 도구(예: DeepLabCut, MNE-Python, fMRIPrep)로부터 추출되었습니다. 스킬 라우터(skill router)를 통해 에이전트는 필요에 따라 기술을 쿼리하고 로드할 수 있어 컨텍스트 오버헤드를 낮게 유지합니다.
3. 그래프 오브 트레이스 (Graph of Trace, GoT)
GoT는 하위 목표, 도구 사용, 증거, 주장을 연결하는 추가 불가능(append-only) 방식의 감사 가능한 기록입니다. 에이전트가 하위 작업을 완료함에 따라 GoT에 보고하며, 이는 워크플로우의 유향 비순환 그래프(DAG)를 구축합니다. 이를 통해 연구자는 다음을 수행할 수 있습니다:
- 연구 궤적을 실시간으로 추적합니다.
- 중간 출력의 근거를 검사합니다.
- 오류가 전파되기 전에 식별하고 수정합니다.
- 주장이 세션 증거에 의해 뒷받침되는지 검증합니다.
주요 기여
- 시스템 설계: 큐레이션된 도메인 지식, 재사용 가능한 기술, 그리고 환각과 이탈을 완화하기 위한 감사 메커니즘(Auditor 에이전트)을 통합하여 뇌 과학에 특화된 새로운 멀티 에이전트 프레임워크를 제안했습니다.
- 지식 인프라: 에이전트 추론의 근거 층 역할을 하는 통합 뇌 과학 지식 베이스(7,233개 항목)와 기술 라이브러리(72개 기술)를 구축했습니다.
- 추적 가능성: 행동을 증거와 연결하여 전체 연구 워크플로우에 대한 투명하고 검사 가능한 기록을 제공하는 Graph of Trace를 구현했습니다.
- 벤치마킹: 네 가지 작업(RSC place-cell 분석, TOPS-fMRI, BCI 운동 상상, Sleep-EDF)을 특징으로 하며, 아티팩트 기반 점수 산정 및 엄격한 격리 프로토콜을 갖춘 뇌 과학 에이전트 전용 예비 벤치마크인 BrainPilotBench-v0를 도입했습니다.
결과
본 논문은 세 가지 차원에서 BrainPilot을 평가합니다:
1. 에이전트의 마지막 시험 (Agents' Last Exam, ALE)
BrainPilot은 ALE 벤치마크의 세 가지 뇌 과학 작업(skull-stripping QC, ROI resample, C. elegans 뉴런 추적)에 대해 테스트되었습니다.
- 성능: 도메인 지식이 활성화되었을 때, BrainPilot은 결정론적 작업에서 최첨단 프레임워크(Codex, Claude Code)와 대등한 성능을 보였습니다. 예를 들어, 특정 백본 모델을 사용하여 T1과 T2에서 만점(1.00)을 달성했습니다.
- 비용 및 효율성: BrainPilot은 상당한 효율성 이득을 입증했습니다. 동일한 백본을 기준으로, 경쟁 프레임워크 대비 8~63%의 시간 내에 완료했으며, 비용은 5~56% 수준으로 낮았습니다. 가장 저렴한 구성(BrainPilot + DeepSeek-V4-Pro)은 $0.08가 소요되어, Codex + GPT-5.5의 $22.53와 비교해 매우 경제적이었습니다.
- 한계: 개방형 문제인 뉴런 추적 작업(T3)에서의 성능은 낮았으며, 이는 매우 구조화되지 않은 문제에 대한 어려움을 나타냅니다.
2. BrainPilotBench-v0
칼슘 이미징, fMRI, EEG, 수면 단계 분류를 아우르는 네 가지 작업에 대해 평가되었습니다.
- 성능:
claude-opus-4.8을 사용한 BrainPilot은 RSC 작업에서 최고 점수(1.00)를 기록하며 공동 1위를 차지했고, BCI 작업에서는 최고 점수(0.20)를 달성했습니다. fMRI 작업에서는 일반적으로 매칭된 Claude Code 구성을 능가했습니다.
- 도메인 지식의 영향: 도메인 지식을 활성화했을 때의 효과는 엇갈렸습니다. 26개의 유효한 셀 중 8개에서는 점수가 향상되었으나, 14개에서는 감소했고 4개는 변화가 없었습니다. 이는 지식 검색이 모든 맥락에서 반드시 더 나은 성능을 보장하는 것은 아님을 시사합니다.
- 비용: 비용은 백본에 따라 크게 달랐습니다.
deepseek-v4-pro를 사용한 BrainPilot은 동일한 작업에 대해 Claude Code보다 빠르지만 약간 더 많은 비용이 들었습니다. 반면 claude-opus-4.8은 높은 성능을 위해 상당한 비용 프리미엄을 발생시켰습니다.
3. 사례 연구 (Case Studies)
다섯 가지 엔드 투 엔드 사례 연구는 복잡하고 다단계적인 워크플로우를 처리하는 BrainPilot의 능력을 보여주었습니다:
- RSC에서의 공간 코딩: 두 광자 칼슘 이미징 데이터에 대해 5단계 분석(스크리닝, 시각화, 디코딩, 상관관계, 역학)을 성공적으로 실행하여 일관된 결과와 과학적 보고서를 생성했습니다.
- 생쥐 시각 시스템의 기능적 계층 구조: Neuropixels 데이터를 분석하여 생리학적 측정치를 해부학적 계층 구조와 대조하였고, 반응 잠복기 및 수용장 직경에서의 양의 상관관계를 식별했습니다.
- fMRI 통증 디코딩: 실험적 토닉 통증 데이터에 기능적 연결성 시그니처를 학습시키고, 이를 독립적인 임상 코호트에 전이하여 검증함으로써 가중치를 해석 가능한 통증 회로에 매핑했습니다.
- EEG 운동 상상: BCI Competition IV 2a를 위한 PyTorch 모델을 설계하여, EEGNet 베이스라인(Cohen's kappa 0.493)보다 높은 경향성(0.440)을 보였습니다.
- 수면 단계 분류: Sleep-EDF 데이터에 대해 5개 클래스 수면 단계 디코더를 구현하여, DeepSleepNet 레퍼런스와 대등한 지표 및 생리학적 검증을 달성했습니다.
의의 및 주장
본 논문은 BrainPilot이 신뢰할 수 있고, 효율적이며, 투명한 뇌 과학 에이전트 연구를 향한 중요한 진전이라고 주장합니다. 그 의의는 다음과 같습니다:
- 격차 해소: 일반 목적의 에이전트를 넘어, 큐레이션된 도메인 지식과 재사용 가능한 기술에 기반을 둔 시스템으로 나아갑니다.
- 타당성 확보: Auditor 에이전트와 Graph of Trace를 통합함으로써, 주장이 증거에 의해 뒷받침되고 워크플로우가 인간 전문가에 의해 검사 가능하도록 하여 과학적 타당성 문제를 해결합니다.
- 비용 효율성: 적절하게 오케스트레이션된 오픈 소스 백본 모델이 값비싼 독점 시스템에 필적하는 성능을 훨씬 적은 비용으로 달성할 수 있음을 입증했습니다.
- 커뮤니티 프레임워크: BrainPilot, BrainPilotBench 및 기초 방법론의 공개는 커뮤니티가 자동화된 뇌 발견을 위한 더 넓은 생태계에 기여하도록 초대하며, 미래의 발전은 벤치마크를 확장하고 기술을 정교화하는 협력적 노력에 달려 있음을 강조합니다.
저자들은 시스템이 연구를 가속화하지만, 해석을 검증하고 방법론적 제약을 정의하며 연구 과정을 조종하는 데 있어 인간의 전문성이 여전히 필수적임을 인정하며 겸허한 태도를 유지합니다. 이들은 BrainPilot을 멀티모달 통합 및 더 복잡한 하위 워크플로우를 위한 미래 발전의 토대로 보고 있습니다.