← 최신 논문
🧬 biology

Comparative benchmarking of AI research agents for omics data interpretation

본 연구는 오믹스 데이터 해석을 대상으로 세 가지 특화된 AI 연구 에이전트(K-Dense, Finch, Biomni)를 ChatGPT와 비교하여 종합적인 정량적 벤치마크를 제시하며, 단일 에이전트가 모든 모달리티에서 우위를 점하지 못한다는 점과 에이전트의 아키텍처가 베이스 모델의 역량보다 특정 생물정보학 워크플로우에 대한 출력 품질 및 적합성을 결정하는 주요 요인임을 밝히고 있다.

원저자: Nikita V. Basov, Yosef K. Tirta, Zihan Li, Huan Zhou, Kiryl D. Piatkevich

게시일 2026-08-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nikita V. Basov, Yosef K. Tirta, Zihan Li, Huan Zhou, Kiryl D. Piatkevich

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

인체의 기능을 거대하고 북적이는 도시라고 상상해 보십시오. 이 도시가 어떻게 작동하는지 이해하기 위해, 과학자들은 단순히 거리만을 보는 것이 아니라 아주 작은 배달 트럭(대사체)부터 건설 현장 인력(단백질), 그리고 명령을 내리는 도시 계획가(유전자)에 이르기까지 모든 개별 거주자의 인구 조사를 실시합니다. 이것을 "오믹스(omics)" 데이터라고 부릅니다. 이는 건강과 질병의 이야기를 들려주는 방대한 정보의 산입니다. 하지만 문제는 도시가 너무 빠르게 성장하고 있어서, 데이터가 쌓이는 속도가 인간 탐정 팀이 분류하는 속도보다 더 빠르다는 점입니다. 우리는 도움이 필요합니다.

여기 "AI 연구 에이전트(AI Research Agents)"가 등장합니다. 이들을 단순한 검색 엔진이 아니라, 고도로 훈련된 자동화된 인턴이라고 생각하십시오. 당신이 엉망진창인 데이터 상자와 함께 "무엇이 이 질병을 유발하는가?"와 같은 질문을 건네면, 이들은 데이터를 정제하고, 수학적 계산을 수행하며, 차트를 그리고, 답을 설명하는 보고서를 작성해야 합니다. 최근 이러한 새로운 물결의 AI 인턴들이 도착하여, 단 몇 초 만에 과학자 팀 전체의 업무를 해낼 수 있다고 약속하고 있습니다. 하지만 너무 많은 새로운 인턴들이 나타나면서, 한 가지 큰 의문이 남습니다. 과연 어떤 인턴이 실제로 일을 가장 잘하는지, 그리고 어떤 인턴은 그저 보기 좋게 만드는 데만 능숙한 것인지 말입니다.

이 논문은 바로 이 사실을 알아내기 위한 거대하고 체계적인 "인턴 경진 대회"와 같습니다. 연구진은 네 가지 서로 다른 AI 에이전트가 신체의 화학적 수프(대사체학), 세포의 구성 요소(단백질체학), 그리고 유전적 지침(전사체학)이라는 세 가지 매우 다른 유형의 생물학적 데이터를 분석하도록 하는 공정한 테스트를 설정했습니다. 그들은 단순히 AI에게 추측을 요구한 것이 아니라, 구체적이고 실제적인 데이터 세트를 제공하고 그들이 단계별로 어떻게 작업하는지 관찰했습니다.

결과는 놀라웠으며, 모든 것을 이기는 단 하나의 "슈퍼 인턴"은 없다는 것을 가르쳐 주었습니다. 결국 AI의 '성격'과 그것이 어떻게 구축되었는지가 모델이 구동되는 컴퓨터의 순수한 연산 능력보다 더 중요하다는 사실이 밝혀졌습니다.

경쟁은 다음과 같이 진행되었습니다:

  • K-Dense (꼼꼼한 설계자): Gemini 2.5 Pro라는 강력한 모델을 기반으로 구축된 이 에이전트는 "화학적 수프"(대사체학) 분야의 챔피언이었습니다. 이 에이전트는 모든 치수를 재차 확인하는 설계사처럼 가장 철저하고 재현 가능한 보고서를 만들어냈습니다. 하지만 때때로 자신의 생각에 갇혀, 스스로의 작업이 완벽하지 않다고 느낄 때 인간이 다시 시도하도록 독려해 주기를 기다리기도 했습니다.
  • Finch (조직적인 관리자): Edison Scientific의 이 에이전트는 나머지 두 분야인 구성 요소(단백질체학)와 유전적 지침(전사체학)에서 명확한 승자였습니다. Finch가 반드시 "왜"에 대해 가장 깊이 파고드는 것은 아니었지만, 가장 잘 정리되고 일관된 보고서를 만들어냈습니다. 이는 마치 세부 사항이 다소 정형화되어 있더라도 항상 깨끗하고 완전한 파일을 제시간에 제출하는 프로젝트 매니저와 같았습니다.
  • Biomni (창의적인 스토리텔러): Claude 제품군을 기반으로 하는 이 에이전트는 생물학적 해석의 "큰 그림"을 그리는 데 뛰어났습니다. 데이터가 무엇을 의미하는지에 대해 설득력 있는 이야기를 들려줄 수 있었습니다. 하지만 데이터 정제나 오류 확인과 같은 지루하지만 중요한 단계들을 자주 건너뛰곤 했습니다. 이는 환상적인 결말을 쓰지만 캐릭터들이 어떻게 그곳에 도달했는지는 설명하는 것을 잊어버리는 스토리텔러와 같았습니다.
  • ChatGPT (제너럴리스트): 연구진은 유명한 범용 도구인 ChatGPT를 기준점으로 포함했습니다. 생물학을 위한 특별한 훈련 없이, 이 모델은 고전했습니다. 주로 기초적인 수학 작업만 수행했으며, 완전한 보고서를 생성하는 데 자주 실패하여 모든 카테고리에서 최하위를 기록했습니다. 이는 일반적인 똑똑한 도구가 전문적인 과학 작업에는 충분하지 않다는 것을 보여주었습니다.

이 경주의 가장 중요한 교훈은 누가 1등을 했느냐가 아닙니다. 연구진은 AI의 '두뇌' 자체보다 AI를 둘러싼 특정 도구와 규칙인 "하네스(harness)"가 더 중요하다는 것을 발견했습니다. 강력한 안전망과 명확한 워크플로우(Finch와 같은)를 가진 에이전트가 구조가 부족한 더 똑똑한 에이전트를 이길 수 있었습니다.

또한 그들은 "재현성"이 까다로운 문제라는 것을 발견했습니다. 한 에이전트인 ChatGPT는 화학 카테고리에서 매우 일관성을 보였는데, 이는 그가 짧고 얕은 답변을 반복했기 때문이었습니다. 또 다른 에이전트인 K-Dense는 지속적으로 깊이 있고 상세한 내용을 보여주었습니다. 일관성이 있다는 것이 항상 옳거나 유용하다는 뜻은 아닙니다. 때로는 그저 고집스럽게 똑같다는 것을 의미할 뿐입니다.

결론적으로, 이 논문은 우리가 단 하나의 AI 로봇이 모든 인간 과학자를 대체하기를 기대해서는 안 된다고 제안합니다. 대신, 미래는 각자가 잘하는 분야를 수행하는 전문화된 AI 도구들의 팀을 보유하게 될 것이며, 인간은 그들이 들려주는 이야기가 진실인지 확인하기 위해 감독하는 역할을 맡게 될 것입니다. 이 경쟁은 AI가 데이터 분석의 힘든 작업을 수행할 수는 있지만, 여전히 그 작업물을 검토하는 편집자로서의 인간이 필요하다는 것을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →