← 최신 논문
🤖 AI

TxBench-PP: Analyzing AI Agent Performance on Small-Molecule Preclinical Pharmacology

이 논문은 실제 어세이(assay) 데이터를 사용하여 소분자 전임상 약리학 과제에 대한 AI 에이전트를 평가하기 위한 검증 가능한 벤치마크인 TxBench-PP를 소개하며, 현재 가장 진보된 모델들조차 정확한 전임상 결정을 신뢰성 있게 도출하는 데 실패한다는 점을 밝히고 있다.

원저자: Hannah Le, Ramesh Ramasamy, Alex Urrutia, Mahsa Yazdani, Tim Proctor, Kenny Workman

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hannah Le, Ramesh Ramasamy, Alex Urrutia, Mahsa Yazdani, Tim Proctor, Kenny Workman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 어떤 새로운 약을 만들지 결정하기 위해, 초지능형 AI 기반 연구 보조원들로 구성된 팀을 고용한다고 상상해 보십시오. 당신에게는 차트, 현미경 사진, 화학 테스트 결과 등 복잡하고 실제적인 실험실 데이터가 담긴 거대한 파일 더미가 있습니다. 그리고 당신은 이 보조원들이 증거를 살펴보고 다음과 같이 말해주기를 바랍니다. "이 약은 유망해 보이니 계속 진행합시다" 또는 "이것은 위험하거나 쓸모없으니 버립시다."

이 논문인 TxBench-PP는 이 AI 보조원들이 실제로 그 업무를 얼마나 잘 수행했는지에 대한 성적표입니다.

핵심 아이디어: AI를 위한 "운전 면허 시험"

저자들은 TxBench-PP라는 특별한 테스트를 만들었습니다. 이것은 자동차 대신 AI가 신약 개발 프로그램을 운전하는 일종의 운전 면허 시험과 같습니다.

  • 함정: 그들은 단순히 AI에게 교과서에 적힌 사실(예: "아스피린은 어떤 작용을 하는가?")을 암기하게 하지 않았습니다. AI에게 그런 것은 쉽습니다. 왜냐하면 그들은 인터넷의 내용을 이미 다 외우고 있기 때문입니다.
  • 진짜 도전: 그들은 AI에게 실제 실험실에서 나온 새롭고도 복잡한 데이터 폴더를 건네주며, "오직 이 특정 수치와 이미지들만을 바탕으로, 우리는 무엇을 해야 합니까?"라고 물었습니다.
  • 목표: AI가 증거를 살피는 과학자처럼 행동하는지, 아니면 단순히 학습한 내용을 바탕으로 추측하는지를 확인하는 것입니다.

결과: AI는 아직 초보 수준이다

연구진은 16가지의 서로 다른 AI 모델(두뇌)과 소프트웨어 도구(손)의 조합을 테스트했습니다. 그들은 총 4,800번의 테스트를 수행했습니다.

결과는 다음과 같습니다: AI는 아직 혼자 운전할 준비가 되지 않았습니다.

  • 최고 점수: 가장 성능이 뛰어난 AI 시스템은 정답률이 약 **59%**였습니다. 교실이라면 낙제점입니다. 실제 제약 회사에서 10번 중 4번을 틀린다는 것은 매우 위험합니다. 이는 수백만 달러를 낭비하거나, 더 나아가 위험한 약물을 단계로 진전시키는 결과를 초래할 수 있기 때문입니다.
  • 현실 점검: 심지어 가장 "똑똑한" AI조차 동일한 과업을 세 번 연속으로 제대로 수행하지 못했습니다. 즉, 일관성이 없었습니다.

AI는 어디서 틀렸는가?

저자들은 실수를 면밀히 조사했고, AI가 단순히 무언가를 "잊어버린" 것이 아님을 발견했습니다. AI는 특정한 유형의 과학적 오류를 범하고 있었습니다.

  1. "교과서" 함정: 때때로 AI는 세포가 죽어가는 사진을 보고도 눈앞의 실제 데이터를 무시했습니다. 대신, 다른 약물에 관한 유명한 교과서 속 이야기를 기억해 냈고, 이곳에 그 이야기를 적용했습니다. 즉, 정해진 서사에 맞추기 위해 증거를 무시한 것입니다.
  2. 잘못된 수학과 잘못된 필터링: AI는 종종 "품질 관리"에서 실수를 저질렀습니다. 마치 과학자가 그래프를 보며 "오, 저 이상한 스파이크는 그냥 오류일 뿐이야, 무시하자"라고 말하는 것과 같습니다. 하지만 실제로는 그 스파이크가 데이터에서 가장 중요한 부분이었습니다. AI는 빈번하게 중요한 데이터를 버리거나 쓰레기 데이터를 유지했습니다.
  3. "전부 아니면 전무(All-or-Nothing)" 문제: 10개의 목록 중에서 가장 좋은 약을 고르라는 요청을 받았을 때, AI는 종-종 "괜찮아 보이는" 것을 골랐지만 정말로 훌륭한 것을 놓치거나, 활성도가 있어 보인다는 이유로 위험한 것을 선택하기도 했습니다. AI는 "이 프로젝트를 중단할 것인가" 대 "이 프로젝트를 진전시킬 것인가"라는 어려운 결정을 내리는 데 어려움을 겪었습니다.

"도구"가 중요하다

흥미로운 발견 중 하나는 AI가 작업을 수행하는 데 사용하는 소프트웨어가 AI 모델 자체만큼이나 중요하다는 것이었습니다.

  • AI를 뛰어난 요리사라고 생각해 보십시오.
  • Harness A는 요리사에게 날카로운 칼과 깨끗한 도마를 주었습니다.
  • Harness B는 똑같은 요리사에게 무딘 버터 칼과 더러운 도마를 주었습니다.
  • (논문에서 'Pi'라고 불리는) 좋은 도구를 가진 요리사는, "요리사"(AI 모델)가 동일함에도 불구하고 나쁜 도구를 가진 요리사보다 훨씬 더 훌륭한 요리를 만들어냈습니다.

결론

이 논문은 현실을 직시하게 해줍니다. AI가 신약 개발 속도를 높여줄 것이라는 약속은 있지만, AI가 스스로 중요한 "진행/중단(go/no-go)" 결정을 내릴 수 있도록 아직 신뢰할 수는 없습니다.

현재의 AI 에이전트들은 매뉴얼을 읽는 데는 능숙하지만, 여전히 선임 과학자가 옆에서 지켜보며 수학 계산을 확인하고, 실험실 데이터의 복잡한 실체를 무시하고 있지는 않은지 체크해 주어야 하는 인턴과 같습니다. 그들은 도움이 될 수는 있지만, 아직 독자적으로 운영할 만큼 신뢰할 만한 수준은 아닙니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →