← 최신 논문
🧬 biology

AssayBench: An Assay-Level Virtual Cell Benchmark for LLMs and Agents

본 논문은 대규모 언어 모델과 에이전트의 세포 표현형 결과 예측 능력을 평가하기 위해 설계된 1,920 개의 CRISPR 스크리닝으로 구성된 새로운 벤치마크인 AssayBench 를 소개하며, 제로샷 범용 대규모 언어 모델이 현재 전문 생물학 모델보다 우수한 성능을 보이지만 견고한 가상 세포 모델을 달성하기 위해서는 여전히 상당한 개선의 여지가 있음을 밝혀냅니다.

원저자: Edward De Brouwer, Carl Edwards, Alexander Wu, Jenna Collier, Graham Heimberg, Xiner Li, Meena Subramaniam, Ehsan Hajiramezanali, David Richmond, Jan-Christian Hütter, Sara Mostafavi, Gabriele Scalia

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Edward De Brouwer, Carl Edwards, Alexander Wu, Jenna Collier, Graham Heimberg, Xiner Li, Meena Subramaniam, Ehsan Hajiramezanali, David Richmond, Jan-Christian Hütter, Sara Mostafavi, Gabriele Scalia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

당신은 거대한 생물학적 미스터리를 해결하려는 형사라고 상상해 보세요. 실제 실험실에서 과학자들은 세포 내 특정 유전자를 "끄는" 수천 가지 실험을 수행하여 어떤 일이 발생하는지 확인합니다. 세포가 성장을 멈추나요? 병에 걸리나요? 약물에 대한 내성을 갖게 되나요? 이러한 실험들은 CRISPR 스크리닝이라고 불리며, 결과에 얼마나 중요한지에 따라 유전자를 순위로 나열한 방대한 목록을 생성합니다.

문제는 이러한 실험을 현실에서 수행하는 것이 느리고, 비싸며, 번거롭다는 점입니다. 과학자들은 이러한 실험을 접시 위에 세포를 배치하기 전에 그 결과를 예측할 수 있는 초지능 컴퓨터 프로그램인 **"가상 세포 (Virtual Cell)"**를 원합니다.

이 논문은 현재 인공지능 (AI) 모델들이 그 가상 세포가 될 만큼 똑똑한지 테스트하기 위해 설계된 새로운 "최종 시험"인 AssayBench를 소개합니다.

다음은 이 논문이 간단한 비유를 사용하여 설명하는 내용입니다:

1. 새로운 시험: AssayBench

이 논문 이전까지 AI 모델들은 주로 단일 분자가 어떻게 형태를 변화하는지 예측하는 것과 같은 좁은 작업으로 테스트되었습니다. 하지만 실제 신약 개발은 영화 줄거리와 더 비슷합니다. 등장인물 (유전자), 배경 (세포 유형), 그리고 반전 (약물 치료) 을 이해해야 결말 (표현형) 을 예측할 수 있습니다.

저자들은 이미 출판된 1,920 개의 실제 실험을 사용하여 AssayBench를 구축했습니다.

  • 과제: AI 는 실험에 대한 텍스트 설명을 받습니다 (예: "우리는 백혈병 세포에서 유전자를 끄고 에토포사이드라는 약물을 추가하여 어떤 세포가 생존하는지 확인했습니다").
  • 목표: AI 는 "가장 가능성 높은 것"부터 "가장 가능성이 낮은 것"까지 효과가 발생했다고 생각하는 상위 100 개 유전자의 순위 목록을 출력해야 합니다.
  • 반전: AI 는 이전에 본 적 없는 새로운 실험에 대해 이를 수행해야 합니다. 이는 마치 특정 주제를 공부했지만 구체적으로 연습해 보지 않은 학생이 시험을 보는 것과 같습니다.

2. 채점 시스템: "조정 점수 (Adjusted Score)"

1,000 개 유전자 목록에 대해 AI 를 어떻게 채점할까요? 단순히 "첫 번째 유전자를 맞혔나요?"라고 묻는다면 너무 가혹합니다. "아무거나 하나라도 맞혔나요?"라고 묻는다면 너무 쉽습니다.

저자들은 Adjusted nDCG라는 특별한 채점 지표를 만들었습니다. 이는 골프 핸디캡과 같습니다:

  • 일부 실험은 쉽습니다 (평탄한 골프 코스처럼); 일부는 어렵습니다 (모래 함정이 있는 코스처럼).
  • 이 지표는 AI 가 "무작위 추측" 기준을 이긴 것에 대해 점수를 부여하지만, 실험이 쉬웠다는 이유만으로 만점을 주지는 않도록 점수를 조정합니다.
  • 또한 AI 가 나쁜 유전자 (문제를 실제로 악화시키는 유전자) 를 목록 상단에 배치하면 점수를 감점합니다.

3. 참가자들: 누가 참여했나요?

저자들은 세 가지 유형의 "학생"을 테스트했습니다:

  1. 일반 천재들 (최첨단 LLM): 이들은 인터넷의 거의 모든 것을 읽는 대규모 범용 AI 모델 (Gemini 3 Pro 또는 GPT-5.4 등) 입니다. 이들은 생물학에 특화되어 훈련된 것은 아니지만, 모든 것에 대해 많은 것을 알고 있습니다.
  2. 생물학 전문가들: 이들은 생물학적 데이터로 훈련되거나 의료 에이전트 역할을 하도록 설계된 AI 모델입니다.
  3. "요약 노트" 기준선: "이 유형의 실험에서 일반적으로 어떤 유전자가 중요한가?"와 같은 패턴을 단순히 찾는 간단한 방법들입니다.

4. 결과: 일반주의자들이 승리했습니다 (아직은)

놀랍게도 일반 천재들(대규모 범용 AI 모델) 이 가장 잘 수행했습니다.

  • 전문가 모델들은 실제로 일반 모델들보다 성적이 더 나빴습니다.
  • "요약 노트" 기준선들은 특히 일반적인 세포 유형에서 놀랍도록 경쟁력이 있었으며, 이는 때로는 단순한 패턴만으로도 충분하다는 것을 시사합니다.
  • 판결: 최고의 AI 모델조차 아직 완벽하지 않습니다. 이 논문은 현재 최고의 AI 점수가 이론적으로 가능한 것 (성능 한계) 의 약 절반 수준임을 보여줍니다. 만약 두 명의 실제 과학자에게 같은 실험을 예측하도록 요청한다면, 그들은 AI 보다 훨씬 더 많이 일치할 것입니다.

5. "암기"의 함정

저자들은 흥미로운 점을 발견했습니다: AI 는 2021 년 이전에 출판된 오래된 실험에서 2025 년 말에 출판된 매우 최근의 실험보다 훨씬 더 잘 수행했습니다.

  • 비유: 이는 지난 해의 연습 시험 문제들을 암기했지만 오늘의 시험에 나온 새로운 질문에는 어려움을 겪는 학생과 같습니다.
  • 결론: AI 는 아마도 훈련 데이터에서 읽은 사실들을 "암기"하고 있을 뿐 생물학적 논리를 진정으로 이해하지는 못하는 것 같습니다. 그러나 여전히 새로운 시험에서 전문가들보다 더 잘 수행했으므로, 단순한 기억력 이상의 진정한 추론 능력을 가지고 있음을 시사합니다.

6. 어떻게 더 나아질 수 있을까요?

이 논문은 AI 의 성능을 높이기 위한 몇 가지 방법을 테스트했습니다:

  • 파인튜닝 (Fine-tuning): 이러한 유형의 문제에 대해 AI 를 특별히 가르치는 것은 조금 도움이 되었습니다.
  • 앙상블 (Ensembling): 세 가지 다른 AI 에게 답을 투표하게 하고 그 결과를 결합하는 것이 가장 잘 작동했습니다. 이는 한 명에게만 묻는 것이 아니라 전문가 패널에게 묻는 것과 같습니다.

결론

AssayBench는 우리가 유전자를 조작할 때 세포가 어떻게 행동할지 예측할 수 있는지 확인하기 위한 새로운 현실적인 시험입니다.

  • 현재 상태: AI 는 이에 대해 잘 해내고 있지만, 아직 도달하지는 못했습니다. 최고의 모델들은 여전히 실제 과학자들이 하지 않을 실수를 저지르고 있습니다.
  • 미래: 이 논문은 진정한 "가상 세포"를 구축하기 위해서는 사실을 암기하는 것이 아니라 생물학을 추론할 수 있는 모델이 필요하며, 그들을 가르치기 위해 더 많은 데이터가 필요하다고 제안합니다.

이 논문은 이러한 모델들이 오늘날 병원이나 질병 치료에 사용될 준비가 되었다고 주장하지 않습니다. 단순히 "AI 가 실험대를 진정으로 대체하기 전에 우리가 얼마나 더 가야 하는지 측정하는 자자"를 제시한다고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →