← 최신 논문
🤖 AI

BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance

이 논문은 가장 진보된 AI 에이전트들조차 병원체 감시를 위한 정확한 유전체 분석 파이프라인을 신뢰성 있게 추론하는 데 어려움을 겪으며 다양한 과업 전반에서 약 50%의 정확도만을 달성한다는 것을 입증하는 검증 가능한 벤치마크인 BioSecBench-Surveillance를 소개한다.

원저자: Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Amanda Darling, Joshua Stallings, David Stern, Shawn Higdon, Claire Duvallet, Bryan Tegomoh, Kenny Workman

게시일 2026-07-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Amanda Darling, Joshua Stallings, David Stern, Shawn Higdon, Claire Duvallet, Bryan Tegomoh, Kenny Workman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

공중보건의 세계를 거대하고 중대한 임무를 맡은 탐정 사무소라고 상상해 보십시오. 이들의 임무는 바이러스, 박테리아, 그리고 기타 병원체와 같은 보이지 않는 악당들을 포착하여, 그들이 팬데믹이라는 전 지구적인 파티를 벌이기 전에 막는 것입니다. 이를 위해 과학자들은 "유전체 감시(genomic surveillance)"라는 초강력 현미경을 사용합니다. 단순히 렌즈를 통해 세균을 들여다보는 대신, 그들의 전체 설계도(DNA 또는 RNA)를 읽어 그것이 정확히 무엇인지, 어디에서 왔는지, 그리고 얼마나 위험할 수 있는지를 파악하는 것입니다.

오랫동안 어려움은 이러한 설계도를 충분히 확보하는 데 있었습니다. 하지만 이제 기계들이 이를 읽어내는 능력이 매우 뛰어나져서, 우리는 데이터의 홍수에 빠져 있습니다. 진짜 병목 현상은 이제 '단서를 찾는 것'이 아니라 '수수께끼를 푸는 것'으로 옮겨갔습니다. 여기서 인공지능(AI) 에이전트가 등장합니다. 이들을 지치지 않는 똑똑한 주니어 탐정이라고 생각하십시오. 이들은 몇 초 만에 수백만 페이지를 읽을 수 있습니다. 하지만 여기 큰 질문이 있습니다. 이 AI 탐정들이 실제로 사건을 해결할 수 있을까요, 아니면 도서관에서 길을 잃고 말까요? 이들이 인간 전문가처럼 혼란스러운 유전적 단서 더미를 보고 "좋아, 답을 찾으려면 이 특정 도구를 이 특정 설정으로 사용해야겠어"라고 결정할 수 있을까요?

이 논문인 BioSecBench-Surveillance는 이 AI 탐정들을 위한 거대하고 엄격한 기말고사와 같습니다. 연구진은 AI 에이전트에게 가공되지 않은 유전 데이터와 특정 감시 맥락(예: "이것은 도시의 하수이다" 또는 "이것은 병원의 샘물이다")을 제공하는 100가지의 서로 다른 시나리오로 구성된 "검증 가능한 벤치마크(verifiable benchmark)"를 만들었습니다. AI는 정답을 알려주지 않은 상태에서 처음부터 올바른 분석 파이프라인(어떤 데이터베이스를 확인할지, 어떤 필터를 적용할지, 어떤 임계값을 설정할지 등)을 스스로 찾아내야 합니다.

시험 결과는 일종의 현실 자각 타임이었습니다. 테스트된 16가지의 AI 모델과 소프트웨어 도구의 조합 중에서, 가장 뛰어난 조합조차 질문의 약 **50.2%**만을 맞혔습니다. 즉, 가장 똑똑한 AI 에이전트들도 절반의 경우에 실패했다는 뜻입니다. 최고 성적을 거둔 것은 Opus 4.8 모델과 PI 도구의 조합, 그리고 GPT-5.5Codex의 조합이었으며, 둘 다 **50.2%**를 기록했습니다. 그 뒤를 Opus 4.7(49.6%)과 Sonnet 4.6(48.6%)이 바짝 뒤쫓았습니다. 반면, Grok의 일부 버전과 같은 가장 약한 구성들은 작업의 14%에서 16% 정도만을 수행해 냈습니다.

연구 결과, AI 에이전트들이 실패한 이유는 대개 어떤 도구를 사용해야 할지 몰랐기 때문이 아니었습니다. 사실, 그들은 거의 항상 올바른 "탐정 도구"(DNA를 읽기 위한 적절한 소프트웨어와 같은 것)를 선택했습니다. 그들의 실수는 아주 세밀한 부분에서 발생했습니다. 그들은 잘못된 참조 문헌을 선택하거나, 잘못된 민감도 임계값을 설정하거나, 데이터를 정규화할 때 수학적 계산을 틀렸습니다. 이는 마치 지문 스캐너가 필요하다는 것은 알지만, 민감도를 너무 높게 설정해 지문을 놓치거나, 너무 낮게 설정해 얼룩을 지문으로 착각하는 탐정과 같습니다.

테스트의 난이도는 사례의 유형에 따라 크게 달랐습니다. AI가 가장 쉬워했던 작업은 소스 추적(샘플이 어디에서 왔는지 파악하는 것)과 분류학적 분류(생물체를 명명하는 것)였으며, 각각 약 **50%**와 **46%**의 정답률을 보였습니다. 그러나 AI는 이상 징elli 탐지(기이하고 예상치 못한 신호를 포착하는 것)에서 큰 어려움을 겪었으며, 정답률은 **20%**에 불과했습니다. 또한 유전자 변형 특성 파악(바이러스가 인위적으로 조작되었는지 탐지하는 것)에서도 힘들어하며 **35%**의 점수를 기록했습니다. 흥ari롭게도, 샘플의 종류(하수냐 임상 샘플이냐 등)는 DNA를 읽는 데 사용된 기술만큼 중요하지 않았습니다. 롱 리드 시퀀싱(long-read sequencing) 데이터는 AI가 다루기에 훨씬 어려웠던 반면(통과율 26%), 숏 리드(short-read) 데이터는 상대적으로 수월했습니다(41%).

연구진은 또한 일부 AI 모델들이 너무 내성적이라는 점을 발견했습니다. 특정 모델들은 질문에 답하기를 거부하며 할 수 없다고 말하는 경우가 **27%에서 31%**에 달했는데, 이는 모델이 실행되는 소프트웨어 "하네스(harness)"에 따라 판이하게 달랐습니다.

결론적으로, 이 논문은 AI 에이전트가 발전하고는 있지만, 병원체 감시의 유일한 의사 결정권자로 신뢰받기에는 아직 충분히 안정적이지 않다고 결론짓습니다. 그들은 분석을 실행할 수는 있지만, 어떻게 실행할지에 대한 미묘한 판단에서는 자주 잘못된 결정을 내립니다. 저자들은 AI가 어떤 참조 문헌을 신뢰할지, 혹은 어떤 임계값을 설정할지와 같은 미세한 선택을 확실하게 할 수 있을 때까지는, 우리가 그들을 전적으로 신뢰하여 다음 발병을 막게 할 수는 없다고 제언합니다. 당분간은 인간 전문가가 여전히 사건에 대한 최종 결정권을 쥐고 있는 주인공입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →