← 최신 논문
🤖 machine learning

Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment

본 논문은 ChatInvent 에이전트 기반 신약 개발 시스템을 위해 특정 품질 차원을 정의하고, 높은 정렬을 달성하기 위해 전문가 주석을 통해 판사 모델을 검증 및 최적화하며, 비격식적인 문구 표현이 성능을 저해하지 않는다는 점을 밝혀낸 인간 정렬형 LLM-as-a-Judge 평가 프레임워크를 제시한다.

원저자: Emma Granqvist, Rocío Mercado, Samuel Genheden

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Emma Granqvist, Rocío Mercado, Samuel Genheden

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

신약 개발이라는 고도의 긴장감이 흐르는 세계에서, 과학자들은 질병을 치료할 수 있는지 확인하기 위해 분자를 설계하고, 실험실에서 이를 구축하며, 테스트하는 데 수년을 보냅니다. 이 과정은 느리고 비용이 많이 들며 복잡한 결정들로 가득 차 있습니다. 최근, 새로운 종류의 인공지능이 등장했습니다. 바로 단순히 질문에 답하는 것을 넘어 행동을 취하는 시스템입니다. 이들은 '에이전틱(agentic) 시스템'이라 불립니다. 단순히 텍ast를 생성하는 일반적인 챗봇과 달리, 에이전트는 다단계 실험을 계획하고, 화학적 특성을 계산하기 위해 전문 소프트웨어를 호출하며, 방대한 과학 데이터베이스에서 데이터를 검색할 수 있습니다. 이는 단순히 그 것에 대해 말하는 것이 아니라, 실제로 작업을 수행할 수 있는 디지털 연구 보조원처럼 행동합니다. 그러나 이러한 디지털 보조원이 더 유능해짐에 따라 중요한 문제가 발생합니다. 바로 이들이 일을 제대로 하고 있는지 어떻게 알 수 있느냐는 것입니다. 정답에 단어를 맞추는 방식에 의존하는 기존의 컴퓨터 답변 채점 방식은 과업이 개방적이고 창의적일 때 실패합니다. 더욱이, 모든 출력물을 채점하기 위해 인간 전문가에게 요청하는 것은 이 새로운 기계들의 속도를 따라잡기에 너무 느립니다. 과학계는 빠르면서도 신뢰할 수 있는 에이전트 평가 방법을 필요로 했습니다.

아스트라제네카(AstraZeneca)와 예테보리 대학교(University of Gothenburg)의 연구팀은 한 인공지능이 다른 인공지능의 심판 역할을 하는 시스템을 구축함으로써 이 과제를 해결했습니다. 그들은 과학자들이 신약 개발 단계를 탐색하도록 설계된 에이전틱 어시스턴트인 '챗인벤트(ChatInvent)'라는 특정 도구에 집중했습니다. 연구진은 단순히 AI가 스스로를 채점하게 두는 것이 위험하다는 것을 알고 있었습니다. 모델들이 편향되거나 일관성이 없을 수 있기 때문입니다. 이를 해결하기 위해, 그들은 '심판' AI가 인간 전문가와 일치하도록 보장하는 엄격한 테스트 프레임워크를 설계했습니다. 그들은 좋은 답변이 갖추어야 할 네 가지 구체적인 자질을 정의했습니다: 응답의 완결성, 정보의 관련성, 텍le의 명확성과 조직화 정도, 그리고 에이전트가 부여된 역할을 벗어나 하지 말아야 할 일을 시도하지 않고 본연의 역할 내에 머물렀는지 여부입니다. 또한 에이전트가 업무를 완수하기 위해 올바른 컴퓨터 도구를 사용했는지 확인하는 엄격한 점검도 포함했습니다.

최적의 심판을 찾기 위해, 연구팀은 주요 기술 기업의 옵션과 오픈 소스 프로젝트를 포함한 네 가지 서로 다른 강력한 AI 모델을 테스트했습니다. 그들은 다섯 명의 화학 및 인공지능 전문가에게 35개의 질문과 답변 세트를 채점하도록 요청했습니다. 전문가들에게는 AI 심판들과 동일한 지침과 정보가 제공되었습니다. 연구진은 이후 인간 전문가의 점수와 각 AI 모델의 점수를 비교했습니다. 그 결과, 인간 전문가들이 항상 완벽하게 일치하지는 않았지만, AI 모델들은 놀라울 정도로 일관적이라는 것을 발견했습니다. 특히 한 모델은 인간의 다수 의견과 매우 밀접하게 일치했습니다. 연구진은 인간 전문가가 주석을 달았던 작은 사례 세트를 사용하여 성능이 가장 좋았던 이 AI 심판을 미세 조정(fine-tuning)했습니다. '최적화'라고 알려진 이 과정은 심판의 인간 사고 일치 능력을 향상시켜, 일치 점수를 80%에서 86%로 높였습니다.

신뢰할 수 있는 심판이 마련되자, 팀은 챗인벤트 시스템이 이전에 본 적 없는 70개의 새로운 질문을 평가했습니다. 결과는 에이전트의 성능에 대한 강점과 약점을 모두 드러냈습니다. 시스템은 주제를 유지하고, 답변을 명확하게 구성하며, 정보를 수집하기 위해 적절한 도구를 사용하는 데 탁월했습니다. 그러나 완결성 측면에서는 어려움을 겪었습니다. 거의 40%의 사례에서 에이전트는 부분적인 답변만을 제공했는데, 생성된 파일의 위치나 요청된 화학적 특성과 같은 구체적인 세부 사항을 포함하는 것을 자주 잊어버렸습니다. 연구진은 이것이 에이전트가 질문을 오해했기 때문이 아니라, 워크플로우의 마지막 단계를 실행하는 데 실패했기 때문임을 발견했습니다. 흥고하게도, 질문이 던져지는 방식이 차이를 만들었습니다. 연구팀은 매우 격식 있는 표현부터 매우 일상적인 표현까지 다양한 질문을 테스트했습니다. 그들은 지나치게 격식 있는 문구가 에이전트의 성능을 높이는 데 도움이 되지 않으며, 오히려 약간 더 비격식적이거나 중립적인 문구가 때때로 더 나은 결과를 가져온다는 것을 발견했습니다. 이는 에이전트가 작업을 시작하기 전에 사용자의 딱딱하거나 복잡한 프롬프트를 더 명확한 버전으로 재작성하는 자체 내부 시스템을 갖추는 것이 유익할 수 있음을 시사합니다.

이 연구는 에이전틱 시스템이 신약 개발 속도를 높이는 데 큰 가능성을 지니고 있지만, 아직 완벽하지는 않다고 결론짓습니다. 연구진은 심판이 전문가의 의견과 신중하게 정렬된다면, 인간의 판단을 모방하는 견고하고 자동화된 평가 시스템을 구축하는 것이 가능하다는 것을 입증했습니다. 이러한 접근 방식은 개발자들이 매 테스트마다 인간 채점팀을 고용할 필요 없이, 에이전트가 어디에서 실패하고 있는지(예: 파일 경로 누락 또는 불완전한 데이터)를 빠르게 식별할 수 있게 해줍니다. 이 작업은 미래를 위한 청사진 역할을 하며, 인공지능이 과학 분야에서 진정으로 유용해지기 위해서는, 먼저 인간 전문가가 사용하는 것과 같은 주의와 정밀함으로 자신의 작업을 채점하는 법을 가르쳐야 한다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →