← 최신 논문
🤖 AI

AutoProteinEngine: A Large Language Model Driven Agent Framework for Multimodal AutoML in Protein Engineering

AutoProteinEngine (AutoPE)은 딥러닝 전문 지식이 없는 생물학자들이 자연어 상호작용을 통해 모델 선택, 하이퍼파라미터 최적화 및 데이터 검색을 처리함으로써 단백질 공학을 위한 멀티모달 자동 머신러닝을 수행할 수 있도록 지원하는 대규모 언어 모델 기반 에이전트 프레임워크입니다.

원저자: Yungeng Liu, Zan Chen, Yu Guang Wang, Yiqing Shen

게시일 2026-08-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yungeng Liu, Zan Chen, Yu Guang Wang, Yiqing Shen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 새로운 요리를 발명하려는 숙련된 셰프라고 상상해 보십시오. 하지만 당신의 재료는 향신료나 채소가 아니라, 모든 생명체에 에너지를 공급하는 작고 정교한 분자 기계인 '단백질'입니다. 생물학의 세계에서 '단능질 공학(protein engineering)'은 이 분자 기계를 조율하여 새로운 의약품을 만들거나 초효율적인 효소를 만드는 것처럼 특정 작업에 더 적합하게 만드는 기술입니다. 오랫동안 이를 수행하는 것은 마치 망치로 복잡한 시계를 고치려는 것과 같았습니다. 과학자들은 추측하고, 테스트하고, 반복해야 했으며, 이 과정은 느리고 비용이 많이 들며 종종 막다른 길에 부딪히곤 했습니다.

최근 '딥 러닝(Deep Learning)'이라는 새로운 도구가 등장했습니다. 딥 러닝을 우주의 모든 요리책을 읽었으며 단백질의 레시피를 보는 것만으로도 그 단백질이 어떻게 행동할지 예측할 수 있는 매우 똑똑한 디지털 견습생이라고 생각해 보십시오. 하지만 한 가지 문제가 있었습니다. 이 디지털 견습생은 복잡한 코드와 수학으로 이루어진 매우 어려운 언어를 사용한다는 점이었습니다. 생명의 '풍미'에 전문가인 대부분의 생물학자들은 이 코드를 구사할 줄 몰랐습니다. 그들에게는 번역기가 필요했습니다. 여기서 큰 질문이 제기됩니다. 어떻게 하면 과학자들이 먼저 전문 프로그래머가 되지 않고도 이 강력한 디지털 도구들을 사용할 수 있게 할 수 있을까요?

이것이 바로 'AutoProteinEngine'(또는 AutoPE로 약칭)이라는 논문이 해결하고자 하는 문제입니다. 다양한 대학과 바이오테크 기업의 연구진으로 구성된 저자들은 인간 과학자와 딥 러닝 모델 사이에서 보편적인 번역기 역할을 하는 영리한 '에이전트' 프레임워크를 구축했습니다. 코드를 작성하는 대신, 생물학자는 "이 단백질을 변화시키면 단맛에 어떤 영향을 미칠지 예측하고 싶다"와 같이 평이한 영어로 시스템과 대화할 수 있습니다. 그러면 시스템이 뒤에서 모든 힘든 작업을 도맡아 처리합니다.

이 논문은 AutoPE가 대화형 챗봇을 구동하는 기술과 같은 종류인 '대규모 언어 모델(LLM)'을 사용하여 단백질을 위한 머신러닝의 전 과정을 자동화하는 프레임워크임을 소개합니다. 이 시스템은 '멀티모달(multimodal)' 데이터를 처리하도록 설계되었습니다. 즉, 단백질을 두 가지 다른 방식, 즉 문자의 서열(레시피와 같은 형태)과 3D 구조(접힌 종이접기 모양과 같은 형태)로 동시에 이해할 수 있다는 의미입니다. 연구진은 LLM이 최적의 모델을 선택하고, 설정을 자동으로 튜닝하며, 심지어 PDB나 UniProt와 같은 거대한 온라인 데이터베이스에서 누락된 데이터를 직접 가져오게 함으로써, 더 사용하기 쉽고 더 효과적인 워크플로우를 만들 수 있음을 발견했습니다.

실험에서 팀은 AutoPE를 두 가지 실제 작업, 즉 변이된 단백질인 브라제인(Brazzein)이 단맛을 낼지 예측하는 것과 효소인 STM1221의 활성 수준을 예측하는 데 테스트했습니다. 그들은 이 새로운 대화 기반 시스템을 두 가지 다른 방법, 즉 '제로샷(zero-shot)' 추론(추가 학습 없이 사전 훈련된 모델을 사용하는 것) 및 '수동 미세 조정(manual fine-tuning)'(전문 인간 프로그래머가 모델을 세심하게 조정하는 것)과 비교했습니다. 결과는 유망했습니다. 단맛 분류 작업에서 자동 튜닝을 거친 AutoPE는 0.7306의 F1-점수와 0.8908의 정확도를 달성하여, 제로샷 방식보다 훨씬 뛰어난 성능을 보였으며 균형과 견고함 측면에서 수동 미세 조정 방식마저 앞질렀습니다. 효소 활성 회귀 작업에서는 자동 튜닝을 거친 AutoPE가 가장 낮은 오차율(RMSE 0.3488)과 가장 높은 설명력(R2 점수 0.6805)을 기록하며, 테스트된 다른 방법들보다 효소의 행동을 더 정확하게 예측할 수 있음을 시사했습니다.

이 논문은 이러한 접근 방식이 복잡한 딥 러닝과 생물학적 전문 지식 사이의 간극을 성공적으로 메운다고 제안합니다. 자연어를 사용하여 과정을 안내함으로써, 이제 컴퓨터 과학 배경이 없는 연구자들도 고급 AI 도구를 활용할 수 있게 된다는 것을 제로합니다. 이 시스템은 단순히 숫자만 계산하는 것이 아니라, 자신이 무엇을 하고 있는지 평이한 영어로 설명하고 찾아낸 데이터를 요약해 주는 유능한 조수 역할도 수행합니다. 저자들은 이것이 단백질 공학을 위해 특화된 멀티모달 AutoML 프레임워크의 새로운 시도라는 점을 언급하면서도, 그들의 연구 결과가 단백질 공학을 더 접근하기 쉽고 효율적으로 만드는 실행 가능한 경로임을 나타낸다고 밝혔습니다. 이는 과학자들이 소프트웨어가 아닌 과학 자체에 집중할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →