Agentic campaign control for high-throughput de novo binder design
이 논문은 제한된 컴퓨팅 예산 내에서 고처리량의 데 노보(de novo) 결합체 생성을 최적화하기 위해, LLM을 사용하여 구조(rescue), 탐색(explore), 또는 활용(exploit) 전략 사이를 동적으로 결정함으로써 다수의 단백질 생성 모델과 평가기를 오케스트레이션하는 에이전트 기반 프레임워크인 T-REX를 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
처음부터 새로운 단백질을 설계하려는 탐구는 현대 생물학의 가장 유망한 최전선 중 하나입니다. 단백질은 조직을 형성하는 것부터 감염과 싸우는 것에 이르기까지, 살아있는 세포 내부에서 수행되는 거의 모든 과업을 수행하는 분자 기계입니다. 수십 년 동안 과학자들은 맞춤형 단백질을 설계하여 의약품이나 산업용 촉매제로 사용하려고 노력해 왔지만, 그 과정은 느리고 비용이 많이 들었습니다. 이는 수백만 개의 잠재적 형태를 생성하고, 그것들이 제대로 접히는지(folding) 확인하기 위해 컴퓨터로 테스트하며, 실패하는 대다수를 폐기하는 과정을 필요로 합니다. 최근 몇 년 동안 인공지능은 단백질 구조를 예측하고 새로운 서열을 놀라운 속도로 생성할 수 있는 도구들을 만들어냄으로써 이 분야를 혁신했습니다. 그러나 이러한 도구들은 종종 전문화되어 있습니다. 어떤 도구는 특정 형태를 만드는 데 탁월한 반면, 다른 도구는 그 형태를 유지하는 화학적 서열을 정교하게 다듬는 데 더 뛰어날 수 있습니다. 연구자들에게 닥친 과제는 도구의 부족이 아니라 전략의 부재가 되었습니다. 즉, 서로 다르고 강력하며 때로는 상충하는 일련의 AI 프로그램들을 마주했을 때, 한정된 컴퓨팅 자원을 어떻게 효과적으로 관리할 것인가 하는 문제입니다.
프린스턴 대학교와 매사추세츠 공과대학교(MIT)의 연구진은 이 문제를 해결하기 위해 설계 과정을 단일 작업이 아닌 역동적인 캠페인으로 취급하는 새로운 접근 방식을 도입했습니다. 그들은 여러 종류의 AI 단백질 설계자 군단을 지능적으로 관리하는 역할을 하는 T-REX라는 시스템을 개발했습니다. T-REX는 하나의 프로그램이 끝날 때까지 무작정 실행하거나 가능한 모든 조합을 맹목적으로 시도하는 대신, 대규모 언어 모델을 사용하여 진행 중인 실험의 결과를 지속적으로 모니터링합니다. 이 시스템은 성공, 실패 또는 정체의 징후를 관찰하고, 유망하지만 결함이 있는 설계를 구제할지, 완전히 새로운 방법을 탐색할지, 아니면 이미 좋은 결과를 내고 있는 경로에 집중할지를 실시간으로 결정합니다. 이 시스템은 6개의 서로 다른 생성 도구, 1개의 서열 정교화 도구, 그리고 1개의 구조 평가 도구를 조율하며, 고정된 컴퓨팅 시간 예산 내에서 독특하고 고품질인 단백질 결합체(binder)를 최대한 많이 만들어내기 위해 여러 개의 그래픽 처리 장치(GPU)에 걸쳐 이들을 조정합니다.
연구진은 이 시스템을 7가지 서로 다른 생물학적 타겟, 즉 새로운 단백질이 부착되도록 설계된 특정 분자들을 대상으로 테스트했습니다. 그들은 T-REX를 단일 AI 도구를 단독으로 사용하는 방식이나, 워크플로우를 관리하기 위해 더 단순한 비지능형 알고리즘을 사용하는 방식 등 여러 다른 전략들과 비교했습니다. 결과는 명확했습니다. T-REX는 다른 어떤 방법보다도 일관되게 더 많은 구조적으로 구별되는 결과물(hits)을 만들어냈습니다. 7가지 타겟 모두에서, 이 시스템은 엄격한 품질 기준을 충족하는 독특한 단백질 설계안을 현저히 더 많이 생성했습니다. 어떤 경우에는 차순위의 대안보다 4배 이상 많은 성공적인 설계를 만들어내기도 했습니다. 시스템은 캠페인이 진행됨에 따라 전략을 적응시킴으로써 이를 달로했습니다. 특정 방법이 더 이상 새로운 결과를 내지 못하면, T-REX는 자원을 다른 도구로 전환했습니다. 설계가 성공에 근접했으나 특정 지표에서 실패한 경우, 시스템은 처음부터 다시 시작하는 대신 특화된 도구를 지시하여 해당 약점을 수정하도록 했습니다.
가장 중요한 발견 중 하나는 시스템이 실패를 처리하는 방식이었습니다. 전통적인 설계 캠페인에서는 프로세스가 중단되면 연구자들이 단일 도구가 끝나기를 기다리거나 수동으로 개입해야 하므로 시간이 낭비되는 경우가 많습니다. 그러나 T-REX는 서로 다른 유형의 실패를 별개의 신호로 취급합니다. 만약 설계가 전체적인 형태가 불안정해서 실패했다면, 시스템은 다른 생성 방법을 시도할 수 있습니다. 만약 화학적 서열이 약간 어긋나서 실패했다면, 형태는 유지하면서 서열을 미세하게 조정하기 위해 정교화 도구로 전환할 수 있습니다. 이처럼 실패의 구체적인 원인을 진단하고 표적화된 대응을 선택하는 능력 덕분에 시스템은 다른 방법들보다 훨씬 빠르게 정체기를 극복할 수 있었습니다. 시뮬레이션에서 시스템이 "구제(rescue)" 전략을 사용하지 못하도록 강제했을 때, 새로운 성공적인 설계를 찾는 데 훨씬 더 오랜 시간이 걸렸으며, 이는 이 적응형 회복 메커니즘이 성공의 핵심 동력임을 입증했습니다.
T-REX가 생성한 설계안들은 수적으로 더 많을 뿐만 아니라 다양성 또한 높았습니다. 시스템은 헬릭스(helical) 구조가 풍부한 형태부터 시트(sheet) 형태가 지배적인 형태에 이르기까지 매우 다양한 모양의 단백질을 생성했습니다. 또한 타겟 분자에 부착되는 다양한 위치의 결합체들도 찾아냈는데, 이는 단백질이 타겟과 상호작용할 수 있는 가능한 방식들을 폭넓게 탐색했음을 시사합니다. 이러한 다양성은 신약 개발에서 매우 중요한데, 서로 다른 모양과 결합 위치가 서로 다른 치료 효과를 내거나 저항 메커니즘을 피할 수 있기 때문입니다. 연구진은 이 설계안들이 단순한 통계적 이상치가 아니라, 안정성과 결합 강도를 점검하는 여러 단계의 계산적 평가를 통과하며 엄격한 테스트를 견뎌냈음을 검증했습니다.
이 연구는 전적으로 컴퓨터 시뮬레이션 내에서 수행되었지만, 현실 세계의 과학에 미치는 영향은 상당합니다. 이 연구는 단백질 설계의 미래가 단 하나의 완벽한 AI 모델을 구축하는 것이 아니라, 여러 가지 서로 다른 모델을 관리하고 결합할 수 있는 지능형 시스템을 만드는 데 있음을 보여줍니다. 관찰, 추론, 행동의 연속적인 루프로 설계 과정을 처리함으로써, T-REX는 상대적으로 짧은 기간의 추론이 훨씬 더 비용이 많이 들고 시간이 오래 걸리는 계산을 안내할 수 있음을 보여주었습니다. 이 시스템은 현재 오픈 소스 소프트웨어로 공개되어 있어, 다른 과학자들이 이 오케스트레이션 프레임워크를 사용하여 자신의 연구를 가속화할 수 있도록 하고 있습니다. 이 접근 방식은 생물학적 공학의 다음 도약이 전문화된 프로그램들의 집합을 복잡한 설계 과제를 해결할 수 있는 응집력 있고 적응적인 팀으로 변화시키는, 즉 우리의 컴퓨팅 도구들을 더 잘 관리하는 데서 올 것임을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.