BioForm-LM: Generative Design of Biologics Formulations via In-Context Learning and Physics-Informed Decoding
BioForm-LM은 기계론적 시뮬레이션, 인컨텍스트 퓨샷 학습, 그리고 물리 기반 디코딩을 결합하여 데 노보(de novo) 바이오로직스 제형을 자동으로 설계하는 새로운 생성 시스템으로, 실제 벤치마크에서 기존의 랭킹 방식 및 무작위 샘플링보다 성능이 현저히 뛰어납니다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
생명을 구하는 단백질 의약품을 만드는 것은 전투의 절반에 불과합니다. 나머지 절반은 그것이 선반 위나 주사기 안, 또는 인체 내부에서 살아남을 수 있을 만큼 충분히 안정적으로 유지되도록 하는 것입니다. 항체와 기타 복잡한 단백질을 포함하는 바이오로직스(biologics)는 용해된 액체가 완벽하게 균형을 이루지 않으면 쉽게 서로 뭉치거나 형태를 잃을 수 있는 취약한 분자입니다. 수십 년 동안 그 완벽한 균형을 찾는 과정은 시행착오를 거치는 느리고 수동적인 과정이었습니다. 과학자들은 단백질을 다양한 완충제, 당, 염류와 혼합한 뒤, 그것이 잘 버텨내는지 확인하기 위해 몇 주를 기다립니다. 이러한 병목 현상은 비용이 많이 들며, 특히 신뢰할 수 있는 냉장 시설이 없는 지역에 새로운 약물이 환자에게 도달하는 속도를 제한합니다. 핵심적인 과제는 과학자들이 단백질이 환경과 상호작용하는 기본적인 규칙은 알고 있지만, 컴퓨터가 새로운 약물에 적합한 혼합물을 예측하도록 가르칠 수 있는 실제 데이터가 거의 없다는 점입니다. 기존의 대부분의 컴퓨터 도구는 인간이 이미 제안한 혼합물 목록의 순위를 매길 수만 있을 뿐, 무에서 유를 창조하듯 새로운 안정적 혼합물을 만들어낼 수는 없습니다.
한 연구자가 컴퓨터가 안정적인 약물 혼합물을 상상하도록 가르쳐 이 문제를 해결하려는 'BioForm-LM'이라는 새로운 시스템을 도입했습니다. 이 시스템은 대부분의 새로운 단백질에 대해 존재하지 않는 방대한 과거 실험 라이브러리에 의존하는 대신, 세 부분으로 구성된 전략을 사용합니다. 첫째, 시스템은 단백질이 다양한 액체 내에서 어떻게 행동하는지를 모방하는 빠른 물리 기반 시뮬레이션을 실행합니다. 이 시뮬레이터는 단백-혼합물과 그 안정성에 대한 백만 개의 합성 사례를 생성하여, 컴퓨터가 화학 및 물리학의 근본 법칙을 학습하도록 가르칩니다. 둘째, 이 시스템은 단 몇 개의 사례로부터 학습할 수 있는 유형의 인공지능을 사용합니다. 과학자가 새로운 단백질을 안정화하고자 할 때, 해당 단백질에 대한 단 3개에서 10개의 실제 측정값을 컴퓨터에 제공합니다. 시스템은 이 소수의 데이터 포인트를 사용하여 재학습 없이도 즉각적으로 자신의 이해도를 조정합니다. 마지막으로, 동일한 물리 법칙에 따라 훈련된 특화된 검증기가 컴퓨터의 제안을 검토하고 실세계에서 작동할 가능성이 가장 높은 것을 선택합니다.
연구자는 과학 문헌에서 발견된 18개의 실제 약물 제형으로 구성된 작고 정교하게 선별된 컬렉션을 통해 이 접근 방식을 테스트했습니다. 결과에 따르면, 이 시스템은 무작위 추측보다 훨씬 더 나은 새로운 실행 가능한 혼합물 레시피를 생성할 수 있었습니다. 작은 항체 파편과 관련된 한 특정 사례에서는, 단 3개의 실제 데이터 포인트만을 사용하여 시스템의 예측과 실제 실험 결과가 완벽하게 일치하는 성과를 거두었습니다. 평균적으로 이 시스템은 무작위 탐색이 커버할 수 있는 것보다 거의 5배 더 큰 화학적 공간을 탐색했는데, 이는 시스템이 단순히 오래된 데이터를 암기한 것이 아니라 단백질을 안정화하는 방법에 대한 진정한 패턴을 학습했음을 시사합니다. 또한 시스템은 서로 다른 유형의 단백질에 적응할 수 있으며, 구하고자 하는 특정 분자에 따라 전략을 바꿀 수 있음을 보여주었습니다.
하지만 저자는 이러한 결과가 현재 계산상의 가설일 뿐, 완성된 의약품은 아니라는 점을 주의 깊게 언급합니다. 이 시스템은 생성된 혼합물이 실제 시험관 내에서 실제로 작동하는지 확인하기 위한 습식 실험(wet laboratory)을 아직 거치지 않았습니다. 테스트에 사용된 데이터셋은 18개의 기록만을 포함할 정도로 매우 작았으며, 이는 오늘날 이 발견을 얼마나 폭넓게 적용할 수 있는지를 제한합니다. 연구자는 자신의 도구가 실험실 작업을 완전히 대체하기 위한 것이 아니라, 과학자들이 테스트할 후보를 제안하기 위해 설계된 것이라고 강조합니다. 그들은 이 도구를 컴퓨터가 수천 가지의 가능한 혼합물을 몇 가지 가장 유망한 것들로 빠르게 좁혀줌으로써 수개월의 수동 스크리닝 시간을 절약할 수 있는 미래를 향한 첫 단계로 보고 있습니다. 시스템이 시뮬레이션에서 큰 가능성을 보여주었지만, 궁극적인 증명은 컴퓨터가 생성한 레시피가 실제로 취약한 단백질을 수년간 안정적으로 유지할 수 있는지 검증하는 물리적 실험을 통해 이루어질 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.