An energy-based model empowers ultra-large virtual screening against 100-billion-scale chemical libraries
이 논문은 1,000억 규모의 화학 라이브러리에 대해 최첨단 정확도로 초고속 및 비용 효율적인 가상 스크리닝을 가능하게 하며, 습식 실험 검증을 통해 다양한 단백질 타겟에 걸쳐 강력한 나노몰 수준의 히트를 성공적으로 식별해 내는 에너지 기반 모델인 DrugJEPA를 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
새로운 약물을 찾는 과정은 종종 건초더미에서 바늘을 찾는 일로 시작되지만, 이 경우에는 그 건초더미가 거의 1,000억 개의 서로 다른 화학 구조를 포함하고 있습니다. 수십 년 동안 과학자들은 적절한 바늘을 찾기 위해 두 가지 주요 방법에 의존해 왔습니다. 실험실에서 수백만 개의 화합물을 물리적으로 테스트하거나, 컴퓨터를 사용하여 이들이 생물학적 표적에 어떻게 들어맞을지 시뮬레이션하는 것입니다. 물리적 테스트는 느리고 비용이 많이 들며, 전통적인 컴퓨터 시뮬레이션은 더 빠르기는 하지만 이토록 거대한 규모의 라이브러리를 처리하기에는 여전히 너무 느립니다. 과제는 도시 크기의 슈퍼컴퓨터를 필요로 하지 않으면서도, 1,000억 개의 분자를 스캔할 수 있을 만큼 충분히 빠르고, 실제로 효과가 있는 소수의 분자를 찾아낼 수 있을 만큼 정확한 방법을 찾는 것이었습니다.
쓰촨 대학교의 연구진은 이 간극을 메우는 새로운 접근 방식을 개발했습니다. 그들은 DrugJEPA라고 불리는 정교한 컴퓨터 모델을 만들었는데, 이는 신약 개발을 위한 고도로 훈련된 '직관 엔진'처럼 작동합니다. 모든 원자의 움직임을 시뮬레이션하는 데 너무 많은 시간이 걸리는 대신, 이 모델은 수백만 개의 단백질과 분자 간 상호작용 사례를 학습함으로써 좋은 결합의 '형태'를 인식하는 법을 배웁니다. 이 모델은 단백질의 결합 포켓과 약물 분자 사이의 관계를 예측하는 기술을 사용하여, 수십억 개의 쓸모없는 후보들을 단 몇 시간 만에 걸러냅니다. 세 가지 매우 다른 유형의 생물학적 표적을 대상으로 테스트했을 때, 이 시스템은 단순히 유효한 물질을 찾아낸 것에 그치지 않고, 극도로 낮은 농도에서도 작동하는 일부 물질을 포함하여 강력한 효능을 가진 물질들을 찾아냈습니다.
이 성과의 핵심은 연구진이 라이브러리와 모델을 구축한 방식에 있습니다. 그들은 기존 데이터베이스에서 잠재적인 약물 후보들을 대량으로 수집하여, 이를 3차원 형태로 변환한 뒤 ZEUS-3D라는 이름의 시스템에 저장하는 것으로 시작했습니다. 이 라이브러리는 약 960억 개의 고유한 분자를 보유하고 있으며, 용액 내에서 분자가 뒤틀리고 회전하는 방식을 고려하여 수천억 개의 서로 다른 3D 변형을 포함하고 있습니다. 이 방대한 데이터의 바다를 탐색하기 위해 그들은 빛과 같은 속도로 움직일 수 있는 도구가 필요했습니다. 그들은 단백질과 분자의 복잡한 정보를 단순한 숫자 코드, 즉 '임베딩(embedding)'으로 압축하는 법을 배우는 신경망인 DrugJE la를 구축했습니다. 이 코드를 비교함으로써 컴퓨터는 분자가 단백질에 얼마나 잘 들어맞을지를 즉각적으로 판단할 수 있으며, 이 과정은 전통적인 방식보다 수백만 배 더 빠릅니다.
시스템의 성능을 증명하기 위해 연구팀은 대규모 가상 스크리닝 캠페인을 실행했습니다. 그들은 면역 반응에 관여하는 키나아제(kinase), 정신 건강과 연결된 뇌 속 수용체, 그리고 알려진 저분자 약물이 존재하지 않았던 RNA 변형 효제라는 세 가지 뚜렷한 생물학적 표적을 대상으로 1,000억 개의 분자 라이브러리를 샅샅이 뒤지도록 모델을 풀어놓았습니다. 1경(quadrillion) 개의 잠재적 상호작용을 다루는 전체 탐색은 단 4개의 표준 그래픽 카드를 사용하여 단 28시간 만에 완료되었습니다. 이 속도는 엄청한 진보를 의미하며, 이제 일반적인 신약 개발 팀들도 거대 기업만이 가졌던 막대한 컴퓨팅 자원 없이도 이전에는 접근 불가능했던 화학적 공간을 탐구할 수 있게 되었습니다.
탐색 결과는 실제 세계에서 검증되었습니다. 연구진은 컴퓨터가 식별한 상위 후보들을 합성하거나 구입하여 실험실 환경에서 실제로 작동하는지 확인했습니다. 면역 관련 표적의 경우, 모델은 40%의 성공률로 활성 화합물을 찾아냈으며, 이 중 몇몇 분자는 1나노몰(nanomolar) 수준의 극히 낮은 농도에서도 표적의 활동을 멈출 만큼 강력했습니다. 뇌 수용체의 경우 적중률은 20%였으며, 시스템은 이 특정 표적에 대해 간과되었던 기존 약물을 재발견함으로써 새로운 해결책과 기존의 해결책을 모두 찾을 수 있는 모델의 능력을 입증했습니다. 가장 인상적인 점은 RNA 변형 효제에 대한 결과로, 알려진 약물 후보가 없었음에도 불구하고 모델은 30%의 적중률을 보였으며 단백질에 단단히 결합하여 그 기능을 효과적으로 차단하는 분자를 찾아냈습니다.
이러한 발견이 단순히 운이 좋았던 것이 아님을 확인하기 위해, 연구팀은 최고의 후보들이 표적과 어떻게 상호작용하는지 더 깊이 조사했습니다. 면역 표적의 경우, 약물이 단백질에 결합된 정확한 3D 구조를 결정하여 컴퓨터가 예측한 위치에 정확히 자리 잡고 있음을 확인했습니다. 뇌 수용체와 RNA 효제의 경우, 물리적인 결정 구조를 만드는 것이 어려웠기 때문에 표적 돌연변이를 유도하여 단백질의 특정 부분을 변화시키는 방식을 사용했습니다. 모델이 결합에 중요하다고 예측한 부분을 변경했을 때 약물이 더 이상 작동하지 않았으며, 이는 모델이 작용 기전을 정확하게 식별했다는 강력한 증거를 제공했습니다. 이러한 속도, 규모, 그리고 실험적 검증의 결합은 가능한 의약품의 광활한 우주를 탐구하는 장벽이 크게 낮아졌음을 시사하며, 오랫동안 발견이 어려웠던 질병들에 대한 새로운 치료법을 찾을 수 있는 실질적인 경로를 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.