How many crystal structures do you need to trust your docking results?
COVID Moonshot 프로젝트의 403개 SARS-CoV-2 메인 프로테아제 결정 구조를 분석한 결과, 일반적인 스캐폴드당 약 5개의 구조를 수집한 후에는 구조 기반 포즈 예측 정확도가 정체된다는 점이 드러났으며, 이는 신약 개발 캠페인의 자원 배분을 최적화하기 위한 실질적인 가이드라인을 제공한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
새로운 의약품을 찾는 고도의 긴박한 세계에서, 과학자들은 종종 구조 기반 신약 개발(structure-based drug discovery)이라고 불리는 전략에 의존합니다. 복잡하고 3차원적인 자물쇠에 완벽하게 들어맞는 열쇠를 설계하는 과정이라고 상상해 보십시오. 이 경우, 자물쇠는 인체 내부에서 질병을 일으키는 단백질이며, 열쇠는 새로운 약물 분자입니다. 열쇠가 잘 맞도록 하기 위해, 연구자들은 자물쇠의 모양이 정확히 어떠한지, 그리고 이전의 열쇠들이 그 안에 어떻게 놓여 있었는지를 알아야 합니다. 수십 년 동안 이 모양을 보는 가장 신뢰할 수 있는 방법은 약물이 부착된 단백질을 얼린 후 X선으로 사진을 찍는 것이었는데, 이 과정은 결정 구조(crystal structure)를 생성합니다. 이러한 이미지들은 청사진 역할을 하여, 과학자들이 미래의 약물을 더 강력하고 정밀하게 만들기 위해 설계를 어떻게 수정해야 하는지, 즉 약물이 어디에 결합하는지를 정확히 보여줍니다. 하지만 이러한 사진을 찍는 것은 비용이 많이 들고, 느리며, 어렵습니다. 완벽한 결정을 키워내어 거대한 기계로 보내야 하므로, 과학자들은 종종 어려운 선택에 직면합니다: 앞으로 나아가기 위해 충분한 정보를 얻을 때까지 실제로 얼마나 많은 이 비싼 사진들을 찍어야 하는가 하는 문제입니다.
한 연구팀은 역사상 가장 크고 개방적인 신약 개발 노력 중 하나인 '코비드 문샷(COVID Moonshot)'을 되돌아봄으로써 이 질문에 답하고자 했습니다. 이 글로벌 프로젝트는 바이러스가 생존하는 데 필수적인 효소인 주요 프로테아제(main protease)에 대해 수천 개의 서로 다른 화학적 설계를 테스트하여, 코로나19를 일으키는 바이러스를 치료하기 위한 목표였습니다. 캠페인 기간 동안 팀은 바이러스의 효소에 약간씩 다른 약물 분자가 결합된 모습을 보여주는 403개의 전례 없는 결정 구조 컬렉션을 생성했습니다. 이 방대한 데이터셋은 분야의 흔한 가설을 테스트할 수 있는 독특한 기회를 제공했습니다. 많은 과학자는 더 많은 결정 구조를 수집할수록 컴퓨터 모델이 보지 못한 새로운 약물이 어떻게 들어맞을지 예측하는 능력이 더 좋아질 것이라고 믿었습니다. 연구자들은 더 많은 사진을 수집하는 것이 도움이 되는 지점이 존재하는지, 즉 추가 사진 촬영의 비용이 그로부터 얻는 새로운 정보의 이득을 상회하는 수확 체감의 순간이 있는지 확인하고 싶었습니다.
이를 조사하기 위해 연구진은 크로스 도킹(cross-docking)이라는 방법을 사용했습니다. 단순히 이미 가지고 있는 사진을 살펴보는 대신, 그들은 컴퓨터 시뮬레이션을 통해 컬렉션에 있는 모든 단일 약물 분자를 보유한 다른 모든 결정 구조의 결합 부위에 배치해 보았습니다. 그런 다음 컴퓨터가 가용한 참조 구조를 바탕으로 약물의 위치를 올바르게 예측할 수 있는지 확인했습니다. 그들은 컴퓨터의 추측이 실제 실험적으로 관찰된 위치와 아주 미세한 거리 내에 있는지 여부를 통해 성공 여부를 측정했습니다. 다양한 수의 참조 구조를 사용하여 이 시뮬레이션을 실행함으로써, 데이터가 추가됨에 따라 정확도가 어떻게 향가되는지 관찰할 수 있었습니다. 또한 그들은 두 가지 다른 접근 방식을 비교했습니다: 단백한 단백질의 모양만을 사용하여 적합성을 추측하는 방식과, 이전 약물의 모양을 가이드로 사용하여 컴퓨터가 새로운 분자를 정렬하도록 돕는 방식입니다.
결과는 "많을수록 항상 좋다"는 생각에 도전하는 명확한 패턴을 드러냈습니다. 연구진은 예측의 정확도가 새로운 약물이 기존 데이터베이스에 있는 것과 얼마나 유사한지에 크게 달려 있다는 것을 발견했습니다. 새로운 분자가 이전의 것과 매우 흡사할 때, 컴퓨터는 단 몇 개의 참조 구조만으로도 그 위치를 높은 정확도로 예측할 수 있었습니다. 그러나 가장 놀라운 발견은 전체 구조의 수보다는 구조의 다양성에 관한 것이었습니다. 연구팀은 특정 화학적 골격(framework) 또는 스캐폴드(scaffold)에 대해 약 5개의 결정 구조를 확보하면, 동일한 유형의 구조를 더 추가하는 것이 거의 아무런 추가적인 이득을 주지 않는다는 것을 발견했습니다. 약물의 위치를 예측하는 성공률은 정체기에 도달했으며, 단순히 같은 종류의 분자를 더 많이 수집하는 것만으로는 이를 개선하는 것이 거의 불가능한 수준에 이르렀습니다.
실제로 이 연구는 화학적 구조의 다양성이 데이터의 양보다 훨씬 더 중요하다는 것을 보여주었습니다. 캠페인에서 가장 성공적이었던 약물 시리즈의 경우, 동일한 기본 형태를 가진 단 5개의 결정 구조만 있어도 95% 이상의 성공률을 달anim할 수 있었습니다. 동일한 형태의 구조를 수십 개 더 추가해도 이 수치는 유의미하게 높아지지 않았습니다. 반대로, 연구진이 완전히 새로운 화학적 형태를 가진 약물의 위치를 예측하려고 했을 때, 해당 새로운 형태와 일치하는 참조 구조가 없다면 정확도가 떨어졌습니다. 이는 자원을 가장 가치 있게 사용하는 방법이, 약간씩 다른 버전의 동일한 약물에 대한 사진을 계속 찍는 것이 아니라, 완전히 새로운 화학적 형태가 발견되는 즉시 그 사진을 찍는 것임을 시사합니다.
연구진은 또한 결정 구조의 품질이 중요한지도 검토했습니다. 그들은 이미지의 선명도나 모델 내 원자들이 얼마나 흔들리는지와 같은 요소들을 살펴보았습니다. 그들은 낮은 품질의 이미지라 할지라도 화학적 형태가 충분히 유사하다면 컴퓨터 모델이 약물의 위치를 정확하게 예측할 수 있다는 것을 발견했습니다. 이는 과정의 병목 현상이 X선 사진의 품질이 아니라, 약물의 올바른 시작 위치를 생성하는 컴퓨터의 능력에 있다는 것을 나타냅니다. 심지어 컴퓨터가 최적의 추측을 점수 매길 수 있는 완벽한 방법을 제공받았음에도 불구하고, 표준적인 스코어링 방식을 통해 달성한 것 이상의 성공률을 높이지 못했습니다. 이는 주요 과제가 가능한 후보 목록 중에서 올바른 것을 골라내는 것이 아니라, 약물의 초기 위치를 생성하는 단계에 있음을 시사합니다.
이러한 결과는 향후 신약 개발 캠페인을 위한 실질적인 가이드를 제공합니다. 단일 화학 시리즈를 위해 수백 개의 결정 구조를 수집하는 데 시간과 비용을 쓰는 대신, 과학자들은 이제 더 작고 전략적인 세트를 목표로 삼을 수 있습니다. 몇 가지 다른 화학적 골격에 대해 각각 5개에서 10개 정도의 구조를 수집하는 데 집중함으로써, 수백 개를 수집했을 때와 거의 동일한 수준의 예측력을 얻을 수 있습니다. 이 접근 방식은 연구자들이 오래된 땅을 다시 조사하는 대신 새로운 화학적 영역을 탐구하는 데 자원을 집중함으로써 더 빠르고 효율적으로 움직일 수 있게 해줍니다. 이 연구는 의약 화학자들 사이에서 오랫동안 이어져 온 직관, 즉 다양한 참조점을 갖는 것이 유사한 참조점의 깊은 집합보다 더 강력하다는 점을 확인해 줍니다. 연구진은 수확이 감소하는 지점을 이해함으로써, 과학계가 세상에 새로운 의약품을 가져오기 위해 필요한 시간과 자금을 어떻게 배분할지에 대해 더 현명한 결정을 내릴 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.