Two Comparators May Be All We Need
이 논문은 화합물의 화학 구조와 단백질 서열을 비교함으로써 화합물과 표적 간의 쌍별 선호도를 정확하게 예측하고, 구조적 형태 분석이나 단백질 구조 데이터 없이도 높은 순위 결정 정확도를 달성하는 두 가지 구조 자유(structure-free) 머신러닝 모델을 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
살아있는 세포 내부에서 약물 분자는 단 하나의 표적만을 만나는 것이 아닙니다. 그 분자는 수많은 단백질이 존재하는 혼잡한 환경을 떠돌며, 그중 상당수는 서로 다른 가계(family)에 속해 있습니다. 분자의 궁극적인 효과는 의도한 표적에 결합하는 것뿐만 아니라, 이 모든 상호작용의 총합입니다. 수십 년 동안 이러한 상호작용을 연구하는 표준적인 방식은 한 번에 하나의 질문만을 던지는 것이었습니다. 즉, '이 특정 약물이 이 특정 단백질에 결합하는가?'라는 질문입니다. 연구자들은 이러한 단일 상호작용을 예측하기 위한 모델들을 구축해 왔지만, 신약 개발의 현실은 결코 그렇게 고립되어 있지 않습니다. 과학자들은 종종 의사결정을 이끄는 두 가지 실질적이고 비교적인 질문에 직면합니다. 새로운 약물 후보가 주어졌을 때, 두 개의 잠재적 표적 중 어느 쪽에 결합할 가능성이 더 높은가? 그리고 반대로, 특정 표적이 주어졌을 때, 두 개의 약물 후보 중 어느 것이 더 적합한가? 이 질문들에 답하는 것은 연구자들이 어떤 화합물을 다음에 합성할지, 그리고 약물이 임상에 도달하기 훨씬 전부터 어떤 원치 않는 부작용을 스크리닝해야 할지를 결정하는 데 도움을 줍니다.
한 연구팀은 이제 이러한 비교 질문에 답하기 위해 특별히 설계된 두 개의 컴퓨터 모델을 구축했습니다. 이 모델들은 단일 약물-단백질 쌍에 대한 정밀한 결합 강도를 계산하려고 시도하는 대신, 두 항목을 동시에 살펴보고 단순히 승자를 선택합니다. 한 모델은 하나의 약물과 두 개의 서로 다른 단백질을 입력받아 해당 약물이 어떤 단백질을 선호하는지 예측합니다. 다른 모델은 하나의 단백질과 두 개의 서로 다른 약물을 입력받아 해당 단백질이 어떤 약물을 선호하는지 예측합니다. 이 모델들은 약 800,000개의 고유한 약물 분자와 2,700개 이상의 인간 단백질을 포함하는 120만 개 이상의 측정치를 담은 방대한 공개 데이터베이스를 통해 학습되었습니다. 결정적으로, 이 모델들은 단백질이나 약물 분자의 3차원 형상에 의존하지 않습니다. 이들은 결합 포켓의 정확한 구조를 알 필요도 없고, 분자들이 서로 맞물리기 위해 어떻게 뒤틀리고 회전하는지를 시뮬레이션할 필요도 없습니다. 대신, 이들은 단백질을 구성하는 아미노산의 가공되지 않은 서열과 약물의 2차원 화학 구조 지도를 활용하여 작동합니다.
결과는 이러한 직접적인 비교 접근 방식이 놀라운 정확도로 작동함을 보여줍니다. 서로 다른 가계의 두 단백질 사이에서 선택하도록 요청되었을 때, 모델은 약 75%의 확률로 선호되는 표적을 올바르게 선택했습니다. 두 단백질이 동일한 가계에 속할 경우, 정확도는 78%로 높아졌습니다. 단일 표적에 대해 두 약물 사이를 선택하는 역방향 질문의 경우, 모델은 71%의 정확도를 보였습니다. 연구진은 모델의 확신도가 신뢰할 수 있는 지표라는 것을 발견했습니다. 모델이 선택에 대해 매우 확신할 때, 그 정확도는 90% 이상으로 급증합니다. 그러나 두 옵션의 측정된 활성이 매우 유사할 때, 모델이 이들을 구별하는 능력은 떨어지는데, 이는 실험 데이터 자체가 그 경우에 구분하기 더 어려워진다는 사실을 반영합니다. 모델은 이전에 본 적 없는 약물 분자들로 테스트되었으며, 이를 통해 결과가 단순히 과거 데이터의 기억이 아니라 진정한 일반화 능력임을 입증했습니다.
이 연구의 핵심적인 발견은 이러한 예측의 정확도가 단순히 컴퓨터 알고리즘의 정교함뿐만 아니라, 과학적 기록에 존재하는 데이터에 크게 의존한다는 점입니다. 모델이 서로 다른 단백질 가계를 비교하기 위해서는, 두 가계 모두에 대해 테스트된 약물을 본 적이 있어야 합니다. 연구진은 데이터베이스 내의 약물 분자 중 단 4.6%만이 두 개의 서로 다른 단백질 가계에 걸쳐 측정되었다는 사실을 발견했습니다. 이러한 교차 가계 데이터의 희소성은 먼 거리에 있는 표적을 비교할 때 모델이 수행할 수 있는 성능에 자연적인 한계를 설정합니다. 반면, 단일 단백질 가계 내에서는 데이터가 훨씬 풍부하여 더 많은 비교가 가능합니다. 이 모델들은 정확한 결합 강도를 예측하거나 물리적 실험을 대체하기 위해 설계된 것이 아닙니다. 대신, 이들은 연구자들이 어떤 실험을 먼저 수행할지 우선순위를 정하는 데 도움을 주는 강력한 분류 도구 역할을 합니다. 절대적인 수치가 아닌 선호도를 기준으로 표적과 화합물의 순위를 매김으로써, 이 도구들은 관련된 모든 단백질의 상세한 3차원 구조를 알 필요 없이 복잡한 약물 상호작용의 영역을 탐색할 수 있는 방법을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.