← 최신 논문
💻 bioinformatics

Interrogating contrastive learning embeddings for structure-based virtual screening: a case study on DrugCLIP

이 논문은 구조 기반 가상 스크리닝을 위한 DrugCLIP의 대조 학습 임베딩을 체계적으로 평가하여, 포켓 임베딩은 빠르고 견고한 구조적 유사성 검색을 제공하고 리간드 임베딩은 미지의 타겟에 대한 강력한 일반화 성능과 함께 포켓 인지적 화학 패턴을 포착하지만, 그 성능이 구조적 변이와 예측된 단백질 포켓의 부정확함에 의해 크게 제한된다는 점을 밝혀냈다.

원저자: Sanchez Utges, J., Jones, D. T., Orengo, C.

게시일 2026-09-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sanchez Utges, J., Jones, D. T., Orengo, C.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

새로운 약물을 찾는 것은 느리고 비용이 많이 드는 도박입니다. 단 하나의 약물을 시장에 출시하는 데 15년이 걸릴 수 있고 10억 달러 이상의 비용이 발생할 수 있는데, 이는 대부분의 잠재적 후보들이 그 과정에서 실패하기 때문입니다. 이러한 낭비를 줄이기 위해 과학자들은 컴퓨터 프로그램을 사용하여 수백만 개의 화학 화합물을 훑으며, 특정 질병 유발 단백질에 달라붙을 수 있는 소수의 화합물을 찾아냅니다. 가상 스크리닝(virtual screening)이라고 불리는 이 과정은 거대한 가능성의 도서관을 실제 테스트가 가능한 관리 가능한 목록으로 좁혀주는 필터 역할을 합니다. 수십 년 동안 이 작업은 약물의 물리적 모양을 단백질 결합 부위의 모양과 일치시키는 방식에 의존해 왔으나, 이는 계산량이 매우 많고 현재 사용 가능한 방대한 양의 단백질과 화학 물질을 처리하기에는 너무 느린 경우가 많았습니다.

최 최근, 이 탐색 과정을 언어 번역 문제처럼 다루는 새로운 접근 방식이 등장했습니다. 모든 상호작용의 물리학을 계산하는 대신, 이 방법들은 인공지능을 사용하여 단백질의 결합 포켓과 약물 분자를 공유된 추상적인 숫자의 언어로 번역합니다. 이 공유된 공간에서, 단백질에 잘 맞는 약물은 단백질 고유의 패턴과 매우 유사한 숫자 패턴을 갖게 되며, 맞지 않는 조합은 매우 다르게 보입니다. 이를 통해 컴퓨터는 단순히 이 숫자 패턴들을 비교함으로써 좋은 매칭을 찾아낼 수 있으며, 이 과정은 믿기지 않을 정도로 빠릅니다. DrugCLIP이라 불리는 이러한 도구 중 하나는 큰 가능성을 보여주었지만, 지금까지 과학자들은 이 추상적인 숫자 패턴이 실제로 무엇을 나타내는지 완전히 이해하지 못했습니다. 그들은 도구가 작동한다는 것은 알았지만, 그것이 진정으로 화학을 이해하고 있는지 아니면 단순히 정답을 암기하고 있는 것인지는 알지 못했습니다.

유니버시티 칼리지 런던(University College London)의 연구팀은 DrugCLIP의 내부에서 정확히 어떤 일이 일어나고 있는지 확인하기 위해 이 '블랙박스'를 열어보기로 했습니다. 그들은 이 도구를 마법 지팡대가 아니라 측정하고 이해할 수 있는 시스템으로 취급했습니다. 그들의 조사 결과, 이 도구는 단순히 약물을 단백질에 매칭하는 것보다 훨씬 더 유용한 것을 학습했다는 사실이 밝혀졌습니다. 연구진은 도구가 가진 단백질 결합 포켓의 내부 표현이 매우 정확하여, 기존의 어떤 방법보다도 더 빠르게 서로 다른 단백질 간의 유사한 포켓을 식별할 수 있다는 것을 발견했습니다. 더욱 놀라운 점은 이 도구가 유사한 포켓을 찾도록 명시적으로 교육받지 않았음에도 불구하고, 오직 약물이 결합하는 것을 찾는 법만을 배웠음에도 불구하고 이 일을 해냈다는 것입니다. 즉, 약물을 찾는 법을 배우는 과정에서 자신도 모르게 포켓 자체의 모양과 구조를 놀라운 정밀도로 인식하는 법을 배운 것입니다.

연구팀은 또한 이 도구가 분자의 물리적 실체를 어떻게 다루는지 검토했습니다. 단백질과 약물은 딱딱한 조각상이 아닙니다. 그것들은 꿈틀거리고 움직입니다. 연구진은 약물 분자가 약간 다른 모양으로 보여지거나 단백질이 약간 다른 위치에 있을 때 도구가 혼란을 겪을지 테스트했습니다. 그들은 도구가 매우 견고하다는 것을 발견했습니다. 동일한 약물이 수십 가지의 서로 다른 움직이는 모양으로 보여지더라도, 도구는 그것들을 동일한 분자로 인식했습니다. 마찬가지로 단백질 포켓이 다양한 상태(약물과 결합한 상태, 비어 있는 상태, 그리고 다른 AI 모델에 의해 예측된 상태 등)로 보여질 때도 도구의 내부 지도는 일관성을 유지했습니다. 그러나 연구는 도구의 성능이 떨어지기 시작하는 명확한 경계선도 그려냈습니다. 연구진이 결합 부위에 잘못된 아미노산을 가진 예측된 단백질 구조를 사용하거나, 단백질의 측쇄(side chains)가 잘못된 방향을 향하고 있을 때, 올바른 약물을 찾는 도구의 능력이 크게 떨어졌습니다. 이는 이 도구가 강력하기는 하지만, 단백질의 물리적 구조에 대한 정확한 이미지에 여전히 의존하고 있음을 나타냅니다.

아마도 가장 중요한 발견은 이 도구가 암기에 의존하고 있는지에 대한 테스트였습니다. 연구진은 도구가 학습 데이터로부터 정답을 단순히 회상할 수 없도록, 이전에 본 적 없는 단의 단백질과 화학 물질에 대해 도구에게 질문하는 엄격한 테스트를 수행했습니다. 결과는 고무적이었습니다. 완전히 새로운 화학 구조를 가진 새로운 단백질들에 대해서도, 도구는 여전히 약 55%에서 75%의 경우에서 올바른 약물을 전체 후보 중 상위 1% 안에 배치했습니다. 이는 도구가 단순히 알려진 쌍의 목록을 암기하는 것이 아니라, 단백질과 약물이 상호작용하는 규칙을 진정으로 학습하고 있음을 증명했습니다. 이는 도구가 완전히 새로운 상황에 자신의 지식을 일반화할 수 있음을 보여주었으며, 이는 실제 신약 개발에 있어 필수적인 요구 사항입니다.

연구는 DrugCLIP과 같은 도구들이 엄청난 속도와 능력의 도약을 의미하지만, 아직 완벽하지는 않다고 결론지었습니다. 이들의 성공은 제공되는 단백질 구조의 정확도에 달려 있습니다. 만약 시작 단계의 단백질 모델이 약간 어긋나거나, 예측된 결합 부위에 잘못된 원자가 포함되어 있다면 도구의 성능은 저하됩니다. 연구진은 이러한 시스템을 개선하기 위한 다음 단계가 단순히 더 나은 AI가 아니라, 단백질 포켓의 정밀한 모양을 예측하는 더 나은 방법이라고 제안합니다. 이러한 빠르고 스마트한 스크리닝 도구를 더 정확한 구조 예측과 결합함으로써, 과학자들은 신약 발견이 더 빠르고, 저렴하며, 신뢰할 수 있는 미래에 더 가까이 다가갈 수 있습니다. 이 연구는 복잡한 기술을 규명하며, 그 렌즈 자체가 안정적으로 유지된다면 그것이 미시적인 세계를 바라보는 강력한 새로운 렌즈가 될 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →