TDEP: Predicting Target Perturbation Response from Drug-Induced Transcriptomes
TDEP는 단백질 언어 모델 임베딩과 그래프 어텐션 네트워크를 활용하여 약물 유도 프로파일로부터 전사체 수준의 표적 섭동 반응을 정확하게 예측하는 딥 뉴럴 네트워크로, 구조 기반 방법론과 대등한 정확도를 제공하면서도 표적 우선순위 선정 및 약물 재창출을 위한 상세한 유전자 수준의 기전적 통찰력을 제공한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
생물학적 자물쇠에 맞는 적절한 열쇠를 찾는 것은 현대 신약 개발의 핵심 과제입니다. 과학자들은 오래전부터 약물이 체내의 특정 단백질에 결합하여 작용한다는 사실을 알고 있었으며, 이는 마치 열쇠가 자물쇠에 꼭 들어맞는 것과 같습니다. 열쇠가 맞으면 자물쇠를 돌려 질병을 멈추거나 치유 과정을 시작할 수 있습니다. 수십 년 동안 연구자들은 이러한 일치를 예측하기 위해 두 가지 주요 전략을 시도해 왔습니다. 한 가지 접근 방식은 분자의 물리적 형태를 살펴보고, 이것이 퍼즐 조각처럼 서로 잘 맞는지 확인하는 것입니다. 다른 방식은 화학적 여파를 관찰하여, 약물이 도입되었을 때 세포 내부의 지침이 어떻게 변하는지 살피는 것입니다. 형태 기반 방식은 일치가 일어날지 예측하는 데는 뛰어나지만, 그 다음에 어떤 일이 일어나는지는 설명하지 못하는 경우가 많습니다. 화학적 방식은 여파를 보여줄 수는 있지만, 정확히 어떤 단백질이 변화를 일으켰는지 짚어내는 데 어려움을 겪으며, 세포의 복잡한 반응이라는 소음 속에서 길을 잃기 쉽습니다.
대한민국의 이화여자대학교 연구팀은 이 간극을 메울 새로운 방법을 개발했습니다. 그들은 TDEP(Target-perturbed Differential Expression Profile, 표적 변동 차등 발현 프로파일)라고 불리는 시스템을 만들었습니다. TDEP는 단순히 약물이 단백질에 달라붙을지를 예측하는 것을 넘어, 그 단백질이 세포 전체의 지침서인 전사체(transcriptome)에 미치는 구체적인 파급 효과를 예측합니다. 세포를 수많은 책이 있는 거대한 도서관이라고 상상해 보십시오. 여기서 각 책은 하나의 유전자입니다. 약물이 표적 단백질을 타격하면, 단순히 책 한 권을 침묵시키는 데 그치지 않고 수천 권의 다른 책들의 읽기 순서를 바꿉니다. TDEP는 약물에 대한 도서관의 반응을 읽는 법을 배우고, 그 후 역으로 추적하여 어떤 단백질이 그 혼란의 원래 원인이었는지를 정확히 예측합니다. 이를 통해 과학자들은 단순히 일치 여부를 찾는 것을 넘어, 그 뒤에 따르는 생물학적 이야기를 이해할 수 있게 됩니다.
연구진은 방대한 양의 생물학적 데이터를 통해 컴퓨터가 패턴을 인식하도록 학습시킴으로써 이 시스템을 구축했습니다. 그들은 Connectivity Map이라는 공공 데이터베이스에서 수집한, 약물로 유도된 유전자 활동 변화의 거대한 컬렉션에서 시작했습니다. 이 데이터베이스에는 다양한 화학 물질에 대해 서로 다른 세포들이 어떻게 반응하는지에 대한 백만 개 이상의 스냅샷이 담겨 있습니다. 연구팀은 이러한 화학적 스냅샷을 약물이 타격해야 하는 단백질의 유전자 서열과 결합했습니다. 그들은 언어 모델이 문장을 이해하는 것과 유사하게 단백질 서열을 이해하는 인공지능 유형을 사용하여 표적 단백질을 표현했습니다. 그런 다음, 특정 단백질을 특정 유전자 변화 패턴과 연결하도록 시스템을 훈련시켰습니다. 이 시스템은 상호작용에 대해 단순히 "예" 또는 "아니오"라고 말하는 것이 아니라, 특정 단백질이 차단되었을 때 세포의 유전자들이 어떻게 높아지거나 낮아질지에 대한 상세한 지도를 생성합니다.
연구팀이 기존 방법들과 이 새로운 시스템을 비교 테스트했을 때, 결과는 놀라웠습니다. 그들은 분자 형태에 의존하는 기존 모델 및 유전자를 인위적으로 억제하는 실험에서 얻은 유전 데이터를 사용하는 모델들과 TDEP를 비교했습니다. 시스템이 본 적 없는 새로운 약물을 대상으로 한 테스트에서, TDEP는 상호작용을 올바르게 식별하는 데 있어 0.87의 AUC를 달축성했습니다. 이 성능은 현재 골드 스탠다드로 간주되는 최고의 형태 기반 모델들과 대등한 수준이었으며, AUC 0.6에 미치지 못해 어려움을 겪었던 기존의 유전적 방법들보다 현저히 높았습니다. 연구진은 시스템이 주어진 데이터로부터 학습하는 능력이 탁월하며, 단순히 정답을 암기하는 흔한 함정을 피했다는 점을 발견했습니다. 시스템은 단백질과 그 세포적 결과 사이를 연결하는 근본적인 생물학적 논리를 인식하는 법을 배웠습니다.
가장 중요한 발견 중 하나는 시스템이 서로 다른 종류의 미지의 상황을 처리하는 방식이었습니다. 연구진은 두 가지 시나리오, 즉 약물은 새롭지만 단백질은 익숙한 경우와 단백질이 완전히 새로운 경우를 테스트했습니다. 그들은 시스템이 이 문제들을 해결하기 위해 두 가지 다른 도구를 사용한다는 것을 발견했습니다. 단백질이 알려진 경우, 시스템은 학습된 상세한 유전자 변화 지도를 활용하여 결과를 예측합니다. 반면 단백키가 새로운 경우, 시스템은 단백질의 유전자 서열에 대한 깊은 이해에 의존하여 교육적인 추측을 합니다. 이러한 이중적 접근 방식 덕분에 시스템은 견고하게 작동하며, 새로운 약물을 마주하든 새로운 표적을 마주하든 잘 작동합니다. 또한, 시스템은 지식을 서로 다른 유형의 세포 간에 전달할 수 있음을 보여주었습니다. 한 종류의 암세포에서 훈련된 모델은 다른 종류의 암세포에 적용했을 때도 정확한 예측을 할 수 있었는데, 이는 이러한 단백질이 유전자에 영향을 미치는 근본적인 규칙이 서로 다른 생물학적 맥락 간에 공유된다는 것을 시사합니다.
연구팀은 또한 시스템이 실제로 생물학을 학습하고 있는지, 아니면 단순히 지름길을 찾고 있는 것인지 면밀히 조사했습니다. 그들은 시스템이 표적이 차단되었을 때 변화할 것이라고 예측한 특정 유전자들을 검토하고, 이를 다른 실험에서 얻은 실제 데이터와 비교했습니다. 그 결과 강력한 일치성을 발견했습니다. 예를 들어, 특정 심장 관련 단백질을 차단했을 때의 효과를 예측했을 때, 시스템이 가장 변화할 가능성이 높다고 지목한 유전자들은 해당 단백질을 제거했을 때 실제로 변화했던 유전자들과 일치했습니다. 이는 시스템이 단순한 통계적 소음이 아닌 진정한 생물학적 신호를 포착하고 있음을 시사합니다. 연구진은 예측이 완벽하지 않고 효과 크기가 때때로 작을 수 있지만, 약물의 작용에 대한 유전자 수준의 설명을 생성할 수 있는 능력은 중요한 진전이라고 언급했습니다. 이는 실험실에서 테스트할 수 있는 가설을 생성하는 방법을 제공합니다.
이러한 성공에도 불구하고, 연구진은 자신들의 연구가 가진 한계를 명확히 짚고 있습니다. 현재 이 시스템은 공공 데이터베이스에 이미 프로파일링된 특정 암 세포주와 약물 데이터에 의존하고 있습니다. 아직 실험실에서 테스트된 적이 없는 완전히 새로운 화학 구조의 효과를 예측할 수는 없습니다. 또한, 시스템은 약물이 표적과 상호작용할지는 예측하지만, 얼마나 강하게 결합하는지는 측정하지 않습니다. 연구진은 또한 사용하는 생물학적 데이터가 특정 기술을 바탕으로 하고 있으며, 다른 측정 플랫폼의 데이터에 적용될 경우 결과가 달라질 수 있음을 인정합니다. 그러나 핵심적인 성과는 여전히 유효합니다. 즉, 특정 단백질을 표적으로 삼았을 때의 상세한 전사적 결과를 높은 정확도로 예측하는 것이 가능하다는 것을 입증했다는 점입니다.
이 연구는 신약 개발에 접근하는 방식에 새로운 관점을 제시합니다. 단순한 예/아니오 예측을 넘어, TDEP는 작용 기전에 대한 창을 제공합니다. 이를 통해 과학자들은 약물이 유발할 것으로 예측되는 특정 유전자 변화 패턴을 살펴봄으로써 잠재적인 부작용이나 치료적 이점을 확인할 수 있습니다. 연구진은 이 접근 방식이 어떤 약물 표적을 추적할 가치가 있는지 우선순위를 정하고, 기존 약물이 어떻게 작용하는지에 대한 새로운 아이디어를 생성하며, 심지어 오래된 약물의 새로운 용도를 찾는 데 도움을 줄 수 있다고 제안합니다. 생물학적 데이터베이스가 계속 성장하고 인공지능 모델이 더욱 정교해짐에 따라, 단백질 표적과 그 전체적인 세포적 결과 사이를 연결하는 이 방법은 질병을 이해하고 치료하는 과정에서 표준적인 도구가 될 수 있습니다. 이 연구는 유전자 서열과 세포 반응 데이터를 결합하는 것이 두 방식이 단독으로는 달성할 수 없었던 통찰력을 산출할 수 있다는 것을 보여주는 개념 증명입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.