BioGCN: Biologically Inspired Graph Convolutional Network to Predict Human Oral Bioavailability
이 논문은 ATC 코드를 도메인 지식으로 통합하여 기존의 머신러닝 방법 및 기존 모델들과 비교하여 인간의 경구 생체이용률 예측 정확도를 크게 향상시킨 생물학적 영감을 받은 그래프 합성곱 신경망인 BioGCN을 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 탐정이라고 상상해 보십시오. 범죄 현장은 범죄 현장이 아니라 인체입니다. 미스터리는 무엇일까요? 왜 어떤 약들은 삼켰을 때 마법처럼 효과를 발휘하는 반면, 어떤 약들은 그저 위장에 머물다 아무런 효과도 내지 못한 채 사라져 버리는 걸까요? 이것이 바로 신약 개발의 세계입니다. 과학자들이 수십억 달러의 비용과 10년 이상의 시간을 들여 하나의 화학적 아이디어를 생명을 구하는 알약으로 바꾸기 위해 고군분투하는 고도의 승부처입니다. 가장 큰 장애물은 단순히 바이러스를 죽이거나 종양을 막는 분자를 찾는 것이 아닙니다. 그 분자가 당신의 소화계를 통과하여 혈류에 도달할 수 있을 만큼 실제로 살아남을 수 있는지 확인하는 것입니다. 이 여정을 "경구 생체이용률(oral bioavailability)"이라고 부릅니다. 이것을 마라톤 선수에 비유해 보십시오. 선수가 빠르다고 해서 장애물에 걸려 넘어지거나 길을 잃지 않는 한 반드시 경주를 완주할 수 있는 것은 아닙니다. 약의 세계에서, 만약 분자가 간과 장을 통과하는 "초회 통과(first pass)" 과정을 견뎌내지 못한다면, 그것이 시험관 안에서 아무리 강력해 보일지라도 실패한 것입니다.
오랫동안 과학자들은 자동차 부품 목록만 보고 자동차가 어떻게 달릴지 추측하는 정비사처럼, 화학적 특징들의 "체크리스트"를 사용하여 이 여정을 예측하려고 노력했습니다. 하지만 이 방식은 느리고, 많은 전문가의 추측을 필요로 하며, 종종 큰 그림을 놓치곤 합니다. 최근에는 "그래프 합성곱 신경망(Graph Convolutional Network, GCN)"이라는 새로운 종류의 AI가 등장했습니다. GCN을 체크리스트가 아닌 지도로 상상해 보십시오. GCN은 분자 전체를 연결된 웹(마치 도로와 교차로가 있는 도시 지도와 같은)으로서 바라보며, 그 안에서 교통 흐름이 어떻게 발생하는지를 학습합니다. 이 논문은 이 지도 판독기의 더욱 똑똑한 버전인 BioGCN을 소개합니다. 이것이 "생물학적 영감을 받은(biologically inspired)" 이유는 단순히 지도만 보는 것이 아니라, 지형을 더 잘 이해하기 위해 약물 카테고리라는 "가이드북"을 함께 가져오기 때문입니다.
인도 통계 연구소(Indian Statistical Institute)의 연구진은 이 가이드북을 추가하는 것이 AI를 더 나은 탐정으로 만들 수 있을지 알고 싶어 했습니다. 그들은 약물이 높은 혹은 낮은 생체이용률을 가질지 예측하기 위해 BioGCN을 구축했습니다. 이를 위해 그들은 AI에게 학습할 수 있도록 1,480개의 알려진 약물로 구성된 방대한 라이브러리를 제공했습니다. 하지만 여기에는 반전이 있습니다. 그들은 AI에게 두 가지 다른 유형의 정보를 주었습니다. 첫 번째는 순수한 화학적 지도(원자의 구조)였습니다. 두 번째는 그 순수한 지도에 ATC 코드라는 특별한 코드를 더한 것이었습니다. ATC 코드는 약물을 위한 도서관의 듀이 십진 분류법과 같아서, 해당 약물이 무엇을 해야 하는지, 그리고 신체의 어느 부분을 목표로 하는지를 정확히 알려줍니다. 연구진의 핵심 아이디어는 같은 "도서관 구역"(동일한 ATC 코드)에 속한 약물들은 아마도 체내를 이동하는 방식에 대해 유사한 비밀을 공유할 것이라는 점이었습니다.
연구진이 BioGemann을 테스트했을 때, 결과는 유망했습니다. 화학적 지도와 라이브러리 가이드북을 모두 갖춘 이 AI는 훈련 데이터에서 약 65.83%에서 76.5% 사이의 정확도로 새로운 약물의 성공 여부를 예측해 냈습니다. 완전히 새로운, 본 적 없는 약물들(288개 및 45개 그룹)을 대상으로 테스트했을 때도 여전히 인상적인 성능을 보였으며, 특정 시나리오에 따라 53.82%에서 77.78% 사이의 정확도를 기록했습니다. 이 연구는 이 접근 방식이 화학적 지도에만 의존하거나 전통적인 컴퓨터 모델에 의존하는 기존 방식보다 더 낫다는 것을 시사합니다. 실제로 "HOBPre"나 "Deep-PK"와 같은 다른 최상위 모델들과 비교했을 때, BioGCN은 성공적인 약물과 실패한 약물을 구별하는 능력을 포함한 거의 모든 카테고리에서 우위를 점했습니다.
연구진은 또한 자신들의 모델이 단순히 답을 암기하고 있는 것인지, 아니면 실제로 학습하고 있는 것인지를 확인했습니다. 그들은 시험을 치르고, 채점한 다음, 내용을 정말로 이해했는지 확인하기 위해 다른 버전의 시험을 치르는 것과 같은 "교차 검증(cross-validation)" 기법을 사용했습니다. 결과는 BioGCN이 잘 일반화된다는 것을 보여주었습니다. 즉, 혼란을 겪지 않고 새로운, 보지 못한 약물들을 처리할 수 있다는 뜻입니다. 또한 그들은 데이터를 조직하는 두 가지 방식, 즉 화학적 특징만 있는 방식(FM)과 화학적 특징에 ATC 가이드북을 더한 방식(CFM)을 비교했습니다. 데이터에 따르면 가이드북이 포함된 버전(CFM)이 일관되게 더 나은 성능을 보였으며, 이는 약물의 "가족"을 아는 것이 체내 여정을 예측하는 데 정말로 도움이 된다는 것을 시사합니다.
하지만 이 논문은 이것을 마법의 탄환이라고 부르는 데 주의를 기울입니다. 저자들은 이 모델이 중요한 진전이지만, 특히 실제 세계의 무질서하고 불균형한 약물 데이터와 관련하여 여전히 과제에 직면해 있다고 언급했습니다. 그들은 모델의 성능이 데이터를 어떻게 처리하느냐(예를 들어, 성공한 약물과 실패한 약물의 숫자를 균형 있게 맞추기 위해 "SMOTE"라고 불리는 기술을 사용하는 것)에 따라 달라질 수 있음을 발견했습니다. BioGCN이 다른 방법들보다 뛰어난 성과를 보였음에도 불구하고, 테스트 세트에서의 정확도는 최상의 경우에도 약 77% 수준에 머물렀습니다. 이는 "생물학적 영감을 받은" 접근 방식이 강력한 도구이긴 하지만, 예측을 완벽하게 만들기 위해서는 여전히 할 일이 남아 있음을 시사합니다. 이 연구는 분자의 구조적 지도와 생물학적 분류를 결-합함으로써, 우리는 약물 개발자들이 약물을 약국 선반에 올리기 위해 필요한 수백만 달러와 수년의 시간을 들일 가치가 있는 후보를 결정하는 데 도움이 되는 더 똑똑한 도구를 구축할 수 있다고 결론짓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.