TRACE: A FINE-TUNED BIOMEDICAL LANGUAGE MODEL FOR DIRECTIONALLY INFORMED DRUG REPURPOSING FROM TRANSCRIPTOME-WIDE ASSOCIATION STUDIES
이 논문은 미세 조정된 생물 의학 언어 모델을 활용하여 문헌 큐레이션을 자동화하고, 약물-유전자 효과의 방향을 전사체 연관 연구(TWAS) 신호와 일치시킴으로써 약물 재창출을 위한 FDA 승인 후보 약물을 순위화하여 유전적 발견과 치료적 가설 생성을 연결하는 확장 가능한 AI 기반 파이프라인인 TRACE를 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
기존 약물의 새로운 용도를 찾는 것은 의학적 발전을 가속화할 수 있는 가장 유망한 방법 중 하나입니다. 처음부터 약물을 발명하는 대신—이 과정은 10년 이상 걸릴 수 있고 수십억 달ante의 비용이 들 수 있습니다—과학자들은 이미 인간에게 안전함이 입증된 화합물을 재활용하는 방법을 찾습니다. 과제는 특정 질병과 특정 약물 사이의 연결 고리를 찾는 데 있습니다. 현대 유전학은 이 여정을 위한 강력하고 새로운 지도를 제공했습니다. 우리 DNA의 변이가 유전자의 활동에 어떻게 영향을 미치는지 연구함으로써, 연구자들은 어떤 유전자가 질병을 유발할 가능성이 높은지 식별할 수 있습니다. 만약 특정 질환을 가진 환자에게서 특정 유전자가 과도하게 활성화되어 있다면, 논리적인 치료법은 그 유전자의 활동을 낮추는 약물이 될 수 있습니다. 반대로 유전자가 저활성화되어 있다면, 목표는 그 활동을 높이는 것이 될 것입니다. '방향성(directionality)'이라고 알려진 이 논리는 매우 중요합니다. 이미 활동이 과도한 환자에게 활동을 증가시키는 약물을 투여하는 것은 질병을 악화시킬 수 있기 때문입니다. 그러나 이러한 유전적 단서들을 실행 가능한 약물 후보 목록으로 바꾸는 것은 전통적으로 매우 느리고 수동적인 과정이었으며, 과학자들이 수천 편의 연구 논문을 읽고 복잡한 데이터베이스를 하나씩 대조하며 교차 참조해야 하는 작업이 필요했습니다.
연구팀은 이제 이 어려운 작업을 자동화하기 위해 TRACE라는 디지털 도구를 구축했습니다. 이 시스템은 고도로 전문화된 연구 보조원 역할을 하며, 질병과 연관된 유전자 목록을 받아 해당 질병을 치료할 수 있는 약물을 찾기 위해 전 세계의 의학 문헌을 빠르게 스캔할 수 있습니다. 과정은 과학자가 도구에 유전자 이름과 방향성(예: "이 질병에서 이 유전자는 너무 활성화되어 있다")을 제공하면서 시작됩니다. 도구는 먼저 4개의 주요 공공 데이터베이스를 확인하여 해당 유전자와 상호작용하는 것으로 알려진 FDA 승인 약물들을 확인합니다. 그런 다음, 미국 내 사용을 위해 공식적으로 승인된 의약품만을 남기도록 이 목록을 필터링합니다. 다음으로, 시스템은 방대한 의학 연구 기록 보관소인 PubMed로 가서, 해당 특정 약물이 특정 유전자에 어떻게 영향을 미치는지 설명하는 최신 초록들을 불러옵니다.
TRACE의 핵심 혁신은 과학적 요약문을 읽고 이해하는 능력에 있습니다. 연구진은 생물 의학 언어에 특화된 일종의 인공지능인 컴퓨터 모델을 훈련시켜 비판적인 독자 역할을 하도록 했습니다. 이 모델은 각 연구 초록을 검토하여 세 가지 사항을 결정합니다: 텍스트가 약물과 유전자 사이의 관계를 확인하는지, 그 관계의 기전(mechanism)은 무엇인지, 그리고 가장 중요한 점은 그 약물이 유전자를 높이는지 혹은 낮추는지입니다. 모델은 전문가가 주석을 달았던 이전 과학 경진대회의 데이터를 포함한 수천 개의 사례를 사용하여 학습되었으며, 이를 통해 유전자를 억제하는 약물과 활성화하는 약물 사이의 미묘한 차이를 배울 수 있었습니다. 모델이 증거를 분류하고 나면, 약물의 효과를 원래의 유전적 단서와 비교합니다. 만약 유전적 데이터가 유전자가 너무 활성화되어 있다고 말하고 약물이 그 활동을 낮춘다면, 시스템은 이를 유망한 치료 후보로 표시합니다. 만약 약물이 유전자를 높인다면, 시스템은 이를 잠재적인 안전 위험으로 표시하여, 이를 사용하는 것이 해로울 수 있음을 경고합니다.
연구진은 이 시스템이 인간 전문가의 작업을 재현할 수 있는지 확인하기 위해 테스트를 진행했습니다. 그들은 먼저 자궁 내막증(자궁 내막에 영향을 미치는 통증을 동반한 질환)과 관련된 유전자 세트에 시스템을 적용했습니다. 그들은 인간 전문가가 수동으로 큐레이션하고 검증한 43쌍의 기존 약물-유전자 쌍 목록을 가지고 있었습니다. 도구가 동일한 데이터를 실행했을 때, 알려진 쌍의 거의 91%를 성공적으로 찾아냈습니다. 시스템은 유익한 약물 후보와 위험한 안전 우려 사항 모두를 대다수 정확하게 식별해 냈습니다. 또한 이 시스템은 스스로 알려진 치료법을 재발견하는 능력을 입증했습니다. 자궁 내막증 유전자 전체 목록을 분석할 때, 시스템은 약물에 대한 사전 지식 없이 오직 문헌과 유전적 방향성만을 분석하여 잘 알려진 치료제인 레프로렐라세테이트(leuprolide acetate)를 독립적으로 식별해 냈습니다.
알려진 사례를 넘어, 이 도구는 자궁 내 내막증과 관련된 99개의 유전자로 탐색 범위를 넓혔고 1,000개 이상의 잠재적인 약물-유전자 상호작용을 찾아냈습니다. 이 거대한 풀(pool) 중에서, 시스템은 32쌍을 새로운 치료를 위한 강력한 후보로 강조하였고, 77쌍을 잠재적인 안전 우려 사항으로 분류했습니다. 시스템은 또한 지방간 질환과 제2형 당뇨병이라는 두 가지 다른 질병에 대해서도 성능을 검증했습니다. 이 경우, 시스템은 자신이 검색한 데이터베이스에 존재하는 약물 쌍의 거의 90%를 회복했습니다. 연구진은 이 도구가 이 약물들이 질병을 완치한다는 것을 증명하는 것이 아니라, 추가 연구를 위한 고도로 조직화되고 증거에 기반한 출발점을 제공한다는 점을 강조합니다. 이는 노이즈를 걸러내고 실험실이나 임상 시험에서 테스트할 수 있는 우선순위가 정해진 가설 목록을 제시합니다. 번거로운 읽기 및 교차 참조 작업을 자동화함으로써, TRACE는 과학자들이 유전자 발견에서 치료 아이디어로 더 빠르게 이동할 수 있게 해주며, 한때 수개월의 수동 노동이 필요했던 과정을 표준 컴퓨터에서 몇 시간 만에 완료할 수 있는 작업으로 바꾸어 놓았습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.