Clinical trial success prediction from open registry text using classical machine learning
본 연구는 고전적인 머신러닝 모델, 특히 랜덤 포레스트가 ClinicalTrials.gov의 공개 레지스트리 텍스트만을 사용하여 임상 시험의 성공을 효과적으로 예측할 수 있음을 입증하며, 엄격한 전처리를 통해 데이터 누수를 완화하는 동시에 다양한 임상 단계와 적응증에 걸쳐 중등도에서 강한 수준의 성능을 달성한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매년 제약 회사들은 신약을 개발하기 위해 수십억 달러의 자금과 수십 년의 노력을 쏟아붓습니다. 실험실의 유망한 아이디어에서 약국 선반 위의 알약에 이르는 경로는 길고 실패로 가득 차 있습니다. 대부분의 후보 물질은 승인 단계에 도달하지 못하며, 수년간의 노력 끝에 실패할 때 발생하는 재정적 손실은 막대합니다. 더 중요한 것은, 이러한 연구에 자원하는 사람들이 기대했던 혜택을 받지 못한 채 위험에 직면한다는 점입니다. 자원은 한정되어 있기 때문에, 결국 실패하게 될 약물에 투입되는 모든 달러와 시간은 성공할 수도 있었던 다른 약물로부터 빼앗아 온 자원입니다. 업계는 오랫동안 너무 많은 시간과 돈이 투자되기 전에, 이들 중 실패할 운명인 후보들을 조기에 식별하여 연구자들이 약한 프로그램은 중단하고 강한 프로그램에 집중할 수 있게 하는 방법을 모색해 왔습니다.
이를 위해 과학자들은 임상 시험, 즉 신약 치료제가 환자들에게 투여되는 엄격한 테스트의 결과를 예측하려고 시도해 왔습니다. 이러한 예측이 어려운 이유는 복잡한 인간의 생물학, 특정 연구 설계, 그리고 새로운 약물의 거동에 대한 이해에 의존해야 하기 때문입니다. 전통적으로 전문가들은 경험을 사용하여 어떤 시험이 성공할지 추측해 왔지만, 이 과정은 느리고 주관적이며 비용이 많이 듭니다. 최근 몇 년 동안 연구자들은 컴퓨터를 사용하여 인간이 놓칠 수 있는 데이터의 패턴을 찾는 머신러닝 기술을 활용해 왔습니다. 그러나 이러한 많은 컴퓨터 모델은 대기업만이 접근할 수 있는 비공개 데이터에 의존하거나, 항상 이용 가능한 것은 아닌 복잡한 분자 정보를 필요로 합니다. 이는 소규모 그룹이나 학술 연구자들이 임상 시험의 성공 가능성을 추정할 수 있는 명확한 방법을 갖지 못하게 만듭니다.
독립 연구자인 마이클 도인(Michael Doane)의 새로운 연구는 누구나 온라인으로 읽을 수 있는 이러한 임상 시험의 공개 기록이 예측을 수행하기에 충분한 정보를 담고 있는지 탐구합니다. 이 연구는 ClinicalTrials.gov라는 공공 웹사이트의 방대한 임상 시험 기록에 초점을 맞춥니다. 이 웹사이트는 연구자들이 연구를 시작하기 전에 질병, 테스트 중인 약물, 참여 환자 수, 연구 목표 등의 세부 사항을 게시해야 하는 글로벌 등록소 역할을 합니다. 도인의 연구는 다음과 같은 단순한 질문을 던집니다. 만약 공공 기록의 텍스트 설명을 컴퓨터에 입력한다면, 컴퓨터가 성공할 시험과 실패할 시험을 구별하는 법을 배울 수 있을 것인가?
이에 답하기 위해 연구자는 약 125,000개의 과거 임상 시험에 대해 최종 결과에 따라 성공 또는 실패로 라벨을 지정한 '임상 시험 결과 데이터셋(Clinical Trial Outcome Dataset)'을 사용했습니다. 과제는 최종 결과를 엿보거나 비공개 기업 데이터를 사용하지 않고, 오직 등록 당시의 공공 등록부에 있는 텍ales만을 사용하여 이러한 결과를 예측할 수 있는 모델을 구축하는 것이었습니다. 연구자는 컴퓨터 모델이 결과가 나온 후에 업데이트된 텍스트를 읽음으로써 정답을 알아차리는 '데이터 누수(data leakage)'라는 흔한 실수를 피하기 위해 매우 주의해야 했습니다. 예를 들어, 임상 시험의 요약본이 몇 년 후 최종 결과를 포함하여 다시 작성될 수 있는데, 만약 컴퓨터가 이 업데이트된 텍스트를 읽는다면, 그것은 미래를 예측하는 것이 아니라 단지 과거를 읽고 있는 것에 불과하기 때문입니다.
이를 방지하기 위해 연구자는 텍스트가 결과가 알려진 후에 변경되었을 가능성이 있는 모든 기록을 제거하여 데이터를 세심하게 정제했습니다. 또한 결과를 직접적으로 설명하는 특정 필드들도 제외했습니다. 데이터가 안전해진 후, 연구자는 남은 텍스트에서 패턴을 찾기 위해 세 가지 다른 유형의 컴퓨터 모델을 훈련시켰습니다. 이 모델들은 개발 단계, 즉 '페이즈(phase)'별로 테스트되었습니다. 페이즈 1은 약물의 안전성을 확인하기 위해 처음으로 인간에게 테스트하는 단계이며, 페이즈 2는 약물이 실제로 효과가 있는지 징후를 살피는 단계이고, 페이즈 3는 승인 전 약물의 유효성과 안전성을 확증하는 대규모 연구입니다.
결과는 컴퓨터 모델이 공공 텍스트에서 실제로 유용한 신호를 찾을 수 있음을 보여주었습니다. '랜덤 포레스트(random forest)'라고 불리는 방법을 사용한 가장 성능이 좋은 모델은 무작위 확률보다 더 나은 수준으로 성공한 시험과 실패한 시험을 구분해 냈습니다. 가장 초기 단계인 페이즈 1 테스트에서 모델은 약 74%의 사례에서 결과를 정확하게 분류하며 꽤 우수한 성능을 보였습니다. 이는 만약 페이즈 1 시험 그룹을 가져온다면, 모델이 높은 정확도로 성공 가능성이 높은 시험을 식별할 수 있음을 의미합니다. 페이즈 2의 경우 성능이 더 낮았는데, 이는 페이즈 2가 약물이 적절한 생물학적 표적에 도달하는지에 크게 의존하기 때문이며, 이러한 세부 사항은 공공 요약본에서 누락되는 경우가 많아 예측하기가 매우 까다롭습니다. 그럼에도 불구하고 모델은 이 단계에서도 무작위 확률보다는 나은 성능을 보였습니다.
가장 흥러운 발견 중 하나는 다양한 질병에 대해 모델을 훈련시키는 것이 신경과학(neuroscience)이라는 특정 질병군을 예측하는 데 실제로 도움이 되었다는 점입니다. 알츠하이머병이나 우울증과 같은 질환을 다루는 신경과학 임상 시험은 역사적으로 매우 높은 실패율을 보여왔습니다. 연구자는 컴퓨터가 신경과학뿐만 아니라 모든 의료 분야의 임상 시험을 통해 훈련되었을 때, 신경과학 임상 시험의 성공을 더 잘 예측하게 된다는 것을 발견했습니다. 이는 임상 시험이 설계되고 운영되는 일반적인 규칙이 다양한 유형의 질병에 걸쳐 유사하며, 광범위한 사례로부터 학습하는 것이 컴퓨터가 신경계의 특수한 과제를 이해하는 데 도움을 준다는 것을 시사합니다.
또한 연구는 모델을 인간 전문가들이 예측하기 어렵도록 수동으로 검토한 7,260개의 까다로운 사례들과 대조하여 테스트했습니다. 이러한 어려운 사례들에 대해서도 모델은 성공과 실패를 구별하는 능력을 유지했으며, 이는 모델이 단순히 단순한 규칙을 암기한 것이 아니라 임상 시험의 본질에 대해 실제로 학습했음을 입증했습니다. 연구자는 또한 모델이 임상 시험을 후원하는 회사의 이름이나 개최 장소에 의존하는지 확인했습니다. 이러한 세부 정보를 제거했을 때 모델의 성능은 약간만 하락했는데, 이는 과학 및 연구 설계를 설명하는 텍스트가 예측의 무게를 대부분 실어 나르고 있음을 나타냅니다.
이 작업은 수년간 존재해 왔으나 이런 방식으로 분석되지 않았던 공공 정보가 제약 산업에 상당한 가치를 지니고 있음을 보여줍니다. 이 연구에 사용된 모델들은 비교적 단순하며 강력한 슈퍼컴퓨터를 필요로 하지 않습니다. 표준 노트북에서도 실행할 수 있습니다. 이는 이 접근 방식이 독점적인 데이터베이스에 접근할 수 없는 학술 연구자, 비영리 단체, 그리고 소규모 기업들에게도 접근 가능하다는 것을 의미합니다. 공개 데이터를 사용하여 성공 가능성을 추정하는 방법을 제공함으로써, 이 방식은 약물 후보를 선별하는 새로운 도구를 제시합니다. 이것이 전문가의 판단이나 복잡한 약물 개발 과정을 대체하는 것은 아니지만, 신뢰할 수 있고 객관적인 출발점을 제공합니다. 이는 어떤 프로그램에 더 많은 주의를 기울여야 하고 어떤 프로그램을 조기에 중단해야 할지 결정하는 데 도움을 줄 수 있으며, 잠재적으로 시간과 비용을 절약하고 이 중요한 연구에 자원하는 환자들의 안녕을 지킬 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.