Clinical trial success prediction from open registry text using classical machine learning
Diese Studie zeigt, dass klassische Modelle des maschinellen Lernens, insbesondere Random Forests, den Erfolg klinischer Studien allein unter Verwendung von Open-Registry-Texten von ClinicalTrials.gov effektiv vorhersagen können, wobei eine moderate bis starke Leistung über verschiedene Studienphasen und Indikationen hinweg erzielt und Datenleckagen durch eine rigorose Vorverarbeitung gemildert werden.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Jedes Jahr investieren Pharmaunternehmen Milliarden von Dollar und Jahrzehnte an Bemühungen in die Entwicklung neuer Medikamente. Der Weg von einer vielversprechenden Idee im Labor bis hin zu einer Pille im Apothekenregal ist lang und von Misserfolgen geprägt. Die meisten Wirkstoffkandidaten schaffen es nie bis zur Zulassung, und wenn sie nach Jahren der Arbeit scheitern, sind die finanziellen Verluste erschütternd. Noch wichtiger ist, dass die Menschen, die sich für diese Studien bereitwillig zur Verfügung stellen, Risiken ausgesetzt sind, ohne den erhofften Nutzen zu erhalten. Da die Ressourcen begrenzt sind, ist jeder Dollar und jede Stunde, die in ein Medikament investiert wird, das letztlich scheitern wird, eine Ressource, die einem Medikament entzogen wird, das vielleicht erfolgreich sein könnte. Die Branche sucht schon lange nach einem Weg, diese zum Scheitern verurteilten Kandidaten frühzeitig zu erkennen – noch bevor zu viel Zeit und Geld investiert werden –, um es Forschern zu ermöglichen, schwache Programme zu stoppen und sich auf die starken zu konzentrieren.
Um dies zu erreichen, versuchen Wissenschaftler, den Ausgang klinischer Studien vorherzusagen, bei denen es sich um die strengen Tests handelt, bei denen neue Behandlungen an Patienten getestet werden. Diese Vorhersagen sind schwierig, da sie ein Verständnis der komplexen menschlichen Biologie, des spezifischen Studiendesigns und des Verhaltens eines neuen Medikaments erfordern. Traditionell haben Experten ihre Erfahrung genutzt, um zu raten, welche Studien erfolgreich sein würden, aber dieser Prozess ist langsam, subjektiv und teuer. In den letzten Jahren haben Forscher das maschinelle Lernen eingesetzt und Computer genutzt, um Muster in Daten zu finden, die Menschen vielleicht übersehen würden. Viele dieser Computermodelle stützen sich jedoch auf private Daten, auf die nur große Unternehmen Zugriff haben, oder sie erfordern komplexe molekulare Informationen, die nicht immer verfügbar sind. Dies lässt kleinere Gruppen und akademische Forscher ohne eine klare Möglichkeit zurück, die Chancen auf den Erfolg einer Studie abzuschätzen.
Eine neue Studie des unabhängigen Forschers Michael Doane untersucht, ob die öffentlichen Aufzeichnungen dieser Studien, die für jeden online einsehbar sind, genügend Informationen enthalten, um diese Vorhersagen zu treffen. Die Studie konzentriert sich auf eine massive Sammlung von Studienaufzeichnungen von der öffentlichen Website ClinicalTrials.gov. Diese Website fungiert als globales Register, in dem Forscher ihre Studien registrieren müssen, bevor sie beginnen, wobei Details über die behandelte Krankheit, das getestete Medikament, die Anzahl der beteiligten Patienten und die Ziele der Forschung veröffentlicht werden. Doanes Arbeit stellt eine einfache Frage: Wenn man die Textbeschreibungen aus diesen öffentlichen Aufzeichnungen in einen Computer einspeist, kann der Computer lernen, zwischen Studien zu unterscheiden, die erfolgreich sein werden und solchen, die scheitern werden?
Um dies zu beantworten, verwendete der Forscher einen Datensatz namens Clinical Trial Outcome Dataset, der für etwa 125.000 vergangene Studien ein Label bereitstellt, das sie basierend auf ihren Endergebnissen entweder als erfolgreich oder erfolglos kennzeichnet. Die Herausforderung bestand darin, ein Modell zu entwickeln, das diese Ergebnisse vorhersagen konnte, indem es ausschließlich den Text verwendete, der zum Zeitpunkt der Registrierung der Studie in dem öffentlichen Register verfügbar war, ohne die endgültigen Ergebnisse vorab zu kennen oder private Unternehmensdaten zu nutzen. Der Forscher musste äußerst vorsichtig sein, um einen häufigen Fehler namens „Data Leakage“ (Datenleck) zu vermeiden, bei dem ein Computermodell versehentlich die Antwort lernt, indem es einen Teil des Textes liest, der nach Abschluss der Studie aktualisiert wurde. Beispielsweise könnte eine Zusammenfassung einer Studie Jahre später umgeschrieben worden sein, um die Endergebnisse einzubeziehen, und wenn der Computer diesen aktualisierten Text liest, sagt er nicht wirklich die Zukunft voraus, sondern liest lediglich die Vergangenheit.
Um dies zu verhindern, bereinigte der Forscher die Daten akribisch und entfernte alle Datensätze, bei denen der Text nach Bekanntwerden des Ergebnisses geändert worden sein könnte. Er schloss zudem spezifische Felder aus, die die Ergebnisse direkt beschrieben. Sobald die Daten sicher waren, trainierte er drei verschiedene Arten von Computermodellen, um nach Mustern im verbleibenden Text zu suchen. Diese Modelle wurden auf Studien aus verschiedenen Entwicklungsstadien getestet, die als Phasen bezeichnet werden. Phase-1-Studien sind die ersten Tests eines Medikaments am Menschen, um die Sicherheit zu prüfen; Phase-2-Studien untersuchen, ob das Medikament tatsächlich wirkt; und Phase-3-Studien sind große Untersuchungen, die die Wirksamkeit und Sicherheit des Medikaments bestätigen, bevor es zugelassen werden kann.
Die Ergebnisse zeigten, dass die Computermodelle tatsächlich nützliche Signale im öffentlichen Text finden konnten. Das leistungsstärkste Modell, das eine Methode namens „Random Forest“ verwendete, konnte zwischen erfolgreichen und gescheiterten Studien besser als durch bloßen Zufall unterscheiden. In der frühesten Testphase, Phase 1, schnitt das Modell sehr gut ab und ordnete die Ergebnisse in etwa 7ak 74 Prozent der Fälle korrekt ein. Das bedeutet, dass man, wenn man eine Gruppe von Phase-1-Studien nimmt, das Modell diejenigen identifizieren kann, die mit einem hohen Grad an Genauigkeit wahrscheinlicher erfolgreich sein werden. Die Leistung war für Phase-2-Studien niedriger, da diese notorisch schwer vorherzusagen sind, weil sie stark davon abhängen, ob das Medikament das richtige biologische Ziel trifft – ein Detail, das in öffentlichen Zusammenfassungen oft fehlt. Dennoch war das Modell auch in dieser Phase besser als der Zufall.
Einer der interessantesten Befunde war, dass das Training des Modells an einer Vielzahl von Krankheiten tatsächlich half, die Ergebnisse für eine spezifische Gruppe von Krankheiten, bekannt als Neurowissenschaften, vorherzusagen. Neurowissenschaftliche Studien, die sich mit Erkrankungen wie Alzheimer oder Depression befassen, hatten historisch gesehen sehr hohe Ausfallraten. Der Forscher fand heraus, dass der Computer besser darin wurde, den Erfolg neurowissenschaftlicher Studien vorherzusagen, wenn er auf Studien aus allen medizinischen Fachbereichen und nicht nur aus den Neurowissenschaften trainiert wurde. Dies deutet darauf hin, dass die allgemeinen Regeln, nach denen eine klinische Studie konzipiert und durchgeführt wird, über verschiedene Arten von Krankheiten hinweg ähnlich sind, und dass das Lernen aus einer breiten Palette von Beispielen dem Computer hilft, die spezifischen Herausforderungen des Nervensystems zu verstehen.
Die Studie testete das Modell auch gegen einen Satz von 7.260 schwierigen Fällen, die von menschlichen Experten manuell überprüft worden waren, um sicherzustellen, dass sie nicht leicht zu erraten waren. Selbst gegenüber diesen schwierigen Beispielen behielt das Modell seine Fähigkeit bei, zwischen Erfolg und Misserfolg zu unterscheiden, was bewies, dass es nicht nur einfache Regeln auswendig lernte, sondern tatsächlich etwas über die Natur klinischer Studien lernte. Der Forscher prüfte auch, ob das Modell auf die Namen der die Studien sponsernden Unternehmen oder die Orte, an denen sie durchgeführt wurden, zurückgriff. Als diese Details entfernt wurden, sank die Leistung des Modells nur geringfügig, was darauf hindeutet, dass der Text, der die Wissenschaft und das Studiendesign beschreibt, den Großteil des prädiktiven Gewichts trug.
Diese Arbeit zeigt, dass öffentliche Informationen, die seit Jahren verfügbar, aber auf diese Weise weitgehend unanalysiert sind, einen erheblichen Wert für die pharmazeutische Industrie besitzen. Die in dieser Studie verwendeten Modelle sind relativ einfach und benötigen keine Supercomputer oder geheime Daten; sie können auf einem Standard-Laptop laufen. Dies macht den Ansatz für akademische Forscher, gemeinnützige Organisationen und kleinere Unternehmen zugänglich, die keinen Zugriff auf proprietäre Datenbanken haben. Indem er einen Weg bietet, die Wahrscheinlichkeit des Erfolgs unter Verwendung offener Daten abzuschätzen, bietet diese Methode ein neues Werkzeug für das Screening von Wirkstoffkandidaten. Sie ersetzt nicht die Notwendigkeit der Expertenurteile oder der komplexen Arbeit der Arzneimittelentwicklung, aber sie bietet einen zuverlässigen, objektiven Ausgangspunkt. Sie kann Teams dabei helfen zu entscheiden, welche Programme mehr Aufmerksamkeit verdienen und welche möglicherweise frühzeitig gestoppt werden sollten, was potenziell Zeit, Geld und das Wohlergehen der Patienten spart, die sich für diese kritischen Studien bereitwillig zur Verfügung stellen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.