← Neueste Arbeiten
🧬 biology

Frequent Hitter Prediction Beyond Classification Models

Diese Studie zeigt, dass die direkte Regression von empirisch Bayes-korrigierten Trefferraten und Multi-Label-Aggregationsstrategien die traditionelle schwellenwertspezifische Binärklassifikation zur Vorhersage häufiger Treffer im Hochdurchsatz-Screening übertrifft, was einen robusteren, cutoff-agnostischen Ansatz bietet, der die frühe Anreicherung und das globale Ranking verbessert.

Ursprüngliche Autoren: Samuli Näppi, Steffen Renner, Jutta Blank, Ansgar Schuffenhauer, Paul Selzer

Veröffentlicht 2026-08-26
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Samuli Näppi, Steffen Renner, Jutta Blank, Ansgar Schuffenhauer, Paul Selzer

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen

In den frühen Phasen der Arzneimittelentdeckung führen Wissenschaftler massive Experimente durch, die als Hochdurchsatz-Screening bezeichnet werden. Stellen Sie sich ein Labor vor, in dem Roboter Hunderttausende winziger chemischer Moleküle gegen biologische Zielstrukturen testen, um nach jedem Anzeichen dafür zu suchen, ob ein Molekül an ein krankheitsverursachendes Protein binden oder einen schädlichen Zellprozess stören könnte. Das Ziel ist es, die seltenen „Hits“ zu finden – Moleküle, die echtes Potenzial als zukünftige Medikamente zeigen. Der Prozess ist jedoch verrauscht. Viele Moleküle lösen Fehlalarme aus. Einige verklumpen auf eine Weise, die den Test blockiert, andere reagieren chemisch mit der Ausrüstung, und einige stören einfach die Art und Weise, wie die Maschine die Ergebnisse liest. Diese Unruhestifterter sind als „Frequent Hitters“ bekannt. Sie erscheinen in Dutzenden oder sogar Hunderten verschiedener Tests als aktiv, nicht weil sie starke Wirkstoffe sind, sondern weil sie chemisch verrauscht sind. Wenn Forscher diese verrauschten Verbindungen nicht von echten Wirkstoffkandidaten unterscheiden können, verschwenden sie Zeit und Geld bei der Verfolgung von Sackgassen. Die Herausforderung besteht darin, ein System zu entwickeln, das diese Frequent Hitter frühzeitig erkennt und das Signal vom Rauschen trennt, bevor teure Experimente beginnen.

Jahrelang war der Standardweg zur Bewältigung dieses Problems darin bestand, eine harte Linie zu ziehen. Wissenschaftler berechneten, wie oft ein Molekül in all seinen Tests als Hit auftrat, und setzten dann einen festen Schwellenwert fest. Wenn die Trefferrate eines Moleküls über dieser Linie lag, wurde es als „Frequent Hitter“ eingestuft und verworfen. Wenn sie darunter lag, wurde es behalten. Dieser Ansatz, obwohl einfach, hat einen erheblichen Mangel. Er behandelt die Entscheidung als ein einfaches Ja oder Nein und wirft wertvolle Informationen über Moleküle weg, die direkt an der Linie liegen. Ein Molekül, das gerade so über dem Schwellenwert liegt, wird exakt genauso behandelt wie ein massiver Übeltäter, während ein Molekül knapp unter dem Schwellenwert als völlig sicher behandelt wird, selbst wenn es gefährlich nah an einem Problem ist. Zudem, wenn ein Labor seine Regeln ändern möchte und strenger oder nachgiebiger sein will, muss es ein völlig neues Computermodell von Grund auf neu erstellen. Diese Starrheit schränkt die Fähigkeit der Wissenschaftler ein, die vielversprechendsten Kandidaten optimal zu priorisieren.

Ein Team von Forschern der Eidgenössischen Technischen Hochschule und der Novartis BioMedical Research beschloss, diesen Prozess neu zu denken. Anstatt jedes Molekül in eine binäre Box zu pressen, fragten sie, ob sie einen kontinuierlichen Score vorhersagen könnten, der die wahre Wahrscheinlichkeit widerspiegelt, dass ein Molekül ein Frequent Hitter ist. Sie entwickelten einen neuen Ansatz unter Verwendung fortschrittlicher Computermodelle, die die Form der Moleküle betrachten, bekannt als Graph Neural Networks. Anstatt diese Modelle darauf zu trainieren, „Ja“ oder „Nein“ zu sagen, trainierten sie sie darauf, einen spezifischen Wert vorherzusagen: eine korrigierte Trefferrate, die berücksichtigt, wie viele Tests ein Molekül tatsächlich durchlaufen hat. Diese Methode, die eine statistische Technik namens empirisches Bayes verwendet, um das Rauschen zu glätten, ermöglicht es dem Modell, das gesamte Spektrum des Risikos zu sehen. Es kann zwischen einem Molekül, das ein klarer Störfaktor ist, einem klaren Erfolg und jenen in der Mitte unterscheiden, die einer genaueren Inspektion bedürfen.

Die Forscher testeten diese neue Methode gegen die alte Methode unter Verwendung zweier massiver Datensammlungen. Ein Datensatz stammte aus einer öffentlichen Datenbank mit über tausend verschiedenen biologischen Tests, und der andere aus der privaten Bibliothek der Screening-Ergebnisse von Novartis. Sie trennten die Daten in Gruppen auf, basierend darauf, ob die Tests in Reagenzgläsern (biochemisch) oder in lebenden Zellen (zellulär) durchgeführt wurden, um sicherzustellen, dass die Computermodelle auf chemischen Strukturen getestet wurden, die sie noch nie zuvor gesehen hatten. Sie verglichen ihre neuen Modelle zur kontinuierlichen Vorhersage mit den traditionellen Modellen, die auf festen Schwellenwerten basieren. Die Ergebnisse zeigten, dass der neue Ansatz überlegen war. Die kontinuierlichen Modelle waren besser darin, Moleküle korrekt zu ranken, insbesondere wenn die Forscher sehr streng sein mussten, um die schlimmsten Übeltäter herauszufiltern. Sie konnten die problematischsten Verbindungen früher in der Liste identifizieren, was entscheidend ist, um Zeit im Labor zu sparen.

Vielleicht am wichtigsten ist, dass die neue Methode viel flexibler erwies. Da das Modell einen kontinuierlichen Score vorhersagt und kein festes Label, können Wissenschaftler ihre Entscheidungsregeln jederzeit anpassen, ohne das Modell neu zu trainieren. Wenn ein Projekt eine sehr hohe Sicherheitsmarge erfordert, können sie einfach die Schwelle für das, was als Problem gilt, anheben. Wenn sie ein breiteres Netz auswerfen müssen, können sie sie senken. Die Studie ergab, dass diese Flexibilität, kombziert mit besserer Genauigkeit, den kontinuierlichen Ansatz zu einem praktischeren Werkzeug für die reale Arzneimittelentdeckung macht. Die Forscher untersuchten auch eine zweite Strategie, bei der das Modell das Ergebnis für jeden spezifischen Test einzeln vorhersagt und diese Vorhersagen dann zu einem einzigen Score kombiniert. Diese Methode schnitt ebenfalls gut ab und bot eine andere Möglichkeit zu verstehen, warum ein Molekül Probleme verursachen könnte.

Die Ergebnisse legen nahe, dass die Zukunft des Screenings darin liegt, sich von starren Schwarz-Weiß-Klassifizierungen hin zu einem nuancierteren Verständnis von Risiko zu bewegen. Indem sie das „Frequent Hitting“ als ein Spektrum statt als eine Kategorie behandeln, bieten diese neuen Modelle einen klareren, zuverlässigeren Weg, um zu priorisieren, welche Moleküle weitere Studien verdienen. Dies bedeutet nicht, dass die alten Methoden nutzlos sind, aber es zeigt, dass sie weniger effizient sind, als sie sein könnten. Die kontinuierlichen Modelle fungieren als robuster Basistyp, der in der Lage ist, die unordentliche Realität chemischer Daten zu handhaben, ohne die subtilen Unterschiede zu verwerfen, die oft am meisten zählen. Da die Arzneimittelentdeckung weiterhin auf massiven Mengen an Daten basiert, wird ein System, das in der Lage ist, sich an wechselnde Bedürfnisse anzupassen und ein detailliertes Risikoprofil für jedes Molekül bereitzustellen, essenziell sein, um die nächste Generation lebensrettender Medikamente zu finden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →