Development and Evaluation of Target-Specific Machine-Learning Scoring Functions for Monoamine Oxidase B
Diese Studie zeigt, dass, während zielspezifische maschinelle Lern-Scoring-Funktionen für MAO-B, insbesondere auf kombinierten Merkmalen basierende, fein abgestimmte Regressionsmodelle, generische Scoring-Funktionen auf unabhängigen Testdatensätzen signifikant übertreffen, ihre Früherkennungsleistung stark von der strukturellen Ähnlichkeit zu bekannten Aktiva beeinflusst wird, was die kritische Notwendigkeit eines rigorosen Benchmark-Designs und einer prospektiven Validierung unterstreicht, um die Generalisierung auf neuartige chemische Räume zu gewährleisten.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Auf der Suche nach neuen Medikamenten stehen Wissenschaftler oft vor einem Problem der Skalierung. Sie besitzen Bibliotheken mit Millionen chemischer Verbindungen, müssen jedoch jene Handvoll finden, die an ein spezifisches krankheitsverursachendes Protein binden und dessen Funktion stoppen könnten. Um dies zu lösen, nutzen Forscher Computersimulationen, um vorherzusagen, welche Moleküle effektiv binden werden – ein Prozess, der als virtuelles Screening bekannt ist. Das Herzstück dieses Prozesses ist eine Scoring-Funktion, ein mathematisches Werkzeug, das wie ein Richter fungiert, indem es die Millionen von Kandidaten bewertet, um zu entscheiden, welche wenigen für Tests im echten Labor wert sind. Jahrzehntelang haben sich diese Richter auf vereinfachte Regeln verlassen, um zu schätzen, wie gut ein Wirkstoff in sein Ziel passt. Diese Regeln übersehen jedoch oft die komplexen, subtilen Arten, wie Moleküle interagieren, was zu einem Plateau der Genauigkeit führt, an dem Computer Schwierigkeiten haben, einen echten Wirkstoffkandidaten von einer chemischen Sackgasse zu unterscheiden.
Um dies zu überwinden, haben sich Wissenschaftler dem maschinellen Lernen zugewandt und bringen Computern bei, die Regeln der Bindung direkt aus riesigen Mengen bestehender Daten zu lernen, anstatt sich auf vorgeschriebene Formeln zu verlassen. Obwohl diese neuen digitalen Richter vielversprechend sind, ist ihre Leistung inkonsistent; sie erscheinen oft brillant in kontrollierten Tests, scheitern aber, wenn sie mit der Komplexität der realen Welt konfrontiert werden. Eine kritische Frage bleibt bestehen: Verstehen diese Modelle des maschinellen Lernens wirklich, wie ein Wirkstoff an ein Protein bindet, oder merken sie sich einfach nur Muster in den Testdaten, die die Realität nicht widerspiegeln? Diese Unsicherheit ist besonders wichtig für Ziele wie Monoaminooxidase B, ein Enzym im Gehirn, das mit Parkinson in Verbindung gebracht wird, bei dem das Finden besserer Inhibitoren zu verbesserten Behandlungen führen könnte.
Eine aktuelle Studie konzentrierte sich auf dieses spezifische Enzym, Monoaminooxidase B, um eine neue Generation von maschinellen Lernrichtern aufzubauen und zu testen. Die Forscher begannen damit, einen Mangel in der Art und Weise anzuerkennen, wie diese Modelle normalerweise getestet werden. Standardtests verwenden oft „Decoys“ (Lockmittel), also gefälschte inaktive Moleküle, die wie echte Wirkstoffe aussehen, aber nicht die Fähigkeit zur Bindung besitzen. Die Studie fand heraus, dass diese Modelle, wenn sie gegen diese Decoys getestet wurden, außergewöhnlich gut abschnitten und den Anschein erweckten, aktive Wirkstoffe mit hoher Genauigkeit zu identifizieren. Als die Forscher jedoch zu einem strengeren Testdatensatz wechselten, der ausschließlich aus echten, experimentell bestätigten inaktiven Verbindungen bestand, brach die Leistung der Standardmodelle zusammen. Das beste generische Modell, das zuvor scheinbar fast 80 % der Top-Kandidaten korrekt gefunden hatte, sank auf ein Niveau ab, das kaum besser als reines Raten war. Dieser dramatische Abfall offenbarte, dass die früheren hohen Werte eine Illusion waren, die durch das spezifische Design der Testdaten erzeugt wurde, und kein Zeichen für echtes Verständnis.
Unbeirrt von diesem Ergebnis entwickelten die Team ein maßgeschneidertes Modell des maschinellen Lernens, das speziell auf Daten von Monoaminooxidase B trainiert wurde. Sie fütterten den Computer mit tausenden bekannten aktiven Wirkstoffen und einer massiven Anzahl inaktiver Decoys, um ihn darauf zu trainieren, die spezifischen Interaktionsmuster zwischen dem Protein und den Molekülen zu erkennen. Die Forscher testeten verschiedene Ansätze, um zu sehen, welcher am besten funktionieren würde. Sie verglichen Modelle, die Moleküle einfach als aktiv oder inaktiv klassifizierten, mit Modellen, die versuchten, die exakte Bindungsstärke vorherzusagen. Sie testeten auch, ob das Hinzufügen einer Beschreibung der chemischen Form des Moleküls neben der Beschreibung, wie es das Protein berührt, hilfreich wäre. Die Ergebnisse waren eindeutig: Modelle, die die Bindungsstärke vorhersagten, schnitten konsistent besser ab als jene, die nur eine einfache Ja-oder-Nein-Klassifizierung vornahmen. Darüber hinaus führte die Kombination der Beschreibung der Molekülform mit den Details seiner Interaktion mit dem Protein zu den genauesten Vorhersagen.
Das erfolgreichste Modell, eine hochgradig optimierte Version eines Algorithmus des maschinellen Lernens, identifizierte aktive Wirkstoffe mit einer dreimal höheren Rate als die besten generischen Modelle, wenn es gegen den strengen Satz echter inaktiver Verbindungen getestet wurde. Dieser Erfolg war jedoch mit einer bedeutenden Einschränkung verbunden. Als die Forscher die Moleküle analysierten, die dieses leistungsstärkste Modell fand, entdeckten sie, dass es weitgehend Verbindungen abrief, die den aktiven Wirkstoffen, die es bereits während des Trainings gesehen hatte, sehr ähnlich sahen. Das Modell war exzellent darin, chemische Verwandte bekannter Wirkstoffe zu erkennen, hatte aber Schwierigkeiten, völlig neue Arten von Molekülen zu finden, mit denen der Computer zuvor noch nie konfrontiert worden war. Dies deutet darauf darauf hin, dass das maßgeschneiderte Modell zwar ein mächtiges Werkzeug ist, um Variationen bestehender Behandlungen zu finden, aber noch nicht die Fähigkeit besitzt, auf völlig neue chemische Gebiete zu generalisieren.
Die Studie kommt zu dem Schluss, dass der Weg nach vorn in der Arzneimittelentwicklung eine strengere Prüfung erfordert. Der scheinbare Erfolg vieler Werkzeuge des maschinellen Lernens in der Vergangenheit mag durch die Verwendung einfacher Testsets aufgebläht worden sein, die nicht die Schwierigkeit realer Screenings widerspiegeln. Um wirklich zuverlässige Werkzeuge aufzubauen, muss die zukünftige Forschung Testsets aus echten inaktiven Verbindungen verwenden und sorgfältig zwischen einem Modell, das gelernt hat, spezifische chemische Formen zu erkennen, und einem, das die grundlegenden Regeln gelernt hat, wie Wirkstoffe an Proteine binden, unterscheiden. Für Monoaminooxidase B, und wahrscheinlich auch für viele andere Zielstrukturen, besteht die effektivste Strategie darin, maßgeschneiderte Modelle zu verwenden, die strukturelle Details mit chemischen Beschreibungen kombinieren, während man sich bewusst bleibt, dass diese Modelle derzeit am besten darin sind, das zu finden, was sie bereits kennen, anstatt das Unbekannte zu entdecken.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.