Two Comparators May Be All We Need
Diese Arbeit stellt zwei strukturfreie maschinelle Lernmodelle vor, die durch den Vergleich chemischer Strukturen und Proteinsequenzen paarweise Präferenzen zwischen Verbindungen und Targets präzise vorhersagen und dabei eine hohe Genauigkeit bei der Rangfolge erzielen, ohne dass eine Konformationsanalyse oder Proteinstrukturdaten erforderlich sind.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Innerhalb einer lebenden Zelle trifft ein Wirkstoffmolekül nicht nur auf ein einziges Ziel. Es treibt durch eine überfüllte Umgebung, in der es auf ein breites Spektrum von Proteinen stößt, von denen viele verschiedenen Familien angehören. Die letztendliche Wirkung des Moleküls ist die Summe all dieser Interaktionen, nicht nur seine Bindung an das beabsichtigte Ziel. Jahrzehntelang war die Standardmethode zur Untersuchung dieser Interaktionen, eine einzige Frage auf einmal zu stellen: Bindet dieser spezifische Wirkstoff an dieses spezifische Protein? Forscher haben Modelle entwickelt, um diese einzelne Interaktion vorherzusagen, doch die Realität der Arzneimittelentwicklung ist selten so isoliert. Wissenschaftler stehen oft vor zwei praktischen, vergleichenden Fragen, die ihre Entscheidungen leiten: Welches von zwei potenziellen Zielen wird ein neuer Wirkstoffkandidat angesichts seiner Eigenschaften wahrscheinlicher binden? Und umgekehrt: Welcher von zwei Wirkstoffkandidaten passt besser zu einem bestimmten Zielprotein? Die Beantwortung dieser Fragen hilft Forschern zu entscheiden, welche Verbindungen sie als Nächstes synthetisieren sollten und nach welchen unerwünschten Nebenwirkungen sie frühzeitig suchen müssen, noch lange bevor ein Medikament die klinische Phase erreicht.
Ein Forschungsteam hat nun zwei Computermodelle entwickelt, die speziell darauf ausgelegt sind, diese vergleichenden Fragen zu beantworten. Anstatt zu versuchen, eine präzise Bindungsstärke für ein einzelnes Wirkstoff-Protein-Paar zu berechnen, betrachten die Modelle zwei Elemente gleichzeitig und wählen einfach einen Gewinner aus. Ein Modell nimmt einen Wirkstoff und zwei verschiedene Proteine und sagt voraus, welches Protein der Wirkstoff bevorzugt. Das andere Modell nimmt ein Protein und zwei verschiedene Wirkstoffe und sagt voraus, welchen Wirkstoff das Protein bevorzugt. Diese Modelle wurden mit einer massiven öffentlichen Datenbank trainiert, die über 1,2 Millionen Messwerte umfasst, welche fast 800.000 einzigartige Wirkstoffmoleküle und über 2.700 menschliche Proteine beinhalten. Entscheidend ist, dass die Modelle nicht auf der dreidimensionalen Form der Proteine oder der Wirkstoffmoleküle basieren. Sie müssen nicht die exakte Struktur der Bindungstasche kennen oder simulieren, wie sich die Moleküle drehen und wenden könnten, um zusammenzupassen. Stattdessen arbeiten sie mit der rohen Aminosäuresequenz, aus der die Proteine bestehen, und einer zweidimensionalen Karte der chemischen Struktur der Wirkstoffe.
Die Ergebnisse zeigen, dass dieser direkte Vergleichsansatz mit überraschender Genauigkeit funktioniert. Wenn das Modell zwischen zwei Proteinen aus verschiedenen Familien wählen sollte, traf es die Wahl des bevorzugten Ziels in etwa 75 Prozent der Fälle. Wenn die beiden Proteine derselben Familie angehörten, stieg die Genauigkeit auf 78 Prozent. Bei der umgekehrten Frage – der Wahl zwischen zwei Wirkstoffen für ein einzelnes Ziel – lag die Genauigkeit bei 71 Prozent. Die Forscher fanden heraus, dass das Vertrauen des Modells ein zuverlässiger Leitfaden ist. Wenn sich das Modell seiner Entscheidung sehr sicher ist, steigt seine Genauigkeit auf über 90 Prozent. Wenn die beiden Optionen jedoch in ihrer gemessenen Aktivität sehr ähnlich sind, sinkt die Fähigkeit des Modells, zwischen ihnen zu unterscheiden, was widerspiegelt, dass die experimentellen Daten selbst in diesen Fällen schwerer voneinander abgrenzbar sind. Die Modelle wurden mit Wirkstoffmolekülen getestet, die das Modell zuvor noch nie gesehen hatte, was sicherstellte, dass die Ergebnisse nicht bloß ein Gedächtnis vergangener Daten waren, sondern eine echte Fähigkeit zur Generalisierung darstellten.
Eine zentrale Erkenntnis dieser Arbeit ist, dass die Genauigkeit dieser Vorhersagen stark von den in der wissenschaftlichen Fachliteratur verfügbaren Daten abhängt und nicht nur von der Raffinesse des Computer-Algorithmus. Damit das Modell zwei verschiedene Proteinfamilien vergleichen kann, muss es einen Wirkstoff gesehen haben, der gegen beide getestet wurde. Die Forscher entdeckten, dass nur etwa 4,6 Prozent der Wirkstoffmoleküle in ihrer Datenbank über Messungen in zwei verschiedenen Proteinfamilien verfügten. Diese Knappheit an datenübergreifenden Familien-Datensätzen setzt eine natürliche Grenze für die Leistungsfähigkeit des Modells beim Vergleich entfernter Ziele. Im Gegensatz dazu sind die Daten innerhalb einer einzelnen Proteinfamilie viel reicher, was mehr Vergleiche ermöglicht. Die Modelle sind nicht darauf ausgelegt, die exakte Stärke einer Bindung vorherzusagen oder physische Experimente zu ersetzen. Stattdessen dienen sie als leistungsstarkes Sortierwerkzeug, das Forschern hilft, zu priorisieren, welche Experimente sie zuerst durchführen sollten. Indem sie Ziele und Verbindungen basierend auf Präferenzen statt auf absoluten Werten ordnen, bieten diese Werkzeuge eine Möglichkeit, die komplexe Landschaft der Wirkstoffinteraktionen zu navigieren, ohne die detaillierte dreidimensionale Architektur jedes beteiligten Proteins kennen zu müssen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.