Monroe: A Molecular Foundation Model for In-Context Probabilistic Inference
Dieses Paper stellt Monroe vor, ein skalierbares molekulares Fundamentmodell, das auf 81 Millionen Molekülen mit verbesserten stereochemischen Repräsentationen und neuartigen Trainingszielen trainiert wurde, welches eine State-of-the-Art-Leistung bei der Vorhersage von Bioassay-Aktivitäten erzielt, indem es ein Prior-Data-Fitted-Modell (TabPFN) für die In-Context-probabilistische Inferenz nutzt und demonstriert, dass diese Downstream-Adaptionsstrategie auch bestehende Modelle wie MiniMol und CheMeleon signifikant verbessert.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Im Wettlauf um die Entdeckung neuer Medikamente stehen Wissenschaftler vor einem hartnäckigen Engpass: Der zuverlässigste Weg, um zu wissen, ob ein Molekül eine Krankheit heilen wird, besteht darin, es zu bauen und in einem Labor zu testen. Dieser Prozess ist langsam, teuer und durch die Anzahl der spezialisierten Einrichtungen begrenzt, die diese Experimente durchführen können. Aus diesem Grund sind die für das Training von Computerprogrammen verfügbaren Daten oft spärlich. Um dies zu überwinden, haben Forscher eine Strategie entwickelt, die der Art und Weise ähnelt, wie ein Kind lernt, Tiere zu erkennen, bevor es jemals einen spezifischen Hund oder eine spezifische Katze gesehen hat. Sie trainieren massive Computermodelle mit riesigen Bibliotheken chemischer Strukturen und deren grundlegenden physikalischen Eigenschaften, wodurch die Software ein allgemeines Verständnis dafür erhält, wie sich Moleküle verhalten. Sobald dieses Fundament gebaut ist, kann das Modell an spezifische biologische Ergebnisse angepasst werden, wie etwa die Frage, ob eine Verbindung an ein Virus bindet, selbst wenn nur eine Handvoll experimenteller Ergebnisse für diese spezifische Aufgabe vorliegt. Dieser Ansatz, bekannt als molekulares Fundamentmodell, zielt darauf ab, die Lücke zwischen der unendlichen Welt möglicher Chemikalien und den begrenzten Daten realer Arzneimitteltests zu schließen.
Ein Forschungsteam hat ein neues Modell namens Monroe vorgestellt, das einen bedeutenden Schritt vorwärts auf diesem Gebiet darstellt. Der Name ehrt Elizabeth Monroe Boggs, eine Pionierin der Computerchemie, aber das Modell selbst ist ein modernes System des maschinellen Lernens, das darauf ausgelegt ist, die komplexe Sprache der Moleküle zu verstehen. Die Forscher trainierten Monroe auf einem massiven Datensatz, der über 81 Millionen Moleküle umfasst – eine Größenordnung, die weit über früheren Versuchen liegt. Dieser Datensatz enthielt detaillierte quantenchemische Berechnungen, die Energie und Struktur von Atomen beschreiben, sowie Daten aus tausenden von biologischen Assays, die messen, wie Moleküle mit lebenden Systemen interagieren. Durch die Konfrontation des Modells mit dieser immensen Vielfalt an Informationen ermöglichten die Forscher ihm, allgemeine chemische Regeln zu erlernen, die für verschiedene Arten von Problemen gelten, anstatt lediglich spezifische Beispiele auswendig zu lernen.
Eine der kritischsten Innovationen in Monroe ist die Art und Weise, wie es mit der dreidimensionalen Form von Molekülen umgeht, insbesondere deren „Händigkeit“. Viele Moleküle existieren in zwei Formen, die Spiegelbilder voneinander sind, ähnlich wie eine linke und eine rechte Hand. Obwohl diese Spiegelbilder dieselben Atome in derselben Reihenfolge besitzen, verhalten sie sich im menschlichen Körper oft völlig unterschiedlich; eines kann ein Medikament sein, während sein Spiegelbild toxisch sein könnte. Standard-Computermodelle haben oft Schwierigkeiten, diese Versionen zu unterscheiden, da sie auf mathematischen Beschreibungen beruhen, die für beide Formen identisch aussehen. Monroe löst dies, indem es explizit zusätzliche Verbindungen in seiner internen Karte des Moleküls hinzufügt, die als Markierungen für diese Spiegelbild-Unterschiede fungieren. Dies ermöglicht es dem Modell, zwischen den beiden Formen mit hoher Genauigkeit zu unterscheiden – eine Fähigkeit, die essenziell ist, um vorherzusagen, wie ein Medikament tatsächlich in einem biologischen System wirkt.
Die Forscher verfeinerten auch die Art und Weise, wie das Modell aus seinen Trainingsdaten lernt. Anstatt jede Lernaufgabe als gleich wichtig zu behandeln, nutzt Monroe ein intelligentes Gewichtungssystem, das seinen Fokus automatisch anpasst. Es schenkt Aufgaben, bei denen die Daten klar und zuverlässig sind, mehr Aufmerksamkeit und Aufgaben, die verrauscht oder unsicher sind, weniger Aufmerksamkeit. Darüber hinaus ist das Modell darauf trainiert, unvollkommene Daten zu bereinigen. In der realen Welt sind die 3D-Formen von Molekülen, die in Computersimulationen verwendet werden, oft grobe Annäherungen. Monroe wird beigebracht, diese groben Formen in genauere, stabilere Formen zu überführen – ein Prozess, der dem Modell hilft, die zugrunde liegenden physikalischen Regeln der molekularen Stabilität zu verstehen. Diese Fähigkeit, die Daten zu „entrauschen“, stärkt seine Vorhersagen für reale Anwendungen.
Beim Testen gegen andere führende Modelle demonstrierte Monroe eine überlegene Leistung, insbesondere in den als „Aktivitätsklippen“ (activity cliffs) bekannten, schwierigsten Szenarien. Dies sind Fälle, in denen zwei Moleküle in ihrer Struktur fast identisch sind, aber drastisch unterschiedliche biologische Wirkungen haben. Das Vorhersagen dieser scharfen Unterschiede ist für künstliche Intelligenz notorisch schwierig, doch Monroe übertraf seine Konkurrenten in diesen Tests. Die Forscher fanden auch heraus, dass ihre Methode, das Modell an neue Aufgaben anzupassen, äußerst effektiv war. Anstatt das gesamte Modell für jedes neue Zielprotein neu zu trainieren, verwendeten sie eine Technik, die es dem Modell ermöglicht, aus einer kleinen Menge von Beispielen in einem einzigen Schritt zu lernen – ähnlich wie ein Mensch nach nur wenigen Beispielen eine neue Regel lernen kann. Dieser Ansatz, den sie nicht nur auf Monroe, sondern auch zur Verbesserung zweier anderer bestehender Modelle anwandten, erwies sich als eine leistungsstarke und allgemeine Strategie.
Die Studie kommt zu dem Schluss, dass die Kombination aus groß angelegtem Pre-Training und spezifischen architektonischen Verbesserungen, wie der besseren Handhabung der molekularen Händigkeit und der intelligenten Datengewichtung, ein robusteres Werkzeug für die Arzneimittelentdeckung schafft. Obwohl das Modell nicht jedes Problem der molekularen Vorhersage löst und die Herausforderung der Aktivitätsklippen weiterhin schwierig bleibt, setzt Monroe einen neuen Standard für das Mögliche. Es zeigt, dass wir durch die Vermittlung eines tieferen, nuancierteren Verständnisses der chemischen Struktur und des Verhaltens an Computer Werkzeuge bauen können, die besser gerüstet sind, um sich in der riesigen und komplexen Landschaft potenzieller Medikamente zu bewegen, was den Weg von einer chemischen Idee zu einer lebensrettenden Behandlung potenziell beschleunigen kann.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.