BOOM: Benchmarking Out-Of-distribution Molecular Property Predictions of Machine Learning Models
Dieses Paper stellt BOOM vor, den ersten chemisch informierten Open-Source-Benchmark zur systematischen Evaluierung der Out-of-Distribution (OOD)-Generalisierung in der molekularen Eigenschaftsvorhersage, wobei aufgezeigt wird, dass aktuelle maschinelle Lernmodelle Schwierigkeiten haben, über ihre Trainingsdaten hinaus zu extrapolieren, und die Notwendigkeit neuer Ansätze hervorgehoben wird, um eine robuste OOD-Leistung zu erreichen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Die Suche nach neuen Medikamenten und Materialien beginnt oft mit einer einfachen, einschüchternden Frage: Welche der Milliarden möglichen chemischen Strukturen werden tatsächlich funktionieren? Jahrzehntelang haben sich Wissenschaftler auf Versuch und Irrtum verlassen, doch eine neue Welle der künstlichen Intelligenz verspricht, dies zu beschleunigen, indem sie vorhersagt, wie ein Molekül sich verhalten wird, noch bevor es überhaupt gebaut wird. Diese Computermodelle werden mit riesigen Bibliotheken bekannter Chemikalien trainiert und lernen, Muster zu erkennen, die die Form eines Moleküls mit seinen Eigenschaften verknüpfen, etwa wie gut es sich in Wasser löst oder wie viel Energie es beim Verbrennen freisetzt. Die Hoffnung ist, dass diese Modelle dann ein völlig neues, unbekanntes Molekül betrachten und dessen Verhalten präzise erraten können, was es Forschern effektiv ermöglicht, die Zukunft der Chemie auf einem Computerbildschirm zu entwerfen.
Es gibt jedoch einen bedeutenden Haken. Die meisten dieser KI-Modelle sind exzellent darin, Muster innerhalb der Daten zu erkennen, mit denen sie trainiert wurden, aber sie stolpern oft, wenn sie gebeten werden, die Eigenschaften von Molekülen vorherzusagen, die sich grundlegend von allem in ihrer Trainingsbibliothek unterscheiden. In der Welt des maschinellen Lernens ist dies als das „Out-of-Distribution“-Problem bekannt. Es ist der Unterschied zwischen einem Schüler, der die Antworten auf eine Übungsprüfung auswendig lernt, und einem, der tatsächlich ein neues, unerwartetes Problem lösen kann. Wenn ein Modell nicht über seine Trainingsdaten hinaus generalisieren kann, wird es zu einem Werkzeug, das bestätigt, was wir bereits wissen, anstatt zu einem Werkzeug, das das Unbekannte entdeckt. Diese Einschränkung ist ein großer Engpass für die nächste Generation der Wirkstoffforschung und Materialwissenschaft, in denen das Ziel darin besteht, Moleküle zu finden, die die Grenzen dessen verschieben, was derzeit möglich ist.
Ein Team von Forschern des Lawrence Livermore National Laboratory und der Binghamton University hat sich diesem Problem mit einem neuen Benchmark namens BOOM intensiv gestellt. Anstatt nur zu testen, wie gut Modelle bei vertrauten Daten abschneiden, entwarfen sie eine strenge Testreihe, um speziell zu prüfen, ob diese Systeme der künstlichen Intelligenz mit dem Unbekannten umgehen können. Sie sammelten zehn verschiedene Datensätze, die Tausende von Molekülen enthalten – von kleinen organischen Verbindungen bis hin zu komplexen Strukturen mit spezifischen elektronischen Eigenschaften. Für jeden Datensatz trennten sie die Moleküle sorgfältig in drei Gruppen: einen Trainingsdatensatz, einen Standard-Testdatensatz mit vertrauten Molekülen und einen speziellen „Out-of-Distribution“-Testdatensatz. Diese spezielle Gruppe bestand aus Molekülen mit extremen Eigenschaften – Werten, die so hoch oder so niedrig sind, dass sie in den Trainingsdaten selten vorkommen. Die Forscher unterzogen dann fünfzehn verschiedene Modelle des maschinellen Lernens einem Test und baten jedes einzelne darum, die Eigenschaften dieser extremen Moleküle vorherzusagen.
Die Ergebnisse waren ernüchternd. Trotz der beeindruckenden Fähigkeiten moderner künstlicher Intelligenz zeigte die Studie, dass kein einzelnes Modell in der Lage war, die Eigenschaften dieser extremen Moleküle über alle Aufgaben hinweg konsistent vorherzusagen. Selbst die leistungsstärksten Modelle machten bei diesen schwierigen, unbekannten Fällen Fehler, die drei Mal größer waren als ihre Fehler bei vertrauten Daten. Die Forscher beobachteten einen häufigen Fehlermodus: Die Modelle waren gut darin, ähnliche Moleküle zusammenzugruppieren, aber sie scheiterten daran, ihre Vorhersagen in das unbekannte Territorium zu erweitern. Anstatt einen Wert zu raten, der tatsächlich außerhalb des Bereichs dessen lag, was sie gesehen hatten, neigten die Modelle dazu, ihre Vorhersagen zu komprimieren und extreme Werte wieder in Richtung des Durchschnitts zu ziehen. Dieses Verhalten deutet darauf hin, dass die Modelle Abkürzungen lernen, die bei Standarddaten gut funktionieren, aber zusammenbrechen, wenn sie mit der wahren Neuartigkeit konfrontiert werden, die für die wissenschaftliche Entdeckung erforderlich ist.
Das Team untersuchte auch, warum diese Modelle Schwierigkeiten hatten, und testete mehrere gängige Strategien zur Behebung des Problems. Sie prüften, ob das Vortrainieren von Modellen auf massiven Datensätzen von Milliarden von Molekülen – eine Technik, die Sprachmodelle revolutioniert hat – helfen würde. Überraschenderweise stellten sie fest, dass dieses Vortraining die Modelle zwar besser im Umgang mit vertrauten Daten machte, ihre Fähigkeit zur Vorhersage extremer Werte jedoch nicht verbesserte. Tatsächlich machte das Vortraining die Out-of-Distribution-Leistung für einige Modelle sogar schlechter. Sie testeten auch, ob es helfen würde, einfach mehr Daten zum Trainingssatz hinzuzufügen. Während die Aufnahme einer kleinen Anzahl extremer Beispiele die Leistung für einige Eigenschaften verbesserte, war dies keine universelle Lösung. Die Studie legt nahe, dass die Art und Weise, wie diese Modelle derzeit aufgebaut sind – insbesondere ihre Abhängigkeit von textbasierten Repräsentationen von Molekülen –, ihre Fähigkeit, die tiefen physikalischen Gesetze zu verstehen, die das chemische Verhalten steuern, fundamental einschränken könnte.
Eines der aufschlussreichsten Ergebnisse war, dass die Art der Datendarstellung wichtiger war als die Größe des Modells. Modelle, die dreidimensionale geometrische Informationen über die Atome und deren Positionen verwendeten, schnitten signifikant besser ab als jene, die sich auf lineare Textzeichenfolgen stützten, welche wie in einer Sequenz aufgeschriebene chemische Namen sind. Die dreidimensionalen Modelle, welche die physikalischen Symmetrien des Raums respektieren, konnten wesentlich besser auf die extremen Fälle generalisieren. Dies weist auf einen klaren Weg in die Zukunft hin: Um eine KI zu bauen, die wirklich neue Chemie entdecken kann, müssen die Modelle in der physikalischen Realität verankert sein, wie Atome sich bewegen und interagieren, anstatt nur in den Mustern, wie sie in Text beschrieben werden. Die Forscher kamen zu dem Schluss, dass das Erreichen einer starken Leistung bei diesen schwierigen Aufgaben wahrscheinlich eine Kombination aus größeren, vielfältigeren Datensätzen und Modellen erfordern wird, die die Elektronenstruktur von Molekülen explizit verstehen.
Der BOOM-Benchmark dient als Realitätscheck für das Fachgebiet und zeigt, dass die aktuelle Generation der chemischen KI, obwohl leistungsstark, noch nicht bereit ist, das Unbekannte zuverlässig zu navigieren. Die Studie behauptet nicht, dass das Problem unlösbar sei, aber sie widerlegt die Vorstellung, dass die bloße Skalierung bestehender Modelle oder die Verwendung standardmäßiger Vortrainingstechniken ausreichen wird. Stattdessen hebt sie hervor, dass die nächste Grenze des maschinellen Lernens in der Chemie einen Wandel in der Art und Weise erfordert, wie diese Systeme entworfen werden. Durch die Bereitstellung einer standardisierten Methode, um diese spezifische Schwäche zu testen, hoffen die Forscher, die Gemeinschaft in Richtung der Entwicklung von Modellen zu leiten, die nicht nur gut darin sind, die Vergangenheit zu erinnern, sondern wirklich in der Lage sind, die Zukunft zu imaginieren. Der Weg zur Entdeckung der nächsten Generation lebensrettender Medikamente und fortschrittlicher Materialien könnte von der Lösung dieses spezifischen Rätsels der Generalisierung abhängen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.