← Neueste Arbeiten
🧬 biology

Transformers Discover Molecular Structure Without Graph Priors

Diese Arbeit zeigt, dass allgemeine Transformer-Modelle, wenn sie ohne explizite graphbasierte physikalische Priors trainiert werden, in der Lage sind, wichtige Molekülstrukturen und Interaktionsmuster autonom allein aus Daten zu entdecken, wobei sie eine Genauigkeit erreichen, die mit physikbasierten Architekturen konkurriert, was darauf hindeutet, dass solche induktiven Biases erlernbar und nicht strikt notwendig sein können.

Ursprüngliche Autoren: Tobias Kreiman, Yutong Bai, Fadi Atieh, Elizabeth Weaver, Eric Qu, Aditi S. Krishnapriyan

Veröffentlicht 2026-09-21
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Tobias Kreiman, Yutong Bai, Fadi Atieh, Elizabeth Weaver, Eric Qu, Aditi S. Krishnapriyan

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ⚕️ Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen

Wissenschaftler verlassen sich seit langem auf Computersimulationen, um zu verstehen, wie die physische Welt funktioniert – von der Art und Weise, wie Atome binden, um Moleküle zu bilden, bis hin zu der Frage, wie Materialien unter Belastung reagieren. Traditionell werden diese Simulationen dadurch aufgebaut, dass die bekannten physikalischen Gesetze direkt in die Software hinein programmiert werden. Dieser Ansatz stellt sicher, dass die Ergebnisse Sinn ergeben, ist jedoch oft langsam und teuer. In den letzten Jahren ist eine andere Methode entstanden: die Nutzung von maschinellem Lernen, um Muster in Daten zu finden, anstatt vorgegebene Regeln zu befolgen. Während dieser datengesteuerte Ansatz Felder wie die Sprach- und Bilderkennung revolutioniert hat, wurde seine Anwendung auf die Physik mit Vorsicht betrachtet. Viele Experten glaubten, dass eine Maschine ohne die explizite Vermittlung von Regeln über Geometrie und Kräfte scheitern würde, die komplexe Dynamik der Atome zu verstehen. Die vorherrschende Meinung war, dass ein Modell des maschinellen Lernens eine eingebaute Karte darüber benötigt, wie Atome interagieren, um zuverlässige Ergebnisse zu liefern.

Ein Forscherteam der University of California, Berkeley, und des Lawrence Berkeley National Laboratory ging die Frage an, die Grenzen dieser Annahme zu testen. Sie stellten eine fundamentale Frage: Wenn man einem leistungsstarken Computermodell eine riesige Menge an Daten über Moleküle gibt, es ihm aber verbietet, vorgeprogrammierte Regeln über die Physik zu verwenden, kann es dann dennoch selbstständig herausfinden, wie die physische Welt funktioniert? Um die Antwort zu finden, trainierten sie einen Typus künstlicher Intelligenz, bekannt als Transformer, auf einem gewaltigen Datensatz molekularer Strukturen. Dieser Datensatz, genannt OMol25, enthält Millionen von Beispielen für Atome, die in verschiedenen Konfigurationen angeordnet sind, zusammen mit der Energie und den Kräften, die mit jeder Anordnung verbunden sind. Entscheidend war, dass die Forscher dem Modell keine speziellen Anweisungen darüber gaben, wie sich Atome verhalten sollten, und es auch nicht dazu zwangen, Atome in einer bestimmten geometrischen Reihenfolge zu betrachten. Sie fütterten es einfach mit Rohkoordinaten und ließen es lernen.

Die Ergebnisse waren verblüffend. Das Modell, das ohne jegliches Wissen über Physik startete, entdeckte autonom genau jene Muster, die Wissenschaftler Jahrzehnte lang versucht hatten, von Hand zu kodieren. Während das Modell die Daten verarbeitete, lernte es, den verschiedenen Beziehungen zwischen Atomen basierend auf deren Abstand zueinander unterschiedliche Wichtigkeiten zuzuweisen. In der frühen Phase seines Lernprozesses konzentrierte sich das Modell intensiv auf nahegelegene Atome, wobei seine Aufmerksamkeit mit zunehmender Distanz drastisch abfiel. Dieses Verhalten spiegelte die Art und Weise wider, wie physikalische Kräfte, wie etwa die elektrostatische Abstoßung, über kurze Distanzen rapide abnehmen. Als das Modell tiefer und komplexer wurde, weitete es seinen Fokus auf die Wechselwirkungen über längere Distanzen aus und erlernte schließlich ein Muster, das mit der Art und Weise übereinstimmte, wie Energie über die Distanz in der klassischen Physik abnimmt. Bemerkenswerterweise fand das Modell sogar eine natürliche Grenze für die Distanz, über die es blicken musste, um die Umgebung eines Atoms zu verstehen – einen Grenzabstand, der perfekt mit den Werten übereinstimmte, die menschliche Experten manuell für traditionelle Modelle ausgewählt hatten.

Die Forscher beobachteten auch, dass das Modell in seinem Ansatz nicht starr war. Anstatt eine feste Regel dafür zu nutzen, wie weit es um ein Atom herum blicken sollte, passte es sein Verhalten basierend auf der Dichte des umgebenden Raums an. In überfüllten Bereichen, in denen Atome dicht gepackt waren, konzentrierte sich das Modell auf die unmittelbaren Nachbarn. In spärlich besiedelten Bereichen, in denen Atome isoliert waren, weitete es seinen Fokus aus, um auch entfernte Partner einzubeziehen. Diese Flexibilität ermöglichte es dem Modell, verschiedene molekulare Umgebungen effektiver zu handhaben als ein starres, vorprogrammiertes System. Darüber hinaus lernte das Modell, chemische Elemente so zu organisieren, dass dies das Periodensystem widerspiegelte, indem es Edelgase zusammen gruppierte und Metalle nach ihren chemischen Familien ordnete – und das alles, ohne jemals erfahren zu haben, was ein Periodensystem ist.

Um sicherzustellen, dass diese Ergebnisse nicht nur ein Zufallsprodukt des spezifischen Datensatzes waren, testete das Team die Fähigkeit des Modells zur Skalierung. Sie fanden heraus, dass sich die Leistung des Modells in einer vorhersehbaren und konsistenten Weise verbesserte, wenn sie die Menge der Daten und die Größe des Modells erhöhten. Dieses Verhalten, bekannt als Skalierungsgesetz (Scaling Law), ist ein Kennzeichen leistungsstarker Systeme des maschinellen Lernens und deutet darauf hin, dass das Verständnis des Modells für die Physik echt und robust war. In Tests, bei denen das Modell aufgefordert wurde, die Energie von Wassermolekülen vorherzusagen, lieferte es Ergebnisse, die sowohl hochgradig komplexe Physiksimulationen als auch reale experimentelle Messungen erreichten. Noch überraschender war, dass das Modell, als die Forscher eine sehr große Version davon trainierten, eine Genauigkeit erreichte, die mit spezialisierten Modellen vergleichbar war, die explizit mit eingebauten physikalischen Gesetzen in ihrer Architektur entworft wurden.

Diese Ergebnisse legen nahe, dass die Grenze zwischen menschengemachten Regeln und gelerntem Wissen fließender ist als bisher angenommen. Die Studie zeigt auf, dass allgemeine Modelle des maschinellen Lernens mit ausreichend Daten in der Lage sind, die grundlegenden Prinzipien physikalischer Interaktion eigenständig zu entdecken. Dies bedeutet nicht, dass menschenentwickelte Modelle obsolet sind; vielmehr deutet es darauf hin, dass universelle Architekturen als ein starker Ausgangspunkt für die wissenschaftliche Modellierung dienen können. Indem Wissenschaftler sich darauf verlassen, die Struktur durch Daten zu enthüllen, können sie möglicherweise flexible Lösungen entdecken, die schwer vorhersehbar oder schwer vorab schriftlich festzuhalten sind. Diese Arbeit eröffnet einen neuen Weg für die wissenschaftliche Entdeckung, auf dem der Computer nicht nur ein Rechner ist, der Anweisungen folgt, sondern ein Lernender, der in der Lage ist, die Regeln des Universums innerhalb der Daten selbst zu finden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →