← Neueste Arbeiten
🤖 machine learning

Molecular Representations for Large Language Models

Dieser Beitrag stellt MolJSON vor, eine neuartige molekulare Repräsentation, die bei der Verwendung mit großen Sprachmodellen in verschiedenen Schlussfolgerungsaufgaben systematisch traditionelle Formate wie SMILES und IUPAC-Namen übertrifft und zeigt, dass explizite molekulare Graphenschemata die Leistung von LLMs in der Chemie erheblich verbessern.

Ursprüngliche Autoren: Nicholas T. Runcie, Fergus Imrie, Charlotte M. Deane

Veröffentlicht 2026-05-05
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Nicholas T. Runcie, Fergus Imrie, Charlotte M. Deane

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem brillanten, aber wörtlich denkenden Roboter beizubringen, komplexe 3D-Strukturen wie ein Molekül zu verstehen und zu zeichnen. Das Problem liegt nicht daran, dass der Roboter dumm ist; es liegt daran, dass Sie mit ihm in der falschen Sprache sprechen.

Dieser Artikel handelt davon, den richtigen „Dialekt" für Large Language Models (LLMs) zu finden, damit diese über Chemie sprechen können.

Das Problem: „Chemiker" sprechen vs. „Roboter" sprechen

Seit Jahrzehnten verwenden Chemiker zwei Hauptmethoden, um Moleküle am Computer festzuhalten:

  1. SMILES: Stellen Sie sich dies als eine lange, verwirrende Zeichenkette vor, die ein Molekül beschreibt, indem sie es „abwandert". Es ist wie ein Haus zu beschreiben, indem man sagt: „Starten Sie an der Haustür, biegen Sie links ab, gehen Sie die Treppe hoch, biegen Sie rechts ab, und Sie sind in der Küche." Wenn Sie einen Schritt verpassen oder die Reihenfolge falsch verstehen, bricht die gesamte Beschreibung zusammen.
  2. IUPAC-Namen: Dies sind die offiziellen, für Menschen lesbaren Namen (wie „Ethansäure"). Sie sind wie das Lesen eines komplexen juristischen Vertrags, um ein Haus zu beschreiben. Sie sind für Menschen präzise, aber für einen Roboter sehr schwer zu parsen, da die Regeln unglaublich streng sind und die Sätze lang sind.

Die Forscher stellten fest, dass die KI-Modelle, wenn sie aufgefordert wurden, Moleküle in diesen alten Formaten zu lesen oder zu schreiben, viele Fehler machten. Es war, als würde man einen Roboter bitten, eine Lego-Burg basierend auf einem Absatz Textanweisungen in einer Fremdsprache zu bauen; er baute oft das Falsche oder geriet in Verwirrung.

Die Lösung: Einführung von „MolJSON"

Die Autoren schufen ein neues Format namens MolJSON.

Stellen Sie sich MolJSON nicht als Geschichte oder eine Reihe von Anweisungen vor, sondern als Bauplan oder Teileliste.

  • Anstatt zu sagen „gehen Sie von Punkt A zu Punkt B", sagt MolJSON: „Hier ist eine Liste aller Steine (Atome) und hier ist eine Liste genau derjenigen Steine, die zusammengeklebt sind (Bindungen)."
  • Es sieht aus wie eine strukturierte Liste (JSON), die Computer lieben. Es listet jedes Stück und deren Verbindungen explizit auf, ohne die KI zu zwingen, durch das Molekül zu „wandern" oder komplexe Grammatikregeln zu entschlüsseln.

Das Experiment: Der Übersetzungstest

Um zu prüfen, ob diese neue Sprache besser funktioniert, richteten die Forscher drei Arten von Tests mit verschiedenen KI-Modellen (wie GPT-5 und Claude) ein:

  1. Der Übersetzer-Test: Geben Sie der KI ein Molekül in einem Format (wie eine SMILES-Zeichenkette) und bitten Sie sie, es in ein anderes Format umzuschreiben.

    • Ergebnis: Wenn die KI das neue Format als MolJSON ausgeben musste, war sie in 71 % der Fälle korrekt. Wenn sie SMILES oder IUPAC-Namen ausgeben musste, lag sie nur in 43 % der Fälle richtig. Die KI konnte die alten Sprachen einfach nicht gut „sprechen".
  2. Der Labyrinth-Test (Kürzester Weg): Geben Sie der KI ein Molekül und fragen Sie: „Wie viele Bindungen liegen zwischen diesem Fluoratom und jenem Chloratom?"

    • Ergebnis: Mit MolJSON lag die KI in 98,5 % der Fälle richtig. Bei SMILES waren es 92 %, und bei IUPAC-Namen sank der Wert auf 82 %.
    • Bonus: Die KI verbrauchte auch weniger „Gehirn-Token" (Rechenleistung), um das Labyrinth zu lösen, wenn sie den MolJSON-Bauplan erhielt. Sie musste keine Energie verschwenden, um zunächst die Struktur herauszufinden.
  3. Der Baumeister-Test (Eingeschränkte Generierung): Bitten Sie die KI, „ein Molekül zu bauen, das ein Fluor, ein Chlor und zwei Ringe hat".

    • Ergebnis: Wenn die KI die Antwort in MolJSON ausgeben durfte, hatte sie in 95 % der Fälle Erfolg. Wenn sie gezwungen wurde, eine SMILES-Zeichenkette auszugeben, gelang ihr dies nur in 64 % der Fälle.

Warum gewann MolJSON?

Der Artikel legt nahe, dass SMILES und IUPAC-Namen die KI zwingen, zwei schwierige Dinge gleichzeitig zu tun:

  1. Die Struktur entschlüsseln: Sie muss herausfinden, wie das Molekül aus dem Text aussieht.
  2. Die Struktur neu kodieren: Sie muss dieses mentale Bild zurück in ein strenges Textformat verwandeln.

MolJSON überspringt den schwierigen Teil. Es gibt der KI die Struktur direkt (die Atome und Bindungen) und lässt sie die Struktur direkt ausgeben. Es ist, als würde man dem Roboter eine Box mit Lego-Steinen und ein Bild der fertigen Burg geben, anstatt einen Absatz Text, der beschreibt, wie man sie baut.

Das Fazit

Die Forscher stellten fest, dass die Wahl der Darstellung eines Moleküls genauso wichtig ist wie die Intelligenz der KI selbst. Obwohl die KI-Modelle auf Millionen von SMILES-Zeichenketten und IUPAC-Namen trainiert wurden, schnitten sie mit diesem neuen, strukturierten „Bauplan"-Format (MolJSON) deutlich besser ab.

Kurz gesagt: Wenn Sie wollen, dass KI Chemie betreibt, hören Sie auf, mit ihr in chemischen Rätseln (SMILES/IUPAC) zu sprechen, und fangen Sie an, mit ihr in klaren, strukturierten Bauplänen (MolJSON) zu sprechen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →