← Neueste Arbeiten
🧬 biology

MoleCode unlocks structural intelligence in large language models

MoleCode führt eine trainingsfreie, graphenexplizite Molekularsprache ein, die implizite lineare Darstellungen wie SMILES durch explizite Strukturbeziehungen ersetzt und es großen Sprachmodellen ermöglicht, Molekültopologien direkt zu verarbeiten und zu manipulieren, um die Leistung bei komplexen chemischen Aufgaben zu verbessern.

Ursprüngliche Autoren: Zhiyuan Yan, Chen Liu, Boxuan Zhao, Kaiqing Lin, Jixiang Zhao, Yimi Wang, Liuzhenghao Lv, Hao Li, Shanzhuo Zhang, Li Yuan, Fanyang Mo

Veröffentlicht 2026-05-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zhiyuan Yan, Chen Liu, Boxuan Zhao, Kaiqing Lin, Jixiang Zhao, Yimi Wang, Liuzhenghao Lv, Hao Li, Shanzhuo Zhang, Li Yuan, Fanyang Mo

Originalarbeit unter CC0 1.0 der Gemeinfreiheit gewidmet (http://creativecommons.org/publicdomain/zero/1.0/). ⚕️ Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen

Das Problem: Die „Mystery Box" der Moleküle

Stellen Sie sich vor, Sie sind ein Architekt, der ein Haus bauen soll, aber anstatt eines Bauplans mit klaren Wänden, Türen und Fenstern erhalten Sie von jemandem einen einzigen, langen Satz, der das Haus beschreibt.

„Beginnen Sie mit einem Ziegelstein, gehen Sie nach links, drehen Sie sich nach rechts, setzen Sie hier ein Fenster ein, dann eine Tür, dann eine Schleife aus Ziegelsteinen, die wieder zum Anfang zurückführt..."

So sehen aktuelle KI-Modelle (Large Language Models oder LLMs) Moleküle normalerweise. Die Standardmethode, ein Molekül zu schreiben, heißt SMILES. Es ist eine kompakte Textzeichenkette, die die tatsächliche 3D-Form und die Verbindungen des Moleküls in einer Codezeile verbirgt.

Wenn eine KI versucht, ein in SMILES geschriebenes Molekül zu verstehen, muss sie viel mentale Akrobatik vollführen. Sie muss den Satz lesen, innehalten und sagen: „Warte, lass mich das ganze Haus in meinem Kopf rekonstruieren, bevor ich dir sagen kann, ob das Dach sicher ist oder ob ich ein neues Zimmer hinzufügen kann." Dieser „Rekonstruktions"-Schritt ist langsam, fehleranfällig und wird viel schwieriger, wenn das Haus (das Molekül) riesig ist oder die KI dieses spezifische Design noch nie gesehen hat.

Die Lösung: MoleCode (Der „Lego-Bauplan")

Die Forscher haben eine neue Sprache namens MoleCode eingeführt. Denken Sie an MoleCode nicht als einen Satz, sondern als eine digitale Lego-Bauanleitung oder eine Tabelle.

Anstatt eines langen, verwirrenden Satzes listet MoleCode jedes einzelne Teil (Atom) und jede Verbindung (Bindung) explizit auf.

  • Atom 1 ist ein Kohlenstoff.
  • Atom 2 ist ein Sauerstoff.
  • Verbindung: Atom 1 ist mit Atom 2 verknüpft.

In diesem Format liegt der „Bauplan" direkt vor der KI. Sie muss die Form nicht erraten oder rekonstruieren; die Form ist bereits sichtbar und bearbeitbar.

Was passierte, als sie es ausprobierten?

Das Team testete diese neue Sprache an mehreren Aufgaben mit hochmodernen KI-Modellen. Hier ist das Ergebnis, dargestellt durch einfache Vergleiche:

1. Rätsel lösen (Schlussfolgern)

  • Der alte Weg: Wenn man die KI bat, die Fenster in einem komplexen, unbekannten Haus zu zählen, geriet die KI, die SMILES verwendete, oft in dem langen Satz verloren und gab die falsche Antwort.
  • Der MoleCode-Weg: Mit MoleCode konnte die KI einfach die Liste der Teile ansehen und sie sofort zählen. Die KI wurde bei Aufgaben wie der Vorhersage chemischer Reaktionen oder dem Zählen von Atomen deutlich besser, insbesondere bei komplexen oder unbekannten Molekülen.

2. Häuser renovieren (Optimierung)

  • Der alte Weg: Wenn man die KI bat, „dieses Haus energieeffizienter zu machen", riss sie manchmal die gesamte Struktur nieder und baute etwas völlig anderes, oder sie nahm Änderungen vor, die das Haus zerstörten.
  • Der MoleCode-Weg: Da die KI genau sehen konnte, welcher „Ziegelstein" (Atom) wo war, nahm sie kleine, präzise Änderungen vor (wie den Austausch eines Fensters gegen ein besseres), die das Haus verbesserten, ohne die Struktur zu beschädigen. Sie traf intelligentere, sicherere Änderungen.

3. Schneller denken (Effizienz)

  • Der alte Weg: Die KI verbrachte die meiste ihrer „Denkzeit" damit, nur herauszufinden, wie das Molekül aussah. Es war wie ein Schüler, der 10 Minuten damit verbringt, die Karte zu zeichnen, bevor er das Matheproblem löst.
  • Der MoleCode-Weg: Die KI verbrachte weniger Zeit damit, die Karte zu zeichnen, weil die Karte bereits da war. Obwohl die MoleCode-„Anweisungen" länger zu lesen waren, verbrachte die KI weniger Zeit mit dem Denken, was zu einem schnelleren und genaueren Gesamtprozess führte.

4. Wolkenkratzer bauen (Polymere)

  • Der alte Weg: Polymere sind wie riesige Ketten aus sich wiederholenden Gliedern. Sie in einem Satz (SMILES) aufzuschreiben, erzeugt einen massiven, unlesbaren Textblock. Die KI würde verwirrt werden und scheitern.
  • Der MoleCode-Weg: MoleCode behandelt diese Ketten wie eine Anweisung „Wiederhole diesen Block 100 Mal". Die KI konnte diese riesigen, sich wiederholenden Strukturen perfekt handhaben, während die alte Methode unter dem Gewicht des langen Textes zusammenbrach.

5. Komplexe Dokumente lesen

  • Die Forscher zeigten auch, dass MoleCode mehr kann als nur einzelne Moleküle zu verarbeiten. Es kann wissenschaftliche Artikel und Patente lesen, die Text mit Diagrammen mischen, und sie in einen einzigen, organisierten Graphen verwandeln. Es kann sogar „Markush-Strukturen" (chemische Formeln mit variablen Teilen, wie „füge hier eine beliebige Frucht hinzu") handhaben, die für Standardtextformate sehr schwer zu beschreiben sind.

Die große Erkenntnis

Die Hauptlehre dieses Papiers dreht sich darum, wie wir mit KI über Wissenschaft sprechen.

Derzeit zwingen wir die KI, wissenschaftliche Formen in Text zu übersetzen und dann diesen Text wieder in Formen in ihrem Kopf zurückzuübersetzen. Dieses Papier argumentiert, dass wir, wenn das Objekt, das wir untersuchen, eine Struktur ist (wie ein Molekül), der KI eine strukturelle Sprache zur Verfügung stellen sollten, mit der sie arbeiten kann.

Durch den Wechsel von „Mystery-Sätzen" (SMILES) zu „expliziten Bauplänen" (MoleCode) verschwendet die KI keine Energie mehr damit zu raten, wie das Molekül aussieht, und beginnt stattdessen, ihr Gehirn zu nutzen, um tatsächlich chemische Probleme zu lösen.

Hinweis zu Einschränkungen: Das Papier klärt auf, dass MoleCode der KI nicht magisch neues chemisches Wissen gibt, das sie nicht bereits hatte. Wenn die KI keine Chemie kennt, wird sie es immer noch nicht wissen. Aber es ermöglicht der KI, das Wissen, das sie hat, viel effektiver zu nutzen. Außerdem ist die neue Sprache länger zu tippen als die alte, aber der Kompromiss lohnt sich, weil die KI weniger denkt und mehr erreicht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →