← Neueste Arbeiten
🤖 machine learning

Bi-semantic Chemical Embedder for Joint Representation Learning of SMILES and Natural Language

Das Papier stellt CheMatE vor, ein bi-semantisches Embedding-Modell, das auf ModernBERT basiert und einen zweistufigen Trainingsprozess nutzt, der aus fortgesetztem Masked Language Modeling auf einem massiven, mit SMILES annotierten wissenschaftlichen Korpus sowie anschließendem kontrastivem Lernen zur gemeinsamen Repräsentation von Molekülstrukturen und natürlicher Sprache besteht, wodurch eine robuste Leistung sowohl bei der Vorhersage chemischer Eigenschaften als auch bei allgemeinen Sprachverständnisaufgaben erzielt wird.

Ursprüngliche Autoren: David Ming Segura, Jeremy Goumaz, Joshua W. Sin, Bojana Ranković, Philippe Schwaller

Veröffentlicht 2026-08-05
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: David Ming Segura, Jeremy Goumaz, Joshua W. Sin, Bojana Ranković, Philippe Schwaller

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich die Welt der Chemie als eine riesige, geschäftige Bibliothek vor. In ihr gibt es zwei sehr unterschiedliche Arten, dasselbe zu beschreiben: ein Molekül. In einem Regal finden Sie die „Abkürzung des Wissenschaftlers“, einen kompakten Code namens SMILES, der wie eine seltsame Zeichenfolge aus Buchstaben und Zahlen aussieht (wie C1=CC=CC=C1). Er ist effizient für Computer, liest sich für Menschen aber wie ein Geheimcode. Im anderen Regal hingegen steht die „Beschreibung des Geschichtenerzählers“: lange Absätze in natürlicher Sprache, die erklären, wie sich ein Molekül verhält, wo es vorkommt oder wie es reagiert. Lange Zeit mussten Computerprogramme, die Chemie verstehen wollten, sich für eine Seite entscheiden. Sie konnten entweder großartig darin sein, den Geheimcode zu lesen, aber schlecht darin, die Geschichte zu verstehen, oder umgekehrt. Sie vergaßen oft, wie man „Mensch“ spricht, nur um zum Experten für „chemischen Code“ zu werden. Diese Arbeit stellt eine einfache, aber knifflige Frage: Können wir ein einziges Gehirn bauen, das sowohl fließend den Geheimcode als auch die Geschichte spricht, ohne dabei den Verstand zu verlieren?

Die Forscher hinter dieser Studie, angeführt von David Ming Segura und Philippe Schwaller, sagen: Ja. Sie haben ein neues KI-Modell namens CheMatE (Chemical Embedder with Matryoshka Embedding) entwickelt, das wie ein super-bilingualer Übersetzer fungiert. Anstatt das KI-Modell zu zwingen, sich zwischen dem Chemiker oder dem Linguisten zu entscheiden, haben sie es gelehrt, den chemischen Code und die wissenschaftliche Geschichte als zwei Seiten derselben Medaille zu sehen.

So haben sie es gemacht, und warum es funktioniert.

Das Problem: Die „Spezialisten“-Falle

Betrachten Sie frühere KI-Modelle wie einen Studenten, der nur für eine Matheprüfung lernt. Er mag in Analysis eine perfekte Punktzahl erreichen, aber wenn man ihn bittet, ein Gedicht zu schreiben, vergisst er vielleicht, wie man Adjektive verwendet. In der Welt der Chemie-KI wurden Modelle, die intensiv auf SMILES-Strings (dem Code) trainiert wurden, so gut darin, Muster im Code zu erkennen, dass sie „vergaßen“, wie man die sie umgebenden Sätze in natürlicher Sprache versteht. Sie wurden zu Spezialisten, die nicht mehr mit dem Rest der Bibliothek kommunizieren konnten.

Die Lösung: Eine „bilinguale“ Bibliothek

Das Team entschied sich dagegen, den Code und die Geschichte als getrennte Dinge zu behandeln. Stattdessen entwickelten sie eine Trainingsmethode, bei der beide miteinander verwoben werden.

1. Die Injection-Pipeline: Den Text würzen
Stellen Sie sich vor, Sie haben einen Stapel von 14,4 Millionen wissenschaftlichen Artikeln und Bildungstexten. Dies sind die „Geschichten“. Die Forscher bauten eine Roboter-Pipeline, die diese Geschichten liest, jede Erwähnung einer Chemikalie (wie „Glukose“ oder „Aspirin“) findet und heimlich den SMILES-Code der Chemikalie direkt daneben einfügt.

  • Das Ergebnis: Ein Satz wie „Glucose ist ein einfacher Zucker“ wird zu „Glucose ist ein einfacher Zucker 0=С[С@H](0)...“.
  • Die Größenordnung: Dies taten sie für über 14 Millionen Dokumente und schufen so einen massiven Trainingsdatensatz mit 21,9 Milliarden „Wörtern“ (Tokens). Das bedeutet, die KI sieht den Code und die Geschichte zur exakt gleichen Zeit, immer und immer wieder.

2. Der „Smart Batching“-Trick: Das Puzzle passend machen
Eine KI auf eine so massive Bibliothek zu trainieren, ist wie der Versuch, Puzzleteile von völlig unterschiedlichen Größen in eine Box zu passen. Einige Dokumente sind kurz; andere sind riesig (bis zu 8.192 Tokens lang). Wenn man sie einfach wahllos hineinwirft, würden einige Computerprozessoren (GPUs) untätig warten, bis die langsamen fertig sind, was Zeit und Geld verschwendet.

  • Die Lösung: Das Team erfand einen „Cost-Aware Batch Sampler“. Stellen Sie sich das wie einen klugen Bibliothekar vor, der nicht nur zählt, wie viele Bücher in einem Stapel liegen, sondern berechnet, wie schwer und sperrig jedes einzelne Buch ist. Sie ordnen die Stapel so an, dass jeder Computerprozessor die gleiche Menge an „Arbeit“ zu erledigen bekommt, unabhängig davon, wie lang die Dokumente sind. Dies machte das Training um 30 % effizienter und ermöglichte es ihnen, diese langen, komplexen Dokumente zu bearbeiten, ohne abzustürzen.

3. Das zweistufige Training: Lesen lernen, dann Verbinden lernen
Die KI las den durchmischten Text nicht einfach nur einmal; sie lernte in zwei deutlichen Phasen, ähnlich wie ein Student, der zuerst Vokabeln lernt und dann lernt, Aufsätze zu schreiben.

  • Stufe 1 (Der Wortschatz): Das Modell nutzte eine Technik namens „Masked Language Modeling“. Stellen Sie sich vor, Sie lesen einen Satz, in dem einige Wörter durch schwarze Kästen verdeckt sind. Die KI musste die fehlenden Wörter erraten. Aber hier konnten die fehlenden Wörter ein normales Wort oder ein Stück SMILES-Code sein. Dies zwang die KI dazu, zu lernen, dass der Code und der Text in denselben Kontext gehören.
  • Stufe 2 (Die Verbindung): Sobeder die KI den Wortschatz kannte, brachten sie ihr bei, Beziehungen zu verstehen. Sie kreierten ein Spiel, bei dem die KI einen spezifischen chemischen Code mit dem korrekten Textabsatz zusammenbringen musste, während sie Absätze über völlig andere Chemikalien ignorieren sollte. Sie verwendeten eine Methode namens „Multiple Negative Ranking Loss“ mit einem „Matryoshka“-Kniff (benannt nach den russischen Matroschka-Puppen). Das bedeutet, die KI lernte, die Chemikalie auf verschiedenen Ebenen der Detailtiefe zu verstehen – von einer Gesamtansicht bis hin zu den kleinsten Details –, wodurch sichergestellt wurde, dass sie keine wichtigen Informationen verliert, selbst wenn die Ansicht herausgezoomt ist.

Die Ergebnisse: Das Beste aus beiden Welten

Als sie CheMatE testeten, waren die Ergebnisse beeindruckend. Sie verglichen es mit 11 anderen Modellen, darunter solche, die Experten nur im Code und andere, die Experten nur in Text waren.

  • Die Punktzahl: CheMatE war das einzige Modell, das gleichzeitig in der Spitzengruppe für beide Aufgaben rangierte. Es erreichte einen „Bi-semantic Score“ von 86,7 %, was bedeutet, dass es zu den besten Performern bei fast 88 % der 48 durchgeführten Tests gehörte.
  • Der Vergleich: Modelle, die gut darin waren, SMILES-Code zu lesen (wie MoLFormer oder ChemBERTa), waren schlecht darin, natürliche Sprache zu verstehen. Modelle, die gut in Sprache waren, waren zwar okay im Code, aber nicht die Besten. ChematE durchbrach diesen Kompromiss. Es bewies, dass man nicht eine Fähigkeit opfern muss, um die andere zu gewinnen.

Warum es wichtig ist

Hier geht es nicht nur darum, eine höhere Punktzahl in einem Test zu erreichen. Indem Che-MatE beweist, dass ein einziges Modell sowohl die starre Struktur chemischer Formeln als auch den fließenden Kontext wissenschaftlicher Texte verstehen kann, öffnet es die Tür für intelligentere Werkzeuge in der Arzneimittelentwicklung und Materialwissenschaft. Es legt nahe, dass wir in Zukunft nicht mehr separate Werkzeuge benötigen, um ein chemisches Diagramm und eine Forschungsarbeit zu lesen; ein einziges, vereintes Gehirn könnte beides leisten und Wissenschaftlern helfen, neue Medikamente oder Materialien schneller zu finden, indem es die gesamte Geschichte hinter der Wissenschaft versteht.

Die Autoren weisen vorsichtig darauf hin, dass das System zwar ein riesiger Schritt nach vorn ist, aber nicht perfekt ist. Es stützt sich auf bestehende Werkzeuge, um Chemikalien in Texten zu finden, was manchmal schwierige oder brandneue Verbindungen übersehen kann. Die Kernidee jedoch – dass das Mischen von Code und Geschichte ein intelligenteres, vielseitigeres KI-Modell schafft – wurde erfolgreich demonstriert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →