Molecular Representations for Large Language Models
Dit artikel introduceert MolJSON, een nieuwe moleculaire representatie die systematisch betere prestaties levert dan traditionele formaten zoals SMILES en IUPAC-namen bij diverse redeneertaken wanneer deze worden gebruikt met grote taalmodellen, en aantoont dat expliciete moleculaire grafschema's de prestaties van LLM's in de chemie aanzienlijk verbeteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een briljante maar letterlijk ingestelde robot te leren complexe 3D-structuren, zoals een molecuul, te begrijpen en te tekenen. Het probleem is niet dat de robot dom is; het probleem is dat je tegen hem spreekt in de verkeerde taal.
Dit artikel gaat over het vinden van het juiste "dialect" voor Large Language Models (LLM's) om over chemie te praten.
Het probleem: "Chemist" spreken versus "Robot" spreken
Decennialang hebben chemici twee hoofdmanieren gebruikt om moleculen op een computer vast te leggen:
- SMILES: Denk hierbij aan een lange, verwarrende tekstreeks die een molecuul beschrijft door er "doorheen te lopen". Het is alsof je een huis beschrijft door te zeggen: "Begin bij de voordeur, sla linksaf, ga de trap op, sla rechtsaf en je bent in de keuken." Als je een stap mist of de volgorde verkeerd hebt, valt de hele beschrijving uit elkaar.
- IUPAC-namen: Dit zijn de officiële, voor mensen leesbare namen (zoals "ethaanzuur"). Ze zijn als het lezen van een complex juridisch contract om een huis te beschrijven. Ze zijn precies voor mensen, maar zeer moeilijk voor een robot om te parseren omdat de regels ongelooflijk strikt zijn en de zinnen lang zijn.
De onderzoekers ontdekten dat wanneer ze AI-modellen vroegen om moleculen te lezen of te schrijven met deze oude formaten, de modellen veel fouten maakten. Het was alsof je een robot vroeg om een Lego-kasteel te bouwen op basis van een alinea tekstinstructies in een vreemde taal; het bouwde vaak het verkeerde ding of raakte in de war.
De oplossing: "MolJSON" introduceren
De auteurs creëerden een nieuw formaat genaamd MolJSON.
Denk aan MolJSON niet als een verhaal of een reeks instructies, maar als een blauwdruk of een onderdelenlijst.
- In plaats van te zeggen "loop van punt A naar punt B", zegt MolJSON: "Hier is een lijst van alle bakstenen (atomen) en hier is een lijst van precies welke bakstenen aan elkaar zijn gelijmd (bindingen)."
- Het ziet eruit als een gestructureerde lijst (JSON) die computers liefhebben. Het vermeldt expliciet elk stukje en hoe ze verbonden zijn, zonder de AI te dwingen door het molecuul te "lopen" of complexe grammaticaregels te decoderen.
Het experiment: De vertaaltest
Om te zien of deze nieuwe taal beter werkte, stelden de onderzoekers drie soorten tests op met verschillende AI-modellen (zoals GPT-5 en Claude):
De vertaaltest: Geef de AI een molecuul in één formaat (zoals een SMILES-reeks) en vraag het om het in een ander formaat te herschrijven.
- Resultaat: Wanneer de AI het nieuwe formaat als MolJSON moest uitvoeren, was het ongeveer 71% van de tijd correct. Wanneer het SMILES of IUPAC-namen moest uitvoeren, was het slechts ongeveer 43% van de tijd correct. De AI kon de oude talen gewoon niet goed "spreken".
De doolhoftest (Kortste pad): Geef de AI een molecuul en vraag: "Hoeveel bindingen zitten er tussen dit Fluor-atoom en dat Chloor-atoom?"
- Resultaat: Met MolJSON had de AI het 98,5% van de tijd goed. Met SMILES was het 92%, en met IUPAC-namen daalde het naar 82%.
- Bonus: De AI gebruikte ook minder "hersentokens" (rekenkracht) om het doolhof op te lossen wanneer het de MolJSON-blauwdruk kreeg. Het hoefde geen energie te verspillen om eerst de structuur uit te zoeken.
De bouwerstest (Beperkte generatie): Vraag de AI om "een molecuul te bouwen dat één Fluor, één Chloor en twee ringen heeft".
- Resultaat: Wanneer de AI het antwoord in MolJSON mocht uitvoeren, slaagde het 95% van de tijd. Wanneer het gedwongen werd om een SMILES-reeks uit te voeren, slaagde het slechts 64% van de tijd.
Waarom won MolJSON?
Het artikel suggereert dat SMILES en IUPAC-namen de AI dwingen om twee moeilijke dingen tegelijk te doen:
- De structuur decoderen: Het moet uit de tekst uitzoeken hoe het molecuul eruit ziet.
- De structuur opnieuw coderen: Het moet dat mentale beeld terug omzetten in een strikt tekstformaat.
MolJSON slaat het moeilijke deel over. Het geeft de AI de structuur direct (de atomen en bindingen) en laat het de structuur direct uitvoeren. Het is alsof je de robot een doos Lego-blokjes en een foto van het uiteindelijke kasteel geeft, in plaats van een alinea tekst die beschrijft hoe je het moet bouwen.
De les
De onderzoekers ontdekten dat de keuze voor hoe je een molecuul representeert net zo belangrijk is als de intelligentie van de AI zelf. Hoewel de AI-modellen waren getraind op miljoenen SMILES-reeksen en IUPAC-namen, presteerden ze aanzienlijk beter wanneer ze dit nieuwe, gestructureerde "blauwdruk"-formaat (MolJSON) gebruikten.
Kortom: Als je wilt dat AI chemie doet, stop dan met tegen hem te spreken in chemische raadsels (SMILES/IUPAC) en begin met tegen hem te spreken in duidelijke, gestructureerde blauwdrukken (MolJSON).
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.