Active Learning Enables Generation of Molecules that Advance the Known Pareto Front
Dit artikel introduceert een closed-loop active learning-pipeline die iteratief wordt hertraind op kwantumchemische simulatiedata om de generalisatiebeperkingen van statische modellen te overwinnen, waarbij succesvol synthetiseerbare moleculen worden gegenereerd met eigenschappen die de oorspronkelijke trainingsdistributie aanzienlijk overtreffen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De zoektocht naar nieuwe moleculen is een quest om de perfecte bouwstenen te vinden voor alles, van zonnecellen tot levensreddende medicijnen. Decennialang hebben wetenschappers vertrouwd op enorme digitale bibliotheken van bekende chemicaliën, waarbij ze deze één voor één hebben gescreend om die met de juiste eigenschappen te vinden. Maar het universum van mogelijke moleculen is zo uitgestrekt — geschat op aantallen die veel groter zijn dan de sterren aan de hemel — dat het controleren van ze allemaal onmogelijk is. Onlangs kwam er een nieuwe aanpak naar voren: het gebruik van computerprogramma's om geheel nieuwe moleculen vanaf nul te verzinnen, ontworpen met specifieke, gewenste kenmerken. De hoop was dat deze kunstmatige intelligentiesystemen deze eindeloze chemische ruimte konden navigeren en oplossingen konden vinden die menselijke databases nog nooit hadden gezien.
Echter, een hardnekkig probleem heeft deze digitale uitvinders ervan weerhouden hun volledige potentieel te bereiken. Hoewel ze uitstekend zijn in het remixen van bekende ideeën, struikelen ze vaak wanneer ze wordt gevraagd om echt onbekend terrein te betreden. Het probleem is niet dat de uitvinders een gebrek aan verbeelding hebben, maar dat de instrumenten die ze gebruiken om hun creaties te beoordelen, onbetrouwbaar zijn buiten hun training. Wanneer een computerprogramma een nieuw molecuul voorstelt, moet een ander programma het gedrag ervan voorspellen. Als dat voorspellingsinstrument alleen ooit veelvoorkomende voorbeelden heeft gezien, faalt het vaak in het correct raden van iets dat werkelijk nieuw is, wat de uitvinder een doodlopende weg in leidt. Een team onderzoekers bij Lawrence Livermore National Laboratory heeft nu laten zien hoe ze dit blinde vlek kunnen oplossen. Door een zelfcorrigerende lus te creëren waarin de voorspellingen van de computer constant worden gecontroleerd tegen rigoureuze fysieke simulaties, stelden ze hun systeem in staat om moleculen te ontdekken die niet alleen nieuw zijn, maar ook aanzienlijk beter dan alles dat in bestaande records is gevonden.
De onderzoekers richtten zich op een specifieke uitdaging: het ontwerpen van moleculen die zowel dicht zijn als in staat zijn om energie op te slaan, eigenschappen die cruciaal zijn voor geavanceerde materialen. Ze begonnen met een standaard computerprogramma dat in staat is om nieuwe chemische structuren te genereren. In een typische opstelling zou deze generator een molecuul creëren, en een apart voorspellingsmodel zou de eigenschappen schatten. Op basis van die schatting zou de generator het ontwerp aanpassen en het opnieuw proberen. Maar de onderzoekers ontdekten dat dit proces tegen een muur liep. Het voorspellingsmodel, getraind op slechts bekende data, kon moleculen die te verschillend waren van wat het eerder had gezien, niet nauwkeurig beoordelen. Bijgevolg zou de generator nooit ver genoeg durven te gaan om werkelijk superieure ontwerpen te vinden, waardoor het effectief binnen de veiligheid van de bekende wereld bleef.
Om deze cyclus te doorbreken, introduceerde het team een "closed-loop"-systeem dat fungeert als een realiteitscheck. In plaats van uitsluitend te vertrouwen op het initiële voorspellingsmodel, bouwden ze een proces waarbij elk nieuw kandidaat-molecuul dat door de computer wordt gegenereerd, wordt onderworpen aan een hoogwaardige fysica-simulatie. Deze simulatie, een complexe berekening gebaseerd op de wetten van de kwantummechanica, bepaalt de werkelijke dichtheid, energie en stabiliteit van het molecuul. Cruciaal is dat de resultaten van deze simulaties niet simpelweg worden weggegooid; ze worden teruggevoerd in het systeem om het voorspellingsmodel te hertrainen. Met elke ronde van testen leert het voorspellingsmodel meer over de nieuwe regio's van de chemische ruimte die de generator verkent. Het wordt beter in het beoordelen van precies de zaken waar het eerder mee worstelde, waardoor de generator met meer vertrouwen verder kan duwen in onontgonnen gebied.
Dit iteratieve proces bleek transformatief. Terwijl standaard computermodellen er niet in slaagden om moleculen te produceren die de beste voorbeelden uit hun trainingsdata overtroffen, slaagde het nieuwe closed-loop systeem er wel in. Na vier ronden van deze zelfcorrigerende cyclus genereerde het systeem moleculen met dichtheden die de 2 gram per kubieke centimeter overschreden, waarmee het de hoogste dichtheid die in de oorspronkelijke dataset van meer dan 10.000 bekende moleculen werd gevonden, overtrof. Bovendien ontdekte het systeem moleculen met energieopslagcapaciteiten die de grenzen van wat voorheen mogelijk werd geacht, verlegden. De studie toonde aan dat de sleutel tot deze doorbraken niet een slimmere generator was, maar een betrouwbaardere rechter. Het voorspellingsmodel, nadat het was hertraind op de nieuwe simulatiegegevens, werd drastisch nauwkeuriger en verminderde zijn fouten met wel 90 procent bij het evalueren van deze nieuwe structuren.
Nog een andere kritieke hindernis bij de ontdekking van moleculen is het waarborgen dat een door de computer gegenereerd ontwerp daadwerkelijk in een lab gebouwd kan worden. Veel theoretische moleculen zijn chemisch instabiel en zouden onmiddellijk uit elkaar vallen. De onderzoekers pakten dit aan door een gespecialiseerde classifier te trainen om tekenen van instabiliteit te herkennen, gebruikmakend van data uit de fysica-simulaties. Door onstabiele kandidaten weg te filteren voordat ze zelfs maar werden gegenereerd, produceerde het systeem een definitieve set moleculen die 3,5 keer grotere kans hadden om stabiel te zijn dan die van andere toonaangevende methoden. Deze stabiliteit is essentieel, aangezien het suggereert dat deze moleculen niet slechts theoretische curiositeiten zijn, maar potentiële kandidaten voor real-world synthese.
De bevindingen suggereren een verschuiving in hoe we de ontdekking van nieuwe materialen benaderen. De studie geeft aan dat de flessenhals bij het creëren van betere moleculen vaak niet het vermogen is om nieuwe structuren te bedenken, maar het onvermogen om hun gedrag betrouwbaar te voorspellen. Door de creatieve kracht van generatieve modellen te koppelen aan een rigoureus, zelfverbeterend validatieproces, lieten de onderzoekers zien dat het mogelijk is om de grenzen van bekende chemische prestaties betrouwbaar te verleggen. Het resultaat is een systeem dat niet alleen oude ideeën recycleert, maar actief de grens van het mogelijke verlegt, door stabiele, hoogpresterende moleculen te vinden die net buiten het bereik van traditionele methoden liggen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.