BOOM: Benchmarking Out-Of-distribution Molecular Property Predictions of Machine Learning Models
Dit artikel introduceert BOOM, de eerste chemisch geïnformeerde open-source benchmark voor het systematisch evalueren van out-of-distribution (OOD) generalisatie in moleculaire eigenschappelijkheidsvoorspelling, wat onthult dat huidige machine learning-modellen moeite hebben met extrapolatie buiten hun trainingsdata en de noodzaak benadrukt voor nieuwe benaderingen om robuuste OOD-prestaties te bereiken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De zoektocht naar het ontdekken van nieuwe medicijnen en materialen begint vaak met een eenvoudige, ontmoedigende vraag: welke van de miljarden mogbare chemische structuren zullen daadwerkelijk werken? Decennialang hebben wetenschappers vertrouwd op trial-and-error, maar een nieuwe golf van kunstmatige intelligentie belooft dit proces te versnellen door te voorspellen hoe een molecuul zich zal gedragen voordat het ooit gebouwd wordt. Deze computermodellen worden getraind op enorme bibliotheken van bekende chemicaliën, waarbij ze leren patronen te herkennen die een molecuulvorm koppelen aan eigenschappen, zoals hoe goed het oplost in water of hoeveel energie het vrijgeeft bij verbranding. De hoop is dat deze modellen vervolgens naar een volledig nieuw, onbekend molecuul kunnen kijken en het gedrag ervan accuraat kunnen raden, waardoor onderzoekers effectief de toekomst van de chemie op een computerscherm kunnen ontwerpen.
Er zit echter een aanzienlijke adder onder het gras. De meeste van deze AI-modellen zijn uitstekend in het herkennen van patronen binnen de data waarop ze zijn getraind, maar ze struikelen vaak wanneer ze gevraagd wordt de eigenschappen te voorspellen van moleculen die werkelijk verschillend zijn van alles in hun trainingsbibliotheek. In de wereld van machine learning staat dit bekend als het "out-of-distribution"-probleem. Het is het verschil tussen een student die de antwoorden op een oefentoets uit het hoofd leert en een student die daadwerkelijk een nieuwe, onverwachte probleemstelling kan oplossen. Als een model niet kan generaliseren buiten zijn trainingsdata, wordt het een hulpmiddel om te bevestigen wat we al weten, in plaats van een hulpmiddel om het onbekende te ontdekken. Deze beperking is een belangrijke flessenhals voor de volgende generatie medicijnontwikkeling en materiaalkunde, waar het doel is om moleculen te vinden die de grenzen van wat momenteel mogelijk is, verleggen.
Een team van onderzoekers van het Lawrence Livermore National Laboratory en de Binghamton University heeft een kritisch oog geworpen op dit probleem met een nieuwe benchmark genaamd BOOM. In plaats van alleen te testen hoe goed modellen presteren op bekende data, hebben zij een rigoureuze reeks tests ontworpen die specifiek bedoeld zijn om te zien of deze systemen van kunstmatige intelligentie met het onbekende om kunnen gaan. Zij verzamelden tien verschillende datasets met duizenden moleculen, variërend van kleine organische verbindingen tot complexe structuren met specifieke elektronische eigenschappen. Voor elke dataset scheidden zij de moleculen zorgvuldig af in drie groepen: een trainingsset, een standaard testset van bekende moleculen, en een speciale "out-of-distribution" testset. Deze speciale groep bestond uit moleculen met extreme eigenschappen—waarden die zo hoog of zo laag zijn dat ze zelden in de trainingsdata voorkomen. De onderzoekers lieten vijftien verschillende machine learning-modellen hun kunnen tonen, waarbij ze elk model vroegen de eigenschappen van deze extreme moleculen te voorspellen.
De resultaten waren sober. Ondanks de indrukwekkende capaciteiten van moderne kunstmatige intelligentie, toonde de studie aan dat geen enkel model consistent de eigenschappen van deze extreme moleculen kon voorspellen over alle taken heen. Zelfs de best presterende modellen maakten fouten op deze moeilijke, onbekende gevallen die drie keer groter waren dan hun fouten op bekende data. De onderzoekers observeerden een veelvoorkomende foutmodus: de modellen waren goed in het groeperen van vergelijkbare moleculen, maar faalden in het uitbreiden van hun voorspellingen naar het onbekende terrein. In plaats van een waarde te raden die werkelijk buiten het bereik lag van wat ze hadden gezien, hadden de modellen de neiging om hun voorspellingen te comprimeren, waarbij ze extreme waarden terug naar het gemiddelde trokken. Dit gedrag suggereert dat de modellen kortroutes leren die goed werken voor standaard data, maar die instorten wanneer ze worden geconfronteerd met de ware nieuwheid die vereist is voor wetenschappelijke ontdekking.
Het team onderzocht ook waarom deze modellen moeite hadden en testte verschillende veelvoorkomende strategieën om het probleem op te lossen. Zij onderzochten of het vooraf trainen (pre-training) van modellen op massale datasets van miljarden moleculen—een techniek die taalmodellen een revolutie heeft gebracht—zou helpen. Verrassend genoeg ontdekten zij dat hoewel deze pre-training de modellen beter maakte in het afhandelen van bekende data, het hun vermogen om extreme waarden te voorspellen niet verbeterde. Sterker nog, voor sommige modellen maakte de pre-training de out-of-distribution prestaties zelfs slechter. Zij testten ook of het simpelweg toevoegen van meer data aan de trainingsset zou helpen. Hoewel het opnemen van een klein aantal extreme voorbeelden de prestaties voor sommige eigenschappen verbeterde, was het geen universele oplossing. De studie suggereert dat de manier waarop deze modellen momenteel worden gebouwd, met name hun afhankelijkheid van tekstgebaseerde representaties van moleculen, hun vermogen om de diepe natuurkundige wetten die het chemische gedrag beheersen, fundamenteel kan beperken.
Een van de meest onthullende bevindingen was dat het type datarepresentatie belangrijker was dan de omvang van het model. Modellen die drie-dimensionale geometrische informatie over de atomen en hun posities gebruikten, presteerden aanzienlijk beter dan diegene die vertrouwden op lineaire tekstreeksen, die lijken op chemische namen die in een sequentie zijn uitgeschreven. De driedimensionale modellen, die de fysieke symmetrieën van de ruimte respecteren, waren in staat veel beter te generaliseren naar de extreme gevallen. Dit wijst op een duidelijke weg vooruit: om AI te bouwen die werkelijk nieuwe chemie kan ontdekken, moeten de modellen geworteld zijn in de fysieke realiteit van hoe atomen bewegen en interageren, in plaats van alleen in de patronen van hoe ze in tekst worden beschreven. De onderzoekers concludeerden dat het bereiken van sterke prestaties bij deze moeilijke taken waarschijnlijk een combinatie vereist van grotere, diversere datasets en modellen die expliciet de elektronische structuur van moleculen begrijpen.
De BOOM-benchmark dient als een reality check voor het vakgebied, waarbij wordt aangetoond dat de huidige generatie chemische AI, hoewel krachtig, nog niet in staat is om betrouwbaar door het onbekende te navigeren. De studie beweert niet dat het probleem onoplosbaar is, maar het sluit wel de mogelijkheid uit dat het simpelweg opschalen van bestaande modellen of het gebruiken van standaard pre-trainingstechnieken voldoende zal zijn om het op te lossen. In plaats daarvan benadrukt het dat de volgende grens in chemische machine learning een verschuiving vereist in hoe deze systemen worden ontworpen. Door een gestandaardiseerde manier te bieden om voor deze specifieke zwakte te testen, hopen de onderzoekers de gemeenschap te leiden naar het bouwen van modellen die niet alleen goed zijn in het onthouden van het verleden, maar werkelijk in staat zijn om de toekomst te verbeelden. Het pad naar de ontdekking van de volgende generatie levensreddende medicijnen en geavanceerde materialen kan afhangen van het oplossen van dit specifieke puzzelstukje van generalisatie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.