Monroe: A Molecular Foundation Model for In-Context Probabilistic Inference
Dit artikel introduceert Monroe, een schaalbaar moleculair fundament-model getraind op 81 miljoen moleculen met verbeterde stereochemische representaties en nieuwe trainingsdoelstellingen, dat een staat-van-de-kunst prestatie bereikt in bioassay-activiteitvoorspelling door gebruik te maken van een prior-data-fitted model (TabPFN) voor in-context probabilistische inferentie en door aan te tonen dat deze downstream adaptatiestrategie ook bestaande modellen zoals MiniMol en CheMeleon significant verbetert.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
In de race om nieuwe medicijnen te ontdekken, worden wetenschappers geconfronteerd met een hardnekkige flessenhals: de meest betrouwbare manier om te weten of een molecuul een ziekte zal genezen, is door het te bouwen en in een laboratorium te testen. Dit proces is traag, duur en beperkt door het aantal gespecialiseerde faciliteiten dat deze experimenten kan uitvoeren. Hierdoor is de data die beschikbaar is om computerprogramma's te trainen vaak schaars. Om dit te overwinnen, hebben onderzoekers een strategie toegepast die vergelijkbaar is met hoe een kind leert om dieren te herkennen voordat het ooit een specifieke hond of kat heeft gezien. Ze trainen enorme computermodellen op uitgestrekte bibliotheken van chemische structuren en hun basisfysische eigenschappen, waardoor de software een algemeen gevoel krijgt van hoe moleculen zich gedragen. Zododat dit fundament is gelegd, kan het model worden aangepast om specifieke biologische uitkomsten te voorspellen, zoals of een verbinding zal binden aan een virus, zelfs wanneer er slechts een handvol experimentele resultaten beschikbaar zijn voor die specifieke taak. Deze aanpak, bekend als een moleculair fundament-model, heeft tot doel de kloof te overbruggen tussen de eindeloze wereld van mogelijke chemicaliën en de beperkte data van echte wereld drugstesten.
Een team van onderzoekers heeft een nieuw model geïntroduceerd genaamd Monroe, dat een significante stap voorwaarts vertegenwoordigt in dit veld. De naam eert Elizabeth Monroe Boggs, een pionier in de computationele chemie, maar het model zelf is een modern machine learning-systeem dat ontworpen is om de complexe taal van moleculen te begrijpen. De onderzoekers hebben Monroe getraind op een enorme dataset die meer dan 81 miljoen moleculen bevat, een schaal die veel groter is dan eerdere pogingen. Deze dataset bevatte gedetailleerde kwantumchemische berekeningen, die de energie en structuur van atomen beschrijven, evenals data van duizenden biologische assays die meten hoe moleculen interageren met levende systemen. Door het model bloot te stellen aan deze enorme variëteit aan informatie, stelden de onderzoekers het in staat om algemene chemische regels te leren die van toepassing zijn op verschillende soorten problemen, in plaats van alleen specifieke voorbeelden te onthouden.
Een van de meest cruciale innovaties in Monroe is hoe het omgaat met de driedimensionale vorm van moleculen, specifiek hun "handigheid" (handedness). Veel moleculen bestaan in twee vormen die elkaars spiegelbeeld zijn, net als een linker- en rechterhand. Hoewel deze spiegelbeelden dezelfde atomen hebben die in dezelfde volgorde zijn verbonden, gedragen ze zich in het menselijk lichaam vaak volkomen verschillend; het ene kan een medicijn zijn, terwijl zijn spiegelbeeld giftig kan zijn. Standaard computermodellen hebben vaak moeite om deze versies van elkaar te onderscheiden omdat ze vertrouwen op wiskundige beschrijvingen die voor beide vormen identiek lijken. Monroe lost dit op door expliciet extra verbindingen toe te voegen in de interne kaart van het molecuul die fungeren als vlaggen voor deze spiegelbeeldverschillen. Dit stelt het model in staat om tussen de twee vormen te onderscheiden met een hoge nauwkeurigheid, een capaciteit die essentieel is voor het voorspellen van hoe een medicijn daadwerkelijk zal werken in een biologisch systeem.
De onderzoekers hebben ook verfijnd hoe het model leert van zijn trainingsdata. In plaats van elke leertaken als even belangrijk te behandelen, gebruikt Monroe een slim weegsysteem dat automatisch de focus aanpast. Het besteedt meer aandacht aan taken waar de data duidelijk en betrouwbaar is, en minder aandacht aan taken die ruisachtig of onzeker zijn. Bovendien is het model getraind om imperfecte data op te schonen. In de echte wereld zijn de 3D-vormen van moleculen die in computersimulaties worden gebruikt, vaak grove benaderingen. Monroe wordt geleerd om deze grove vormen te verfijnen tot nauwkeurigere, stabielere vormen, een proces dat het model helpt de onderliggende fysische regels te begrijpen die moleculaire stabiliteit beheersen. Deze mogelijkheid om de data te "denoisen" (ruis te verwijderen) versterkt de voorspellingen van het model voor toepassingen in de echte wereld.
Wanneer het werd getest tegen andere leidende modellen, toonde Monroe een superieure prestatie, met name in de meest uitdagende scenario's die bekend staan als "activity cliffs" (activiteitshellingen). Dit zijn gevallen waarbij twee moleculen bijna identiek zijn in structuur, maar drastisch verschillende biologische effecten hebben. Het voorspellen van deze scherpe verschillen is berucht moeilijk voor kunstmatige intelligentie, toch presteerde Monroe beter dan zijn concurrenten in deze tests. De onderzoekers ontdekten ook dat hun methode om het model aan nieuwe taken aan te passen zeer effectief was. In plaats van het hele model opnieuw te trainen voor elk nieuw medicijn-doelwit, gebruikten ze een techniek die het model in staat stelt om in één stap te leren van een kleine set voorbeelden, vergelijkbaar met hoe een mens een nieuwe regel kan leren na het zien van slechts enkele voorbeelden. Deze aanpak, die ze niet alleen op Monroe toepasten maar ook om twee andere bestaande modellen te verbeteren, bleek een krachtige en algemene strategie te zijn.
De studie concludeert dat het combineren van grootschalige pre-training met specifieke architecturale verbeteringen, zoals een betere behandeling van moleculaire handigheid en slimme data-weging, een robuustere tool creëert voor medicijnontdekking. Hoewel het model niet elk probleem in moleculaire voorspelling oplost, en de uitdaging van "activity cliffs" moeilijk blijft, zet Monroe een nieuwe standaard voor wat mogelijk is. Het laat zien dat door computers een dieper, genuanceerder begrip van chemische structuur en gedrag bij te brengen, wetenschappers tools kunnen bouwen die beter uitgerust zijn om door het uitgestrekte en complexe landschap van potentiële medicijnen te navigeren, wat de reis van een chemisch idee naar een levensreddende behandeling potentieel kan versnellen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.