Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules
Mol-JEPA is een schaalbaar multimodaal framework dat moleculaire wereldmodellen leert door modaliteitsmaskering toe te passen over diverse data voor medicijnontwikkeling om beperkingen zoals chemisch ongeldige augmentaties en modaliteitsinstorting te overwinnen, waardoor robuuste representaties worden gegenereerd via latentieruimtevoorspelling.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De zoektocht naar nieuwe medicijnen is een traag, duur en vaak frustrerend proces. Wetenschappers moeten minuscule moleculen vinden die zich kunnen vastzetten op specifieke doelwitten in het lichaam om een ziekte te stoppen, maar deze moleculen moeten ook de reis door de bloedbaan overleven, niet worden afgebroken door de lever en geen gezonde cellen vergiftigen. Decennialang hebben onderzoekers geprobeerd computers te leren deze uitkomsten te voorspellen door ze afbeeldingen van moleculen te laten zien, meestal gerepresenteerd als reeksen tekst of diagrammen van verbonden atomen. Een molecuul bestaat echter niet in een vacuüm; het gedrag ervan hangt volledig af van hoe het interacteert met de complexe, levende systemen om zich heen. Een model dat alleen de vorm van een molecuul ziet, is als een kaart die het terrein laat zien, maar het weer, het verkeer en de lokale wetten negeert. Het kan je vertellen waar een weg naartoe gaat, maar niet of een auto er daadwerkelijk overheen kan rijden.
Om dit op te lossen, heeft een team onderzoekers een nieuw soort kunstmatige intelligentie ontwikkeld genaamd Mol-JEPA. In plaats van te proberen de toekomst van een molecuul te raden door de vorm ervan licht te veranderen – een methode die vaak tot onzin leidt omdat kleine veranderingen in chemie enorme gevolgen kunnen hebben voor het gedrag – leert dit systeem door het molecuul vanuit veel verschillende hoeken tegelijkertijd te bekijken. Stel je voor dat je een persoon probeert te begrijpen, niet alleen door hun gezicht, maar door naar hun stem te luisteren, te kijken naar hoe ze bewegen, hun medische geschiedenis te lezen en te observeren hoe ze reageren op verschillende soorten voedsel. Mol-JEPA doet precies dit voor chemicaliën. Het verzamelt een enorme hoeveelheid informatie over bijna vijf miljoen moleculen, inclusief hun atomaire structuur, hoe ze binden aan eiwitten, hoe ze cellen beïnvloeden en hun fysieke eigenschappen. Het systeem oefent vervolgens een spel van voorspelling: het verbergt één stukje van deze informatie en probeert te raden wat het is op basis van de rest. Door herhaaldelijk deze ontbrekende stukjes in te vullen, leert de computer een diep, verenigd begrip van hoe moleculen zich in de echte wereld gedragen, in plaats van alleen hun statische vormen te memoriseren.
De onderzoekers bouwden dit model met behulp van een enorme collectie gegevens uit publieke databases en nieuwe berekeningen. Ze combineerden standaard chemische metingen met geavanceerde simulaties van hoe atomen bewegen en interageren, evenals gegevens uit experimenten die meten hoe medicijnen levende cellen beïnvloeden. In totaal creëerden ze een dataset met bijna vijf miljoen unieke verbindingen, waarbij elke verbinding wordt beschreven door tot wel veertien verschillende soorten informatie. Sommige van deze beschrijvingen kwamen van bestaande computermodellen die al patronen in de chemie hadden leren herkennen, terwijl andere vanaf nul waren berekend met behulp van kwantumfysica. Het team trainde hun AI vervolgens om te fungeren als een "wereldmodel", een systeem dat de regels van het chemische universum begrijpt. Tijdens de training keek de computer bijvoorbeeld naar de structuur van een molecuul en de cellulaire effecten daarvan, en moest vervolgens de bindingssterkte aan een specifiek eiwit voorspellen, of andersom. Als de computer de voorspelling fout had, paste hij zijn interne begrip aan totdat het wel klopte. Dit proces stelde het model in staat om de verborgen verbanden tussen de vorm van een molecuul en het biologische gedrag ervan te leren, zonder dat het expliciet de regels hoefde te krijgen verteld.
Toen het team dit nieuwe model testte tegen andere toonaangevende kunstmatige intelligentiesystemen, waren de resultaten opmerkelijk. Het model presteerde beter dan zijn concurrenten bij een breed scala aan moeilijke taken, vooral wanneer de gegevens schaars waren. In de echte wereld van medicijnontwikkeling moeten wetenschappers vaak beslissingen nemen op basis van zeer kleine hoeveelheden experimentele gegevens, en dat is waar het nieuwe model uitblonk. Het was in staat om zijn kennis te generaliseren naar moleculen die het nog nooit eerder had gezien, waarbij het een hoge nauwkeurigheid behield, zelfs wanneer de testmoleculen chemisch gezien heel anders waren dan de moleculen die het tijdens de training had bestudeerd. De onderzoekers ontdekten dat het succes van het model voortkwam uit zijn vermogen om alle verschillende soorten informatie te gebruiken. Wanneer ze bepaalde soorten gegevens verwijderden, zoals de gedetailleerde 3D-structuur van het molecuul of de cellulaire effecten, vertoonde de prestatie van het model slechts minimale verschillen, wat suggereert dat de geleerde representaties een mate van redundantie bevatten waarbij informatie over meerdere modaliteiten is gecodeerd. Het systeem heeft de gegevens niet simpelweg gememoriseerd; het heeft geleerd te redeneren over de relaties tussen verschillende chemische eigenschappen.
Een van de belangrijkste bevindingen was dat het model niet perfect hoefde te zijn in elke enkele taak om nuttig te zijn. In plaats daarvan leerde het een flexibele representatie van moleculen die kon worden aangepast aan vele verschillende problemen. De onderzoekers testten het model op verschillende uitdagende benchmarks, waaronder het voorspellen van hoe goed een medicijn door het lichaam zou worden opgenomen of hoe giftig het zou kunnen zijn. In bijna alle gevallen presteerde het nieuwe model beter dan de voorheen beste methoden. Het was vooral goed in het aanpakken van het "out-of-distribution"-probleem, wat de moeilijkheid is om te voorspellen hoe een nieuw, ongezien molecuul zal reageren wanneer het chemisch gezien fundamenteel verschilt van alles in de trainingsdata. Door te leren van een breed spectrum aan biologische en fysieke contexten, bouwde het model een robuust begrip op dat het in staat stelde om betrouwbare gissingen te doen over nieuwe verbindingen. Dit suggereert dat de toekomst van medicijnontwikkeling mogelijk niet ligt in het bouwen van grotere modellen die simpelweg meer data memoriseren, maar in het bouwen van slimmere modellen die diverse bronnen van informatie kunnen integreren om de complexe realiteit van hoe medicijnen werken te begrijpen.
De studie onthulde ook dat niet alle soorten informatie even belangrijk waren, hoewel het systeem baat had bij het hebben van ze allemaal. De onderzoekers ontdekten dat de grafenmodaliteit, die de connectiviteit en structuur van het molecuul vertegenwoordigt, het meest cruciale stuk informatie was voor de prestaties in de praktijk, maar dat chemische vingerafdrukken en gegevens over hoe moleculen met cellen interageren ook essentieel waren. Interessant genoeg was het model in staat om effectief te leren, zelfs wanneer sommige gegevens ontbraken of schaars waren, een veelvoorkomend probleem in wetenschappelijk onderzoek. Deze veerkracht suggereert dat de aanpak kan worden toegepast op andere velden waar gegevens incompleet of moeilijk te verkrijgen zijn, zoals materiaalkunde of biologie. Het team merkte op dat hoewel het model krachtig is, het geen magische oplossing is; het vereist nog steeds een zorgvuldige selectie van de gegevens waarvan het leert, en er zijn grenzen aan hoe goed het de uitkomsten kan voorspellen voor moleculen die totaal anders zijn dan alles wat het ooit heeft gezien. De successen van deze aanpak markeren echter een belangrijke stap voorwaarts in het creëren van kunstmatige intelligentie die de chemische wereld werkelijk kan begrijpen, waarbij het verder gaat dan eenvoudige patroonherkenning naar een dieper, meer contextueel redeneren dat de complexiteit van het leven zelf weerspiegelt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.