Graph2Path: Hierarchical Reactivity-Guided Template Policy Learning for Multi-Step Retrosynthesis
Graph2Path is een hiërarchisch, reactiviteit-gestuurd template-beleid dat multi-stap retrosyntheseplanning verbetert door atoom- en binding-activiteitstoezicht te integreren in graaf-gecodeerde toestanden, waarmee een superieure exacte route-nauwkeurigheid en succespercentages wordt bereikt vergeleken met bestaande methoden zoals RetroSynFormer en AiZynthFinder, zij het met een verhoogde inferentietijd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De zoektocht naar het ontwikkelen van nieuwe medicijnen en materialen begint vaak met een eenvoudige maar ontmoedigende vraag: hoe nemen we een complex molecuul dat we nodig hebben en hoe bepalen we hoe we het kunnen maken van eenvoudigere, beschikbare ingrediënten? Dit proces, bekend als retrosynthese, is als het achteruitwerken van een voltooide puzzel om de specifieke doos met stukjes te vinden die eruit zijn ontstaan. Decennialang hebben chemici vertrouwd op hun intuïtie en ervaring om deze paden te traceren, maar de enorme hoeveelheid mogelijke chemische reacties maakt de taak overweldigend voor een menselijk brein alleen. In de afgelopen jaren zijn computers bijgekomen om te helpen, waarbij ze gebruikmaken van uitgebreide bibliotheken van bekende chemische reacties om stapsgewijze plannen voor te stellen. Deze computerprogramma's worstelen echter vaak met het overzien van het grote geheel. Ze zijn uitstekend in het suggereren van de directe volgende stap in een reactie, maar ze raken vaak de weg kwijt wanneer ze proberen een lange keten van stappen te coördineren, waarbij ze vastlopen in doodlopende wegen of paden kiezen die lokaal goed lijken maar de einddoelstelling niet bereiken.
Een team van onderzoekers heeft een nieuwe aanpak ontwikkeld genaamd Graph2Path om dit coördinatieprobleem op te lossen. In plaats van alleen naar de directe volgende zet te kijken, leert hun systeem de volledige reis van een chemische synthese in één keer te begrijpen. De kern van het idee is om de computer te leren niet alleen te herkennen welke reactie hij moet kiezen, maar ook hoe belangrijk die reactie is binnen de context van het volledige plan. In een succesvolle chemische synthese zijn sommige stappen cruciale draaipunten die vroeg in het proces plaatsvinden, terwijl andere minder belangrijke aanpassingen zijn die later gebeuren. De onderzoekers hebben hun systeem getraind om deze "reactiecentra" te identificeren — de specifieke atomen en bindingen waar veranderingen optreden — en ze een waarde toe te kennen op basis van hoe diep ze in het algemene plan zitten. Denk aan een kaart waarbij de meest cruciale knooppunten met felle kleuren zijn gemarkeerd, wat de computer helpt om prioriteit te geven aan de meest significante beslissingen boven de minder belangrijke.
Om deze intelligentie op te bouwen, gebruikte het team een methode die bestaat uit het herhalen van bekende, succesvolle chemische routes. Ze namen deze opgenomen paden en braken ze af in een sequentie van beslissingen, waarbij de computer niet alleen de volgende reactie leerde voorspellen, maar ook de "activiteit" of het belang van de betrokken atomen in die reactie. Het systeem gebruikt een geavanceerd graafgebaseerd model, dat moleculen behandelt als netwerken van verbonden punten, om deze structuren te visualiseren. Door te leren de belangrijkheid van specifieke delen van het molecuul in verschillende stadia van de reis te voorspellen, krijgt de computer een hiërarchisch begrip van de synthese. Het leert dat een binding die aan het begin van een plan wordt verbroken, fundamenteel anders is van een binding die aan het einde wordt verbroken, zelfs als de chemische reactie er aan de oppervlakte hetzelfde uitziet.
Toen de onderzoekers dit nieuwe systeem testten tegen bestaande methoden, lieten de resultaten een duidelijke verbetering zien in het vinden van het exacte juiste pad. Op een standaard reeks testgevallen identificeerde het nieuwe systeem de volledige, correcte sequentie van reacties ongeveer 7,9% van de tijd, een aanzienlijke sprong ten opzichte van de 5,8% succesratio van de vorige beste methode. Hoewel het systeem niet altijd een oplossing sneller vond — het duurde in feite ongeveer 60% langer om elk plan te berekenen omdat het een meer gedetailleerde analyse uitvoerde — was het veel beter in het vinden van de precieze route die chemici hadden vastgelegd. In veel gevallen vonden de oudere systemen een pad dat weliswaar werkte, maar net iets anders was dan de bedoeling, of ze raakten verdwaald in een lange, onnodige omweg. Het nieuwe systeem was daarentegen in staat om de complexe boom van mogelijkheden directer te navigeren, waarbij het vaak de exacte sequentie van stappen vond die een menselijke chemicus zou hebben gekozen.
De studie onthulde ook hoe verschillende onderdelen van het systeem bijdroegen aan het succes. De verbetering in het vinden van de exacte route kwam primair voort uit het vermogen van het systeem om deze hiërarchische belangrijkheidsniveaus tijdens de training te leren. Echter, een apart kenmerk dat het vertrouwen van de computer in zijn keuzes tijdens het eigenlijke zoekproces aanpaste, hielp ervoor te zorgen dat het systeem niet op moeilijke problemen opgaf. Deze combinatie stelde het systeem in staat om een hoog percentage van het vinden van een werkende oplossing te behouden, waarbij het de prestaties van de beste bestaande tools evenaarde, terwijl het tegelijkertijd veel beter werd in het vinden van de beste oplossing. De onderzoekers merkten op dat hoewel het systeem momenteel langzamer is dan zijn voorgangers, de afruil een veel hogere kwaliteit van planning is, wat cruciaal is bij het ontwerpen van complexe moleculen waarbij een verkeerde afslag maanden aan laboratoriumwerk kan verspillen.
Uiteindelijk vertegenwoordigt dit werk een verschuiving van simpelweg reageren op de volgende stap naar het begrijpen van de structuur van de gehele reis. Door computers te leren de relatieve belangrijkheid van verschillende delen van een molecuul gedurende een proces met meerdere stappen te begrijpen, hebben de onderzoekers een hulpmiddel gecreëerd dat meer is afgestemd op de manier waarop menselijke experts over synthese denken. Hoewel het systeem nog steeds afhankelijk is van een vaste set bekende reacties en meer rekentijd vereist, suggereert het vermogen om menselijke routes met grotere nauwkeurigheid te matchen een veelbelovende toekomst voor computerondersteunde chemie. De bevindingen suggereren dat we door lagen van structureel begrip aan deze modellen toe te voegen, dichter bij volledig geautomatiseerde systemen kunnen komen die complexe chemische paden kunnen ontwerpen met dezelfde betrouwbaarheid en voorzienigheid als ervaren wetenschappers.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.