← Nieuwste papers
💬 NLP

Closed-Loop Bayesian Molecular Inverse Design with Semantic LLM Surrogates

Dit artikel introduceert \textbf{\method}, een closed-loop Bayesiaans framework voor moleculair invers ontwerp dat een bevroren groot taalmodel gebruikt als een semantische surrogaat om direct te redeneren over tekstuele instructies en optimalisatiegeschiedenis, waardoor informatieve referentiemoleculen worden geselecteerd om een bevroren generator aan te sturen en de traditionele Gaussian process-baselines overtreft of evenaart bij taken binnen de geneesmiddelen- en materiaalkunde.

Oorspronkelijke auteurs: Yaoyao Xu, Xinjian Zhao, Xiaozhuang Song, Lei Bai, Tianshu Yu

Gepubliceerd 2026-08-25
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yaoyao Xu, Xinjian Zhao, Xiaozhuang Song, Lei Bai, Tianshu Yu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De zoektocht naar nieuwe medicijnen en geavanceerde materialen begint vaak met een vraag: hoe moet een molecuul eruitzien om een specifieke taak te kunnen uitvoeren? Wetenschappers noemen dit inverse design. In plaats van duizenden bestaande chemicaliën te testen om te zien wat ze doen, proberen onderzoekers een molecuul vanaf nul op te bouwen dat aan een precieze set vereisten voldoet, zoals het blokkeren van een virus of het door een filter laten passeren van gas. De uitdaging is dat het universum van mogbare chemische structuren enorm is, naar schatting bevat het rond de 10 tot de macht 60 geneesmiddelachtige moleculen. Het vinden van de weinigen die werken, is als het zoeken naar een naald in een hooiberg die voortdurend van vorm verandert. Traditioneel hebben computers geprobeerd dit op te lossen door willekeurige kandidaten te genereren en deze te controleren tegen een computermodel, maar dit proces is vaak inefficiënt en produceert veel slechte opties voordat er een goede wordt gevonden.

Een team onderzoekers van de Chinese Universiteit van Hong Kong, Shenzhen, en het Shanghai Artificial Intelligence Laboratory heeft een nieuwe manier ontwikkeld om deze zoektocht te sturen. Ze creëerden een systeem genaamd BoMolLLM, dat het proces van het vinden van een goed molecuul niet behandelt als een enkele gok, maar als een gesprek tussen een computerprogramma en een groot taalmodel. In hun aanpak genereert de computer een batch moleculen, en een gespecialiseerde kunstmatige intelligentie fungeert als een gids. Deze gids leest de resultaten van de vorige batch, analyseert welke structuren het beste werkten, en schrijft vervolgens een nieuwe set instructies voor de generator. In plaats van alleen het beste molecuul uit de vorige ronde te kiezen, selecteert de gids een paar interessante voorbeelden en legt uit waarom deze veelbelovend zijn, waardoor de generator effectief leert wat hij als volgende moet proberen. Dit creëert een gesloten lus waarbij de zoektocht met elke stap slimmer wordt, en de focus verfijnt totdat het moleculen vindt die nauw aansluiten bij de gewenste eigenschappen.

De onderzoekers testten dit systeem op twee zeer verschillende soorten problemen. Eerst vroegen ze het om moleculen te ontwerpen voor medicijnontdekking, specif으로 gericht op verbindingen die met HIV zouden kunnen interageren, de bloed-hersenbarrière kunnen passeren, of een specifiek enzym genaamd BACE kunnen remmen. Deze taken vereisen dat het molecuul een binaire uitkomst heeft: het werkt of het werkt niet. Ten tweede testten ze het op materiaalkunde, waarbij ze het systeem vroegen om polymeren te ontwerpen die de doorstroming van gassen zoals koolstofdioxide, zuurstof en stikstof kunnen reguleren. Deze taken zijn meer continu en vereisen dat het molecuul een specifieke doelwaarde voor permeabiliteit bereikt in plaats van simpelweg te slagen of te falen in een test. In beide gevallen kreeg het systeem een beperkt aantal pogingen om zijn resultaten te verbeteren, wat een scenario simuleert waarin het testen van echte chemicaliën duur en tijdrovend is.

De resultaten toonden aan dat deze conversationele aanpak de standaardmethoden overtrof. Wanneer de onderzoekers hun systeem vergeleken met een eenmalige poging (one-shot), waarbij de computer probeert de perfecte molecuul in één keer te genereren zonder feedback, produceerde de nieuwe methode een veel hoger deel succesvolle kandidaten. Het presteerde ook even goed als, of beter dan, traditionele wiskundige optimalisatietechnieken die vertrouwen op complexe statistische modellen om de volgende beste stap te voorspellen. Het cruciale verschil was dat het nieuwe systeem de geschiedenis van zijn eigen pogingen kon "lezen". Het kon naar een lijst met moleculen kijken die faalden en zeggen: "Deze bevatten te veel zware metalen," of "Deze misten de juiste ringstructuur," en die inzichten vervolgens doorgeven aan de volgende ronde van generatie. Dit vermogen om te redeneren over de tekst van de chemische structuren en de scores die zij ontvingen, stelde het systeem in staat om de chemische ruimte effectiever te navigeren dan methoden die alleen naar gecomprimeerde numerieke gegevens keken.

Een van de meest interessante bevindingen was dat het systeem zijn strategie aanpaste afhankelijk van het type probleem. Voor de medicijn-doelwitten, die duidelijke pass-of-fail criteria hadden, werkte het systeem het best wanneer het simpelweg wees naar de beste voorbeelden uit de vorige ronde. De specifieke structuren van die moleculen waren voldoende om de volgende stap te sturen. Echter, voor de materiaalkunde-taken, waarbij het doel is om een precieze numerieke doelwaarde te bereiken, had het systeem meer hulp nodig. In deze gevallen bood de gids een korte, éénzinnige samenvatting van de strategie, zoals "focus op gefluoreerde structuren", wat de generator hielp het bredere patroon te begrijpen dat nodig was om het doel te bereiken. Dit suggereert dat hoewel het systeem flexibel is, de manier waarop het zijn bevindingen communiceert, afgestemd moet zijn op de aard van het probleem dat het oplost.

De onderzoekers observeerden ook dat het systeem zijn gedrag in de loop van de tijd natuurlijk veranderde. In de vroege rondes verkende het een grote verscheidenheid aan chemische structuren, waarbij het veel verschillende vormen en samenstellingen probeerde om te zien wat mogelijk was. Naarmate de rondes vorderden, begon het zich nauwer te focussen en de meest veelbelovende structuren die het had gevonden te verfijnen. Dit weerspiegelt de manier waarop een menselijke wetenschapper te werk gaat, beginnend met brede ideeën en geleidelijk toewerkend naar de meest levensvatbare opties. Het systeem was niet alleen gelukkig; het ontdekte consistent eerder en betrouwbaarder hoog scorende moleculen dan de andere geteste methoden. Tegen het einde van het proces bevonden de gegenereerde moleculen zich geclusterd in de regio's van de chemische ruimte waar de beste kandidaten werden gevonden, in plaats van willekeurig verspreid te zijn.

Dit werk demonstreert dat grote taalmodellen effectieve gidsen kunnen dienen voor wetenschappelijke ontdekkingen, niet alleen door tekst te genereren, maar door strategische beslissingen te nemen op basis van data. Het systeem vervangt niet de noodzaak voor real-world testen, maar verbetert aanzienlijk de kwaliteit van de kandidaten die de laboratoriumtafel bereiken. Het maakt de zoektocht naar nieuwe moleculen tot een transparanter proces, waarbij de redenering achter elke stap gelezen en begrepen kan worden. De onderzoekers ontdekten dat door de optimalisatiegeschiedenis te behandelen als een verhaal dat geanalyseerd moet worden in plaats van slechts een lijst met getallen, ze een efficiëntere en intelligentere zoekmachine voor de moleculaire wereld konden bouwen. Deze aanpak biedt een veelbelovend pad voor het versnellen van de ontdekking van nieuwe medicijnen en materialen, door een enorme en chaotische zoekruimte te veranderen in een geleide reis naar een oplossing.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →