ML4SD: Leveraging Machine Learning and High-Throughput Search Algorithms for an Iterative Growth-Coupled Design Innovation
Het artikel introduceert ML4SD, een actieve leer-Design-Build-Test-Learn-cyclus die machine learning integreert met een nieuw hoog-doorvoersalgoritme (gcSwarms) om efficiënt groei-gekoppelde microbiële stamontwerpen te identificeren, waarbij aanzienlijk hogere koolstofopbrengsten worden bereikt met veel minder experimentele iteraties dan traditionele zoekmethoden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
In de race naar een circulaire economie proberen wetenschappers microben te leren om afval om te zetten in waardevolle chemicaliën, ter vervanging van de op olie gebaseerde processen die momenteel onze wereld aandrijven. Stel je een fabrieksvloer voor waar bacteriën fungeren als piepkleine arbeiders, die weggegooid plantaardig materiaal of industriële bijproducten consumeren en plastics, brandstoffen of medicijnen uitspugen. De uitdaging is dat deze microscopische werkers van nature prioriteit geven aan groei en deling boven het besteden van energie aan het maken van een specifiek product voor mensen. Om dit op te lossen, proberen ingenieurs het interne metabolisme van de bacteriën te herbedraden, zodat het maken van het gewenste product essentieel wordt voor het overleven van de organisme zelf. Als de bacteriën stoppen met het produceren van de chemische stof, stoppen ze ook met groeien. Deze "groei-gekoppelde" strategie dwingt de microben om het werk te doen, maar het vinden van de juiste genetische schakelaars om om te zetten is als het zoeken naar een speld in een hooiberg van miljarden mogelijkheden. Traditionele methoden omvatnen het testen van één genetische verandering tegelijk, een traag en duur proces dat vaak weinig resultaat oplevert.
Een team van onderzoekers heeft nu een nieuwe aanpak ontwikkeld die computeronderzoek combineert met machine learning om deze zoektocht drastisch te versnellen. Ze creëerden een systeem genaamd ML4SD, dat fungeert als een slimme gids voor het ontwerpen van deze genetisch gemanipuleerde bacteriën. In plaats van blindelings duizenden genetische combinaties te testen, gebruikt het systeem een digitale tweeling van het metabolisme van de bacterie om te simuleren hoe verschillende genetische ingrepen de groei en productie zouden beïnvloeden. Vervolgens gebruikt het machine learning om te leren van deze simulaties, waarbij patronen worden geïdentificeerd die leiden tot succes. De onderzoekers ontdekten dat voor dit leerproces de initiële pool van gesimuleerde ontwerpen enorm en gevarieerd moet zijn, inclusief veel ontwerpen die falen of slecht presteren. Als de pool alleen de "beste" ontwerpen bevat, raakt het computermodel in de war en kan het niet generaliseren naar nieuwe situaties. Door te trainen op een diverse set gegevens, leerde het systeem te voorspellen welke genetische veranderingen het beste zouden werken, waardoor de zoekruimte effectief werd verkleind.
Om hun methode te testen, richtte het team zich op een specifieke en uitdagende taak: het omzetten van 4-hydroxybenzoaat, een verbinding afgeleid van lignine uit plantaardig afval, in 6-caprolactam, de bouwsteen voor nylon-6. Dit is een moeilijke conversie omdat de chemische paden complex zijn en de bacteriën, Pseudomonas putida, deze taak van nature niet efficiënt uitvoeren. De onderzoekers probeerden eerst een bestaand algoritme te gebruiken om een lijst met potentiële genetische ontwerpen te genereren, maar ze ontdekten dat dit een kleine, repetitieve lijst met opties produceerde waar het machine learning-model niet effectief van kon leren. Het model vertoonde overfitting, wat betekent dat het de weinige voorbeelden die het kreeg uit het hoofd leerde, maar er niet in slaagde de resultaten te voorspellen voor nieuwe, onbekende ontwerpen.
Om dit op te lossen, bouwde het team een nieuw zoekalgoritme genaamd gcSwarms. In tegen tegenstelling tot de vorige methode verkende dit algoritme de ontwerpplek breder en genereerde het een enorme bibliotheek van meer dan 50.000 unieke genetische ontwerpen in één enkele run. Dit bevatte veel ontwerpen die niet perfect waren, wat het machine learning-systeem de rijke, gevarieerde data gaf die het nodig had om de onderliggende regels van het metabolisme te leren. Wanneer zij deze diverse bibliotheek in hun ML4SD-systeem voedden, waren de resultaten opmerkelijk. Het systeem identificeerde succesvol een set genetische deleties die de koolstofopbrengst van het proces met wel 164 procent verbeterde vergeleken met de beste ontwerpen gevonden door de initiële zoektocht alleen.
De kracht van deze aanpak ligt in de efficiëntie ervan. Om deze hoogpresterende ontwerpen te vinden, verkende het ML4SD-systeem minder dan 4.500 ontwerpen. In contrast hiermee moest het traditionele zoekalgoritme tussen de 10.000 en 30.000 ontwerpen onderzoeken om een vergelijkbaar niveau van prestatie te bereiken. Dit betekent dat de nieuwe methode hetzelfde resultaat behaalde met twee tot zeven keer minder computationele inspanning. Bovendien was het systeem in staat om een specifieke, minimale set van drie genetische veranderingen aan te wijzen die consistent voorkwamen in de beste ontwerpen. Deze veranderingen stuurden de energiestroom binnen de cel effectief om, waardoor de cel werd gedwongen middelen naar de productie van de nylon-precursor te kanaliseren.
De onderzoekers benadrukken dat deze bevindingen momenteel simulaties zijn, een proof of concept die het potentieel van de methode aantoont. De volgende stap zou zijn om de werkelijke bacteriën in een laboratorium te bouwen en te testen of ze presteren zoals de computer heeft voorspeld. Indien succesvol, zou deze aanpak de ontwikkeling van duurzame biofabricage aanzienlijk kunnen versnellen, door afvalstromen om te zetten in waardevolle materialen met veel minder tijd en middelen dan de huidige methoden toelaten. Door machines te leren leren van een breed scala aan mislukte en succesvolle pogingen, hebben de onderzoekers een routekaart gecreëerd voor het navigeren door het complexe landschap van metabole engineering, wat een praktisch pad biedt naar een meer circulaire en duurzame industriële toekomst.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.