← Nieuwste papers
📄 bioengineering

RNASeek: A Cross-Phyla Generative Foundation Model for Multipurpose RNA Modeling and Reinforcement Learning-Based Design

RNASeek is een generatief fundamenteel model met 1,6 miljard parameters dat reinforcement learning gebruikt om RNA-sequentie-representatie, functionele voorspelling en de novo ontwerp te verenigen, waarbij het succesvol experimenteel gevalideerde ribozymen en 3' UTR's genereert met verbeterde prestaties.

Oorspronkelijke auteurs: Chen, S., Fernandes, N., Li, W. V., Wang, L., Jia, Z., Xiang, J. S.

Gepubliceerd 2026-09-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chen, S., Fernandes, N., Li, W. V., Wang, L., Jia, Z., Xiang, J. S.

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

In elke levende cel vindt een enorme en complexe conversatie plaats, niet met woorden, maar met moleculen. In het hart van deze dialoog staat RNA, een veelzijdig molecuul dat zowel als boodschapper als regulator fungeert, waarbij het instructies draagt van de genetische blauwdruk en bepaalt hoe die instructies worden uitgevoerd. Decennialang hebben wetenschappers begrepen dat de specifieke volgorde van letters in een RNA-streng zijn vorm en functie bepaalt, net zoals de ordening van letters in een zin de betekenis bepaalt. Het voorspellen van exact hoe een nieuwe sequentie van letters zich zal gedragen, is echter een enorme uitdaging geweest. De regels zijn complex en omvatten interacties op lange afstand en subtiele structurele nuances die moeilijk met de hand in kaart te brengen zijn. Nu hebben onderzoekers een nieuwe tool ontwikkeld die deze regels leert door de biologische literatuur van het leven zelf te lezen, waardoor ze niet alleen kunnen voorspellen hoe RNA zich zal gedragen, maar ook geheel nieuwe moleculen kunnen ontwerpen met specifieke, gewenste eigenschappen.

Het team achter dit werk, geleid door onderzoekers aan de University of California, Riverside en Columbia University, creëerde een enorm computerprogramma dat ze RNASeek noemen. Denk aan dit programma als een student die elk boek heeft gelezen in een bibliotheek die de genetische instructies bevat van meer dan honderd verschillende soorten, van planten en dieren tot schimmels en virussen. In tegen tegenstelling tot eerdere tools die ontworpen waren om slechts één specifieke puzzel op te lossen, is RNASeek gebouwd om de algemene taal van RNA te begrijpen. Het werd getraind op een dataset bestaande uit ongeveer 150 miljard stukjes genetische informatie, waarbij het leerde patronen te herkennen in de manier waarop verschillende organismen hun RNA construeren. Het programma leerde ook om natuurlijke taalinstructies te lezen, wat betekent dat een wetenschapper simpelweg kan vertellen wat hij wil, zoals "creëer een stabiele RNA-sequentie" of "ontwerp een molecuul dat zichzelf doorsnijdt", en het model zal proberen een oplossing te genereren.

Om te testen of deze digitale student de taal werkelijk had geleerd, vroegen de onderzoekers het eerst om het gedrag van ribozymen te voorspellen. Dit zijn RNA-moleculen die fungeren als enzymen, in staat om zichzelf of andere moleculen door te snijden. Het team voorzag het model van duizenden bekende ribozyme-sequenties en hun gemeten snijsnelheden. RNASeek slaagde erin om te voorspellen welke sequenties snel zouden snijden en welke traag, waarbij het subtiele kenmerken identificeerde die bijdragen aan de snelheid, zoals de flexibiliteit van bepaalde lussen in de structuur van het molecuul. Het model presteerde even goed als, of zelfs beter dan, veel gespecialiseerde tools die specifiek voor deze taak zijn ontworpen, wat bewees dat het de onderliggende principes had begrepen van hoe de RNA-structuur de functie dicteert.

Moedig door dit succes, pushten de onderzoekers het model verder door het te vragen om nieuwe RNA-sequenties vanaf nul te ontwerpen. Ze richtten zich op een ander type RNA dat te vinden is in de 3' niet-vertaalde regio, een sectie van het molecuul die helpt te bepalen hoe lang het RNA overleeft in een cel. Een langere levensduur betekent dat de cel meer van het eiwit produceert waar het RNA voor codeert, wat cruciaal is voor therapieën zoals mRNA-vaccins. De onderzoekers gebruikten een techniek genaamd reinforcement learning, een methode waarbij het computerprogramma een spel van trial-and-error speelt. Het genereerde duizenden kandidaat-sequenties, en een apart deel van het model fungeerde als een rechter, die de kandidaten scoorde op basis van hoe stabiel ze voorspeld werden te zijn. Het programma paste vervolgens zijn strategie aan om betere kandidaten te genereren, waarbij het geleidelijk leerde om sequenties te produceren die zeer stabiel zijn.

De resultaten waren opmerkelijk. De door RNASeek ontworpen sequenties waren niet slechts willekeurige combinaties van letters; ze bevatten specifieke patronen, zoals een overvloed aan adenine en uracil, die bekend staan om het helpen stabiliseren van RNA. Wanneer de onderzoekers deze door de computer gegenereerde ontwerpen in een laboratoriumsetting testten, ontdekten ze dat de nieuwe sequenties uitzonderlijk goed presteerden. Sommige van de ontworpen moleculen waren zelfs stabieler dan de beste sequenties gevonden in de natuur of die gecreëerd door andere kunstmatige intelligentietools. Cruciaal was dat wanneer de onderzoekers de letters van deze succesvolle ontwerpen door elkaar haalden, de volgorde veranderden terwijl de ingrediënten hetzelfde bleven, de stabiliteit verdween. Dit bevestigde dat het succes voortkwam uit de specifieke ordening van de letters, en niet alleen uit de chemische samenstelling, wat bewees dat het model de ware syntaxis van de taal had geleerd.

De studie demonstreerde ook dat het model complexe instructies kon opvolgen. Wetenschappers konden het programma vragen om een stabiele RNA-sequentie te genereren die een specifiek motief voor klonering bevat of een bepaald patroon uitsluit dat problemen zou kunnen veroorzaken. Het model slaagde erin om aan deze beperkingen te voldoen terwijl het nog steeds optimaliseerde voor stabiliteit. Dit vermogen om natuurlijke taalcommando's op te volgen en functionele biologische onderdelen te produceren, suggereert een nieuwe manier om het leven te ontwerpen. In plaats van te vertrouwen op trage, dure cycli van trial-and-error in het laboratorium, kunnen wetenschappers nu een verenigd systeem gebruiken om te voorspellen hoe RNA zal reageren en om nieuwe moleculen te ontwerpen die aan precieze behoeften voldoen. Het werk vestigt dat een enkel, grootschalig model de kloof kan overbruggen tussen het begrijpen van biologische data en het creëren van nieuwe, functionele biologische tools, wat de deur opent naar een efficiënter ontwerp van therapieën en onderzoeksinstrumenten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →