An RNA Language Model trained on sequence alone reveals the structural logic of Internal Ribosome Entry Sites
De auteurs introduceren Albatross, een RNA-taalmodel dat uitsluitend is getraind op sequentiedata en dat bestaande methoden aanzienlijk overtreft in het voorspellen van Internal Ribosome Entry Site-structuren, wat de ontdekking van nieuwe functionele subklassen mogelijk maakt en de identificatie van antivirale doelwitten versnelt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Virussen zijn meesters in vermomming, maar hun meest kritieke geheimen zijn vaak in het volle zicht verborgen binnen hun genetische code. Voor veel virussen, waaronder de picornavirussen die alles veroorzaken van de gewone verkoudheid tot verwoestende neurologische ziekten, zijn de instructies voor het maken van nieuwe virusdeeltjes niet slechts een simpele lijst met letters. Ze zijn gevouwen in complexe driedimensionale vormen. Deze vormen fungeren als schakelaars en handvatten, waardoor het virus de eiwitmakende machinerie van de cel kan kapen. Een van de belangrijkste van deze vormen wordt een Internal Ribosome Entry Site, of IRES, genoemd. In tegen tegenstelling tot menselijke cellen, die meestal een specifieke 'cap' aan het begin van hun genetische instructies nodig hebben om ze te kunnen lezen, fungeren deze virale IRES'en als een directe uitnodiging, waardoor het virus direct en onafhankelijk met het bouwen van eiwitten kan beginnen. Het begrijpen van hoe deze IRES'en precies vouwen, is essentieel om te begrijpen waarom sommige virussen specifieke weefsels infecteren, waarom sommige ernstige ziekten veroorzaken terwijl anderen dat niet doen, en hoe we medicijnen kunnen ontwerpen om ze te stoen. Deze structuren zijn echter berucht moeilijk in kaart te brengen. Ze zijn lang, zeer variabel en veranderen van vorm afhankelijk van de omgeving, waardoor traditionele methoden voor voorspelling traag en vaak onnauwkeurig zijn.
Een team van onderzoekers heeft nu een nieuwe manier ontwikkeld om deze verborgen vormen te zien, waarbij de noodzaak voor dure, tijdrovende experimenten wordt omzeild. Ze creëerden een kunstmatig intelligentiesysteem, dat ze Albatross noemden, getraind op uitsluitend de ruwe genetische sequenties van duizenden van deze virale elementen. Het systeem kreeg geen informatie over hoe RNA vouwt, de regels van de chemie of de fysica van stabiliteit. Het werd simpelweg gevoed met miljoenen sequenties en gevraagd om de patronen daarin te leren. Opmerkelijk genoeg leerde het model de driedimensionale structuur van deze virale elementen met hoge precisie te voorspellen, enkel door de statistische relaties tussen de letters in de sequentie te herkennen. Wanneer de onderzoekers Albatross testten tegen een bibliotheek van 96 verschillende volledige virale IRES'en, waren de voorspellingen van het model veel nauwkeuriger dan die van de beste bestaande methoden. Terwijl andere tools minder dan de helft van de werkelijke structurele verbindingen correct identificeerden, had Albatross in 80 procent van de gevallen gelijk.
De kracht van deze aanpak ligt in wat het model daadwerkelijk heeft geleerd. Het heeft niet alleen de vormen gememoriseerd; het heeft de logica van het virus geleerd. Door te analyseren hoe een verandering in één deel van de sequentie de voorspelling van een ander deel beïnvloedde, identificeerde het model welke stukken van het RNA dicht bij elkaar moeten liggen om te functioneren. Dit stelde de onderzoekers in staat om onderscheid te maken tussen vormen die slechts stabiel zijn en vormen die essentieel zijn voor de werking van het virus. Sterker nog, het model was zo goed in het opsporen van functionele structuren dat het kon voorspellen welke delen van het RNA het meest waarschijnlijk betrokken waren bij het starten van het infectieproces. Deze capaciteit stelde het team in staat om een enorme atlas te bouwen van meer dan 75.000 voorspelde structuren, die een enorme diversiteit aan virussen beslaat die nooit eerder in dergelijke detail met elkaar zijn bestudeerd.
Met behulp van deze nieuwe kaart ontdekten de onderzoekers iets geheel nieuws. Ze vonden een voorheen onbekende subgroep van virale structuren die een uitgebreide stam (extended stem) bevat, een specifiek vouwingspatroon dat nog niet eerder in deze klasse van virussen was gezien. Ze testten deze ontdekking in het laboratorium en bevestigden dat de uitgebreide stam echt was en dat deze een cruciale rol speelde in het vermogen van het virus om te functioneren. Deze bevinding suggereert dat het model biologische waarheden kan onthullen die voorheen onzichtbaar waren voor wetenschappers. Bovendien toonden de onderzoekers aan dat deze methode niet beperkt is tot slechts één type virus. Toen ze dezelfde trainingsstrategie toepasten op het genetisch materiaal van hantavirussen en bacteriële sensoren, identificeerde het model succesvol complexe, langetermijninteracties en zelfs het vermogen van een enkel RNA-molecuul om tussen twee verschillende vormen te schakelen, afhankelijk van de omgeving.
De implicaties van dit werk reiken veel verder dan alleen het in kaart brengen van virussen. Decennialang hebben wetenschappers gestreden om de structuur van RNA te voorspellen omdat de moleculen zo flexibel zijn en de regels die hen beheersen zo complex. Traditionele methoden vertrouwen vaak op het berekenen van de energie van elke mogelijke vorm, een proces dat onmogelijk wordt voor lange sequenties. Andere methoden vereisen het vergelijken van veel soortgelijke virussen om patronen te vinden, wat faalt wanneer de virussen te verschillend zijn. Albatross omzeilt deze problemen door direct te leren van de sequentiegegevens zelf. De onderzoekers ontdekten dat de nauwkeurigheid van het model verbeterde naarmate ze de omvang van de trainingsdata en de omvang van het model vergrootten, wat suggereert dat deze aanpak kan blijven verbeteren met meer data.
Deze studie vertegenwoordigt een significante verschuiving in hoe we de RNA-biologie benaderen. In plaats van deze moleculen te behandelen als statische puzzels die opgelost moeten worden met natuurkundige vergelijkingen, behandelden de onderzoekers ze als een taal die geleerd moet worden. De resultaten laten zien dat de evolutionaire geschiedenis van een virus is gecodeerd in zijn sequentie op een manier die een kunstmatige intelligentie kan decoderen. Door de structurele logica van deze virale elementen te onthullen, biedt dit werk een krachtig nieuw instrument voor het begrijpen van hoe virussen opereren en hoe ze gestopt kunnen worden. Het vermogen om deze structuren op grote schaal te voorspellen betekent dat wetenschappers nu de functionele potentie van duizenden virale sequenties kunnen verkennen die voorheen te moeilijk te bestuderen waren, wat de deur opent naar nieuwe ontdekkingen in de virologie en de geneeskunde.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.