An RNA Language Model trained on sequence alone reveals the structural logic of Internal Ribosome Entry Sites
Gli autori presentano Albatross, un modello linguistico dell'RNA addestrato esclusivamente su dati di sequenza che supera significativamente i metodi esistenti nella previsione delle strutture dei siti di ingresso interno del ribosoma, consentendo la scoperta di nuove sottoclassi funzionali e accelerando l'identificazione di bersagli antivirali.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA di un preprint non sottoposto a revisione paritaria. Non è un consiglio medico. Non prendere decisioni sulla salute basandoti su questo contenuto. Leggi il disclaimer completo
I virus sono maestri del travestimento, ma i loro segreti più critici sono spesso nascosti in piena vista all'interno del loro codice genetico. Per molti virus, inclusi i picornavirus che causano tutto, dal raffreddore comune a devastanti malattie neurologiche, le istruzioni per creare nuove particelle virali non sono solo un semplice elenco di lettere. Esse sono ripiegate in complesse forme tridimensionali. Queste forme agiscono come interruttori e maniglie, permettendo al virus di dirottare il macchinario di sintesi proteica della cella. Una delle forme più importanti è chiamata Sito di Ingresso Interno del Ribosoma, o IRES. A differenza delle cellule umane, che di solito necessitano di un cappuccio specifico all'inizio delle loro istruzioni genetiche per iniziare a leggerle, questi IRES virali agiscono come un invito diretto, permettendo al virus di iniziare a costruire proteine immediatamente e in modo indipendente. Comprendere esattamente come questi IRES si ripiegano è vitale per capire perché alcuni virus infettano tessuti specifici, perché alcuni causano malattie gravi mentre altri no, e come potremmo progettare farmaci per fermarli. Tuttavia, queste strutture sono notoriamente difficili da mappare. Sono lunghe, altamente variabili e cambiano forma a seconda dell'ambiente, rendendo i metodi tradizionali di predizione lenti e spesso imprecisi.
Un team di ricercatori ha sviluppato un nuovo modo per vedere queste forme nascoste, bypassando la necessità di esperimenti costosi e dispendiosi in termini di tempo. Hanno creato un sistema di intelligenza artificiale, che hanno chiamato Albatross, addestrato esclusivamente sulle sequenze genetiche grezze di migliaia di questi elementi virali. Il sistema non ha ricevuto alcuna informazione su come l'RNA si ripiega, sulle regole della chimica o sulla fisica della stabilità. Gli sono stati semplicemente somministrati milioni di sequenze e gli è stato chiesto di apprendere i pattern al loro interno. Sorprendentemente, il modello ha imparato a predire la struttura tridimensionale di questi elementi virali con alta precisione, semplicemente riconoscendo le relazioni statistiche tra le lettere della sequenza. Quando i ricercatori hanno testato Albatross contro una libreria di 96 diversi IRES virali a lunghezza intera, le predizioni del modello sono state molto più accurate rispetto a quelle dei migliori metodi esistenti. Mentre altri strumenti identificavano correttamente meno della metà delle reali connessioni strutturali, Albatross era esatto circa l'80 percento delle volte.
La forza di questo approccio risiede in ciò che il modello ha effettivamente imparato. Non ha solo memorizzato le forme; ha imparato la logica del virus. Analizzando come un cambiamento in una parte della sequenza influenzasse la predizione di un'altra parte, il modello ha identificato quali pezzi dell'RNA devono trovarsi vicini per funzionare. Ciò ha permesso ai ricercatori di distinguere tra forme che sono meramente stabili e quelle che sono essenziali affinché il virus funzioni. Infatti, il modello era così bravo a individuare le strutture funzionali che poteva predire quali parti dell'RNA fossero più probabilmente coinvolte nel processo di inizio dell'infezione. Questa capacità ha permesso al team di costruire un enorme atlante di oltre 75.000 strutture predette, coprendo una vasta diversità di virus che non erano mai stati studiati con tale dettaglio prima d'ora.
Utilizzando questa nuova mappa, i ricercatori hanno scoperto qualcosa di completamente nuovo. Hanno trovato un sottogruppo precedentemente ignoto di strutture virali che includeva uno stelo esteso, un particolare pattern di ripiegamento che non era mai stato visto in questa classe di virus prima d'ora. Hanno testato questa scoperta in laboratorio, confermando che lo stelo esteso era reale e che svolgeva un ruolo cruciale nella capacità del virus di funzionare. Questo ritrovamento suggerisce che il modello può svelare verità biologiche che erano precedentemente invisibili agli scienziati. Inoltre, il team ha dimostrato che questo metodo non è limitato a un solo tipo di virus. Quando hanno applicato la stessa strategia di addestramento al materiale genetico degli hantavirus e ai sensori batterici, il modello ha identificato con successo complesse interazioni a lungo raggio e persino la capacità di una singola molecola di RNA di passare tra due forme diverse a seconda del proprio ambiente.
Le implicazioni di questo lavoro vanno ben oltre la mappatura dei virus. Per decenni, gli scienziati hanno lottato per predire la struttura dell'RNA perché le molecole sono così flessibili e le regole che le governano sono così complesse. I metodi tradizionali spesso si affidano al calcolo dell'energia di ogni possibile forma, un processo che diventa impossibile per sequenze lunghe. Altri metodi richiedono il confronto di molti virus simili per trovare pattern, il che fallisce quando i virus sono troppo diversi tra loro. Albatross elude questi problemi imparando direttamente dai dati della sequenza stessa. I ricercatori hanno scoperto che l'accuratezza del modello migliorava all'aumentare della dimensione dei dati di addestramento e della dimensione del modello, suggerendo che questo approccio può continuare a migliorare con più dati.
Questo studio rappresenta un cambiamento significativo nel modo in cui approcciamo la biologia dell'RNA. Inveve di trattare queste molecole come puzzle statici da risolvere con equazioni fisiche, i ricercatori le hanno trattate come un linguaggio da apprendere. I risultati mostrano che la storia evolutiva di un virus è codificata nella sua sequenza in un modo che un'intelligenza artificiale può decodificare. Rivelando la logica strutturale di questi elementi virali, il lavoro fornisce un potente nuovo strumento per comprendere come operano i virus e come potrebbero essere fermati. La capacità di predire queste strutture su larga scala significa che gli scienziati possono ora esplorare il potenziale funzionale di migliaia di sequenze virali che prima erano troppo difficili da studiare, aprendo la porta a nuove scoperte nella virologia e nella medicina.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.