← Ultimi articoli
💻 bioinformatics

CodonMamba: a foundation model for programmable mRNA coding sequence design

CodonMamba è un modello di fondazione allo stato dell'arte per la progettazione di sequenze codificanti di mRNA che, attraverso il pre-addestramento su corpora su larga scala, raggiunge prestazioni superiori nei compiti di predizione e consente un controllo programmabile, durante l'inferenza, dell'ottimizzazione dei codoni per soddisfare specifiche preferenze dell'ospite o dell'applicazione senza necessità di riaddestramento.

Autori originali: Lang, M., Fang, X., Wang, Z., Chen, M., Cheng, Z., Zhu, X., Tam, K. Y., Zhang, J., Li, X.

Pubblicato 2026-08-24
📖 3 min di lettura☕ Lettura da pausa caffè

Autori originali: Lang, M., Fang, X., Wang, Z., Chen, M., Cheng, Z., Zhu, X., Tam, K. Y., Zhang, J., Li, X.

Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Questa è una spiegazione generata dall'IA di un preprint non sottoposto a revisione paritaria. Non è un consiglio medico. Non prendere decisioni sulla salute basandoti su questo contenuto. Leggi il disclaimer completo

All'interno di ogni cellula vivente, una complessa catena di montaggio trasforma le istruzioni genetiche nelle proteine che mantengono in movimento la vita. Queste istruzioni sono scritte in un linguaggio composto da quattro lettere chimiche, raggruppate in triplette chiamate codoni. Sebbene il codice genetico sia universale, il modo in cui diversi organismi utilizzano queste triplette varia; alcuni preferiscono determinate combinazioni rispetto ad altre, proprio come diversi dialetti favoriscono parole specifiche per la stessa idea. Gli scienziati cercano da tempo di riscrivere questi messaggi genetici per creare medicinali potenti, in particolare l'RNA messaggero, o mRNA, che funge da progetto temporaneo per la produzione di proteine terapeutiche. Tuttavia, progettare queste sequenze è un delicato gioco di equilibrio. Il codice non deve solo produrre la proteina corretta, ma deve anche ripiegarsi correttamente, rimanere stabile ed essere letto efficientemente dalla specifica cella ospite in cui entra. Per anni, i ricercatori si sono affidati a programmi informatici per ottimizzare queste sequenze, ma questi strumenti richiedevano spesso una revisione completa ogni volta che uno scienziato voleva cambiare le regole per un nuovo ospite o per una diversa applicazione medica.

Un team di ricercatori ha introdotto un nuovo approccio chiamato CodonMamba, un sistema progettato per comprendere e generare queste sequenze genetiche con una flessibilità senza precedenti. Piuttosto che limitarsi a memorizzare schemi dai dati esistenti, questo sistema funziona come un modello di fondazione, un tipo di intelligenza artificiale addestrata su una vasta libreria di sequenze di codifica naturali per comprendere le regole sottostanti del linguaggio biologico. I ricercatori hanno testato questo modello contro un set completo di dodici diverse attività relative alla previsione del comportamento dell'mRNA. In questi test, CodonMamba ha ottenuto prestazioni migliori di qualsiasi metodo precedente, classificandosi al primo posto in dieci delle dodici categorie. Questo successo suggerisce che il modello abbia appreso una comprensione profonda e generalizzabile di come funzionano le sequenze genetiche, permettendogli di prevedere i risultati con un alto grado di precisione in un'ampia gamma di scenari biologici.

Ciò che distingue questo lavoro non è solo la sua accuratezza, ma la sua capacità di essere guidato dall'utente al momento della creazione. Tradizionalmente, se uno scienziato voleva progettare una sequenza per un organismo specifico, doveva riaddestrare l'intero modello informatico con nuovi dati, un processo lento e rigido. CodonMamba cambia questa dinamica consentendo agli scienziati di specificare le proprie preferenze direttamente durante la fase di generazione. Introducendo regole definite dall'utente su quanto spesso determinati codoni debbano apparire, il sistema può adattarsi istantaneamente alle esigenze di un ospite o di un'applicazione specifica senza dover essere riaddestrato. Ciò significa che un singolo modello può essere utilizzato per progettare sequenze per diversi ambienti semplicemente regolando le istruzioni fornite, preservando la logica biologica centrale pur spostando le scelte stilistiche per adattarle al nuovo contesto.

Nei loro esperimenti, i ricercatori hanno dimostrato che questo sistema può coordinare più obiettivi di progettazione contemporaneamente, ottimizzando simultaneamente diverse proprietà della sequenza. Hanno mostrato che il modello può prendere un design genetico destinato a un ospite e riorientarlo per un altro, cambiando le preferenze sottostanti pur mantenendo intatte le scelte strutturali essenziali. Questa capacità segna un passaggio dall'ottimizzazione statica a un framework programmabile, in cui il processo di progettazione diventa una conversazione tra lo scienziato e il modello. I risultati indicano che questo modello di fondazione offre uno strumento preciso e adattabile per l'ingegneria dell'mRNA, portando il campo verso un futuro in cui le sequenze genetiche possono essere personalizzate con un livello di specificità e facilità che prima era fuori portata.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →