Evaluation of multiple sclerosis risk loci reveals that genomic oracles fail to generalise sequence effects across host contexts
Questo studio dimostra che gli oracoli genomici basati sul deep learning non riescono a generalizzare gli effetti delle sequenze attraverso diversi contesti dell'ospite, poiché le loro previsioni sull'attività degli elementi regolatori sono altamente dipendenti dalla specifica posizione genomica e non possono essere predette in modo affidabile solo dalle caratteristiche della sequenza.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Nel vasto paesaggio del genoma umano, determinati tratti di DNA agiscono come interruttori, accendendo o spegnendo i geni per controllare il modo in cui le cellule funzionano. Gli scienziati cercano da tempo di comprendere il codice preciso che dice a questi interruttori dove lavorare e quando attivarsi. Negli ultimi anni, sono emersi potenti programmi informatici per aiutare a decodificare questo linguaggio. Questi programmi, spesso chiamati "oracoli genomici", possono esaminare una sequenza di lettere di DNA e prevedere come si comporterà all'interno di una cellula vivente, stimando se si aprirà per permettere l'attività genica o rimarrà chiusa. Poiché questi strumenti digitali sono veloci ed economici rispetto agli esperimenti di laboratorio, i ricercatori li utilizzano sempre più spesso per progettare nuove sequenze di DNA, sperando di creare interruttori personalizzati che funzionino esattamente come previsto. La speranza sottostante è che, se un programma informatico afferma che una specifica sequenza di DNA è un buon interruttore in una parte del genoma, essa rimanga un buon interruttore anche se spostata in una posizione diversa.
Un nuovo studio mette in discussione questa fondamentale assunzione, testando se queste previsioni digitali reggano quando la stessa sequenza di DNA viene collocata in diverse zone del genoma. I ricercatori si sono concentrati sulla sclerosi multipla, una malattia in cui il sistema immunitario attacca il sistema nervoso, e hanno esaminato le specifiche regioni genetiche note per aumentare il rischio di sviluppare tale condizione. Hanno utilizzato un modello di intelligenza artificiale per generare migliaia di candidati sequenze di DNA che sembrassero poter funzionare come interruttori regolatori nelle cellule immunitarie. Hanno poi utilizzato un oracolo genomico per valutare questi candidati, selezionando quelli che il computer prevedeva sarebbero stati i più attivi. Il team ha quindi eseguito un test rigoroso: ha preso le stesse identiche sequenze selezionate e le ha collocate in ventiquattro diverse posizioni all'interno del genoma per vedere se la previsione del computer rimanesse coerente.
I risultati hanno rivelato una sorprendente mancanza di coerenza. Sebbene il programma informatico potesse classificare bene le sequenze all'interno di una singola posizione, le sue previsioni non erano in grado di generalizzare quando le sequenze venivano spostate. L'effetto di una specifica modifica al DNA non era una proprietà fissa della sequenza stessa; invece, dipendeva interamente da dove la sequenza si trovava nel genoma. In alcune posizioni, una specifica modifica al DNA rendeva la sequenza più attiva, mentre in altre posizioni la stessa identica modifica la rendeva meno attiva o non aveva alcun effetto. I ricercatori hanno scoperto che il comportamento della sequenza era così dipendente dal suo ambiente che la variazione tra le diverse posizioni era enorme, con l'effetto che cambiava direzione in quasi la metà dei siti testati.
Per capire cosa il computer stesse effettivamente "vedendo", il team ha eseguito interventi diretti sulle sequenze di DNA. Hanno testato se la preferenza del computer fosse guidata dalla presenza di specifici siti di legame per le proteine note per controllare i geni, o dalla densità di questi siti. La risposta è stata negativa; rimuovere questi siti o cambiarne il numero non ha cambiato il punteggio del computer in modo prevedibile. Invece, il fattore che contava davvero era il contenuto di una specifica struttura chimica chiamata CpG, che coinvolge l'appaiamento di due lettere del DNA. Tuttavia, anche questo fattore non agiva da solo. Aumentare la quantità di questa struttura nel DNA migliorava il punteggio in alcune posizioni genomiche, ma danneggiava il punteggio in altre. La direzione dell'effetto era determinata dalla posizione ospite, non dall'editing stesso.
Lo studio ha anche testato se un secondo programma informatico, addestrato indipendentemente, producesse gli stessi risultati. Questo nuovo modello, costruito con un'architettura diversa e addestrato su dati differenti, ha confermato il risultato principale: l'effetto dell'editing del DNA era altamente instabile e variava enormemente a seconda della posizione genomica. Tuttavia, i due programmi non concordavano esattamente su quali posizioni avrebbero mostrato un effetto positivo o negativo, suggerendo che, sebbene l'instabilità sia un fenomeno reale, i dettagli specifici di come un modello interpreta una posizione siano unici per quel modello.
Forse più criticamente, i ricercatori hanno verificato se le sequenze selezionate dal computer funzionassero effettivamente meglio in un esperimento reale. Hanno confrontato i punteggi del computer con l'attività misurata da un saggio di laboratorio su larga scala che coinvolgeva migliaia di elementi di DNA. I criteri di selezione del computer non sono riusciti a prevedere quali sequenze fossero veramente attive nelle cellule. Infatti, le sequenze che il computer valutava come le migliori performer mostravano spesso il comportamento opposto nei laboratori, con gli elementi più specifici e attivi che ricevevano i punteggi più bassi dall'oracolo. Questa discrepanza suggerisce che l'obiettivo specifico per cui il computer stava ottimizzando non riflette l'effettiva attività biologica del DNA.
I ricercatori hanno inoltre scoperto che un metodo matematico molto più semplice, basato sul conteggio dei pattern di lettere nel DNA, poteva generare sequenze altrettanto bene quanto i complessi modelli di intelligenza artificiale basati sul deep learning. Questo metodo semplice, che non richiede computer potenti e può essere adattato in pochi secondi, eguagliava le prestazioni delle avanzate reti neurali in ogni parametro testato. Questa scoperta implica che la complessità dei modelli di deep learning non fosse necessaria per catturare i pattern essenziali delle sequenze di DNA in questo contesto.
In definitiva, lo studio conclude che un effetto a livello di sequenza appreso o misurato da un oracolo genomico non è una proprietà della sequenza da sola. È una proprietà della sequenza combinata con il contesto genomico specifico in cui si trova. Questa dipendenza dalla posizione non è prevedibile da caratteristiche semplici e poco costose del DNA circostante. Per gli scienziati che progettano nuovi elementi genetici, ciò significa che un design scelto e validato in una simulazione al computer in una posizione non garantisce affatto come si comporterà una volta spostato o inserito altrove. I risultati fungono da avvertimento: questi potenti strumenti digitali, pur essendo utili, non possono ancora essere affidati per prevedere il comportamento di sequenze progettate attraverso il diversificato panorama del genoma umano senza una verifica sperimentale diretta in molteplici posizioni.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.