Information-theoretic profiling of structural organization in human genes
Questo studio impiega un framework di clustering basato sulla teoria dell'informazione e sull'entropia del cluster di Kullback–Leibler per analizzare l'organizzazione strutturale di specifici geni umani coinvolti nella regolazione epigenetica e nei disturbi dello sviluppo neuroevolutivo, dimostrando che i profili di entropia risultanti sono robusti e utili per la genomica comparativa e la caratterizzazione funzionale dei geni.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA di un preprint non sottoposto a revisione paritaria. Non è un consiglio medico. Non prendere decisioni sulla salute basandoti su questo contenuto. Leggi il disclaimer completo
Il genoma umano è una vasta biblioteca che contiene le istruzioni per costruire e far funzionare un essere umano. È scritto in un codice chimico composto da quattro lettere, che rappresentano i mattoni del DNA. Per decenni, gli scienziati si sono concentrati sulla lettura delle parole specifiche in questo libro — i geni che codificano per le proteine — per capire come funziona la vita. Tuttavia, gli spazi tra queste parole, e il modo in cui le lettere sono disposte al loro interno, custodiscono un segreto di un tipo diverso. Queste regioni non sono solo riempitivi vuoti; contengono complessi modelli di organizzazione che aiutano a controllare quando e dove i geni si attivano o si disattivano. Per comprendere queste strutture nascoste, i ricercatori si stanno rivolgendo a un ramo della matematica sviluppato originariamente per misurare l'informazione e l'incertezza. Trattando le sequenze di DNA come flussi di dati, possono cercare modelli statistici che rivelino come il codice genetico sia organizzato, senza la necessità di allineare o confrontare le sequenze con altre specie. Questo approccio permette loro di vedere la "trama" del genoma, identificando aree che si comportano in modo altamente ordinato rispetto ad altre che appaiono più casuali.
In uno studio recente, ricercatori del Politecnico di Torino in Italia hanno applicato questo approccio basato sull'informazione a cinque geni umani specifici noti per essere coinvolti nella regolazione di come il DNA viene impacchettato e letto. Questi geni, chiamati ASH1L, NSD1, NSD2, NSD3 e SETD2, sono cruciali per lo sviluppo e sono collegati a varie malattie quando funzionano male. Il team voleva vedere se la "impronta digitale" matematica di questi geni potesse rivelare la loro struttura interna. Hanno iniziato convertendo le lunghe stringhe di lettere del DNA in una serie di numeri. Per farlo equamente, hanno raggruppato le lettere del DNA in due categorie basate sulla loro forma chimica: quelle con due anelli e quelle con uno. Ciò ha creato una mappa numerica bilanciata di ogni gene, estendendosi dall'inizio del gene fino a mille lettere prima e dopo di esso, assicurando di catturare l'ambiente regolatorio circostante.
I ricercatori hanno poi analizzato queste mappe numeriche facendo scorrere una finestra lungo la sequenza, osservando piccoli segmenti alla volta. Per ogni segmento, hanno misurato come le lettere si raggruppassero e hanno confrontato quel modello con un insieme di modelli generati al computer. Questi modelli rappresentavano diversi tipi di casualità, che spaziavano dal rumore completamente caotico a modelli con connessioni a lungo raggio, simili a come un sistema meteorologico potrebbe avere correlazioni nel tempo. L'obiettivo era trovare quale modello informatico meglio corrispondesse alla reale sequenza di DNA. Se un segmento di DNA si comportasse esattamente come la pura casualità, la corrispondenza sarebbe perfetta. Se mostrasse una specifica struttura non casuale, la distanza matematica tra il DNA reale e il modello casuale aumenterebbe. Questa distanza, o divergenza, fungeva da segnale di quanto quella parte del gene fosse strutturata.
I risultati hanno rivelato un modello sorprendente e coerente attraverso tutti e cinque i geni. Le sezioni di DNA che codificano per le proteine, note come esoni, hanno mostrato un segnale forte e distinto. Queste regioni codificanti hanno costantemente deviato dai modelli casuali, indicando che possiedono una struttura interna specifica e organizzata. Al contrario, le sezioni non codificanti, chiamate introni, che costituiscono la stragrande maggioranza della lunghezza del gene, si sono comportate molto più come i modelli casuali e non correlati. La misura matematica ha evidenziato efficacementamente la differenza tra le parti "lavorative" del gene e le parti "spaziatrici". Quando i ricercatori hanno confrontato questi profili matematici con le mappe biologiche note dei geni, i picchi nel segnale si sono allineati perfettamente con le posizioni degli esoni che codificano per le proteine. Le valli nel segnale corrispondevano agli introni.
Questa scoperta suggerisce che il metodo basato sulla teoria dell'informazione può distinguere tra DNA codificante e non codificante senza dover conoscere la funzione biologica in precedenza. Lo studio ha anche esaminato altre caratteristiche regolatorie, come promotori ed enhancer, che agiscono come interruttori per i geni. La connessione tra il segnale matematico e questi elementi regolatori era meno chiara e variava da gene a gene, suggerendo che, mentre la struttura codificante è catturata in modo robusto da questo metodo, l'organizzazione degli interruttori regolatori è più complessa e dipendente dal contesto. I ricercatori hanno scoperto che la forza del segnale nelle regioni codificanti era strettamente legata alla dimensione del gene e alla quantità di DNA codificante in esso contenuto.
Lo studio dimostra che l'organizzazione strutturale dei geni umani lascia una firma statistica rilevabile. Utilizzando un metodo che misura quanto una sequenza differisca dalla pura casualità, i ricercatori sono stati in grado di mappare l'architettura interna di geni complessi. L'approccio si è dimostrato robusto, funzionando costantemente sia che i dati venissero analizzati in sezioni sovrapposte che non sovrapposte. Sebbene il metodo separi chiaramente le regioni codificanti da quelle non codificanti, la sua capacità di individuare specifici interruttori regolatori è ancora in fase di sviluppo. Il lavoro offre un nuovo modo complementare per guardare il genoma, che si basa sulle proprietà matematiche della sequenza stessa piuttosto che sul semplice confronto con altre sequenze note. Ciò potrebbe aiutare gli scienziati a identificare le regioni funzionali nel genoma in modo più efficiente, fornendo una comprensione più profonda di come il codice genetico sia organizzato per sostenere la vita.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.