Avoiding the explicit inverse of the pedigree relationship matrix among genotyped animals in approximate reliabilities of single-step genomic predictions
Questo studio valuta cinque strategie computazionali che evitano con successo i costi proibitivi di memoria e tempo dell'inversione esplicita della matrice di relazione pedigree per le predizioni genomiche single-step, con l'identità di Woodbury e gli approcci stocastici di Hutchinson che emergono come i metodi più efficienti per scalare il calcolo dell'affidabilità approssimata a grandi popolazioni genotipizzate mantenendo un'elevata accuratezza numerica.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA di un preprint non sottoposto a revisione paritaria. Non è un consiglio medico. Non prendere decisioni sulla salute basandoti su questo contenuto. Leggi il disclaimer completo
Nel mondo dell'allevamento animale, l'obiettivo è migliorare le mandrie selezionando i migliori genitori per la generazione successiva. Per farlo efficacemente, gli allevatori si affidano ai valori genetici stimati, che sono previsioni del potenziale genetico di un animale. Tuttavia, una previsione è valida solo quanto la sua affidabilità, una misura di quanto sia precisa tale stima. Per decenni, calcolare questa precisione è stato gestibile quando gli allevatori lavoravano solo con gli alberi genealogici, o pedigree. Ma il campo si è spostato verso le previsioni genomiche a passaggio singolo (single-step), un metodo potente che combina la storia familiare con i dati del DNA effettivo. Questa integrazione permette decisioni di allevamento molto più accurate, ma introduce un enorme ostacolo computazionale. I dati del DNA collegano ogni animale genotipizzato a tutti gli altri, creando una fitta rete di connessioni che rende gli strumenti matematici standard per il calcolo dell'affidabilità troppo grandi per essere contenuti nella memoria di un computer. Quando una popolazione supera le poche decine di migliaia di animali genotipati, il metodo tradizionale di risolvere queste equazioni semplicemente va in crash, lasciando gli allevatori senza un modo per sapere quanto possano fidarsi dei loro migliori candidati.
Un team di ricercatori ha deciso di risolvere questo collo di bottiglia cercando nuovi modi per calcolare questi punteggi di affidabilità senza mai costruire la matrice massiccia e ingombrante che causa il fallimento del computer. Lavorando con i dati del programma di allevamento Angus PROMEBO in Brasile, che comprendeva quasi 434.000 animali con oltre 24.000 di essi genotipati, il team ha testato cinque diverse strategie. Il loro obiettivo non era inventare una nuova teoria genetica, ma trovare un modo più intelligente per fare i calcoli. Hanno confrontato questi nuovi approcci con il metodo tradizionale esatto, che funge da standard di riferimento (gold standard), ma che è impossibile da eseguire su dataset così grandi. I ricercatori volevano vedere se potevano saltare il passaggio della creazione esplicita della enorme matrice, utilizzando invece scorciatoie matematiche per ottenere lo stesso risultato con molta meno memoria e tempo.
I risultati hanno dimostrato che tutte e cinque le nuove strategie potevano riprodurre i risultati del metodo standard con estrema accuratezza. Quando i ricercatori hanno confrontato i punteggi di affidabilità generati dai loro nuovi metodi rispetto al benchmark, i numeri corrispondevano quasi perfettamente, con correlazioni superiori al 99 percento. Ciò significa che le scorciatoie non hanno sacrificato la precisione; hanno semplicemente evitato il vicolo cieco computazionale. Tra i cinque approcci, due si sono distinti per la loro efficienza. Un metodo, che utilizza un'identità matematica specifica per riorganizzare il problema, e un altro che utilizza una tecnica di campionamento statistico, hanno entrambi ridotto la memoria richiesta di circa l'80 percento. Invece di aver bisogno di quasi 18 gigabyte di memoria per eseguire il calcolo, questi metodi richiedevano solo circa 3,5 gigabyte. Questa riduzione è fondamentale perché significa che il calcolo può essere eseguito su server standard anziché richiedere hardware di supercalcolo specializzati ed costosi.
La velocità di questi metodi variava, ma uno degli approcci basati sul campionamento è stato particolarmente impressionante. Ha completato i calcoli in circa lo stesso tempo del metodo tradizionale, ma senza il crash della memoria. Questa è una scoperta significativa perché suggerisce che, man mano che i programmi di allevamento crescono fino a includere centinaia di migliaia o persino milioni di animali genotipati, il metodo tradizionale diventerà impossibile da usare, mentre queste nuove strategie rimarranno pratiche. I ricercatori hanno scoperto che per popolazioni più piccole, il vecchio metodo è ancora il più veloce, ma una volta che il numero di animali genotipati supera una certa soglia, i nuovi metodi diventano l'unica opzione praticabile. Lo studio conferma che gli allevatori possono continuare a utilizzare gli strumenti genomici più avanzati senza scontrarsi con un limite computazionale, garantendo che la precisione delle loro valutazioni genetiche tenga il passo con la dimensione dei loro dati.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.