La bioinformatica è l'incontro vitale tra biologia e informatica, un campo che trasforma i dati biologici complessi in conoscenza comprensibile. Qui esploriamo come algoritmi e software aiutino gli scienziati a decifrare il codice della vita, dall'analisi del DNA alla scoperta di nuovi farmaci, rendendo accessibili scoperte che altrimenti rimarrebbero confinate in database tecnici.

Su Gist.Science, monitoriamo ogni nuovo preprint inviato da bioRxiv in questa categoria. Per ogni articolo, offriamo una doppia prospettiva: una spiegazione semplice per chiunque sia curioso e un riassunto tecnico dettagliato per i ricercatori. Questo approccio garantisce che le ultime novità scientifiche siano chiare, accurate e immediatamente disponibili.

Di seguito trovate i documenti più recenti pubblicati da bioRxiv nel settore della bioinformatica, pronti per essere esplorati nelle vostre forme più accessibili.

💻 bioinformatics

A hierarchical orthology framework reveals viral carbohydrate-active genes across the global virosphere

Questo studio introduce VirGenes, un framework di ortologia gerarchica che integra dati sequenziali, strutturali e funzionali per svelare una vasta, precedentemente sottovalutata diversità di enzimi carboidrato-attivi virali attraverso l'intera virosfera, rivelando le loro complesse origini evolutive e i ruoli significativi nelle interazioni virus-ospite.

Meng, L., Zhang, R., De Castro, C., Uchiyama, I., Kanehisa, M., Ogata, H.2026-08-07
💻 bioinformatics

Phylogeny-aided detection of contamination in nearly 5 million SARS-CoV-2 genomes

Lo studio introduce PhyCD, uno strumento computazionale assistito dalla filogenesi che ha analizzato quasi 5 milioni di genomi di SARS-CoV-2 per identificare oltre 10.000 eventi di contaminazione e mascherare quasi 65.000 sostituzioni errate, migliorando così l'affidabilità delle analisi a valle dell'evoluzione e della trasmissione dei patogeni.

Anoufa, O., Ly-Trong, N., Goldman, N., De Maio, N.2026-08-07
💻 bioinformatics

SLIM: A small linear model with STRING embeddings for single-cell genetic perturbation prediction

SLIM è un modello leggero e computazionalmente efficiente che sfrutta embedding di reti STRING a 64 dimensioni e uno stimatore di regressione ridge in forma chiusa per prevedere accuratamente le risposte cellulari alle perturbazioni genetiche, spesso superando complessi baseline di deep learning con un numero minimo di parametri addestrabili.

Hu, D., Pielies Avelli, M., Jensen, L. J., Rasmussen, S.2026-08-07
💻 bioinformatics

From Abandoned Scripts to FAIR Community Pipelines: Rescuing Orphan Bioinformatics Workflows with nf-core - Lessons from Light-Sheet Fluorescence Microscopy

Questo articolo dimostra che il software scientifico orfano, come l'abbandonato toolkit NuMorph basato su MATLAB, può essere recuperato con successo e trasformato in workflow comunitari sostenibili e riutilizzabili, come nf-core/lsmquant, applicando una riprogettazione sistematica guidata dai principi FAIR e dagli standard moderni dell'ingegneria del software.

Schwitalla, C., Kuhn Cuellar, L., Hoertenhuber, M., Grote, N., Woller, T., Lamberti, I., Pavie, B., Kuestner, T., Kyere (…)2026-08-06
💻 bioinformatics

Benchmarking Twist Genotyping-by-Sequencing Against Whole-Genome Sequencing in Nuclear Families

Questo studio confronta la piattaforma di cattura degli SNP a livello genomico (GxS) di Twist Bioscience rispetto al sequenziamento dell'intero genoma e al microarray Illumina GSA-24 valutando la concordanza dei genotipi e i tassi di violazione mendeliana in 555 individui appartenenti a 184 famiglie nucleari, con l'obiettivo di fornire una valutazione di terze parti di questa emergente tecnologia di sequenziamento mirato.

Klugerman, J., Iossifov, I., Ye, K.2026-08-06
💻 bioinformatics

A Comprehensive Database of Simulations and Meshes of Coronary Arteries from the Fame 2 Trial

Questo articolo presenta un database pubblicamente disponibile contenente simulazioni 3D di Navier-Stokes non stazionarie e mesh esaedriche di alta qualità per 779 arterie coronarie ricostruite dal trial FAME 2, con l'obiettivo di affrontare la scarsità di dati emodinamici numerici per applicazioni di modellazione basata sui dati e di apprendimento automatico.

Marcinno', F., Hinz, J., Ando', E., Mahendiran, T., Buffa, A., Deparis, S.2026-08-05
💻 bioinformatics

Semi-automated annotation refinement accelerates cell type identification in brain spatial and single-cell studies

Il documento presenta SAHA, un pacchetto R scalabile che accelera l'identificazione dei tipi cellulari negli studi di trascrittomica singola e spaziale consentendo un rapido trasferimento di etichette preservando la privacy tramite statistiche riassuntive e iperparametri definiti dall'utente per generare report di annotazione trasparenti e semi-automatizzati.

Acri, D. J., Mustaklem, R., Horan-Portelance, L., Dabin, L. C. J., Park, J. H., Hartigan, K. A., Kersey, H. N., Mesecar (…)2026-08-04
💻 bioinformatics

BWR-finder: BWT-based de novo interspersed repeat detection for gigantic genomes

Gli autori presentano BWR-finder, un nuovo strumento software senza database che utilizza un algoritmo di seed-and-extend basato su BWT parallelizzato per rilevare efficientemente le ripetizioni intersparse in genomi giganteschi (oltre 10 Gb) con una velocità e un uso della memoria migliorati rispetto agli strumenti esistenti, mantenendo al contempo un'alta sensibilità.

Takeda, A., Fukunaga, T., Hamada, M.2026-08-04
💻 bioinformatics

crispAIPE: Probabilistic Modelling of Prime Editing Variant Correction Efficiency

crispAIPE è un framework probabilistico basato su transformer che quantifica l'incertezza negli esiti del prime editing modellando gli eventi di editing competitivi su un simplesso con verosimiglianza di Dirichlet e calibrazione split-conformal, consentendo la previsione affidabile dell'efficienza di correzione delle varianti e filtri di progettazione generalizzabili attraverso i tipi cellulari.

Ozden, F., Lu, P., Minary, P.2026-08-03