La bioinformatica è l'incontro vitale tra biologia e informatica, un campo che trasforma i dati biologici complessi in conoscenza comprensibile. Qui esploriamo come algoritmi e software aiutino gli scienziati a decifrare il codice della vita, dall'analisi del DNA alla scoperta di nuovi farmaci, rendendo accessibili scoperte che altrimenti rimarrebbero confinate in database tecnici.

Su Gist.Science, monitoriamo ogni nuovo preprint inviato da bioRxiv in questa categoria. Per ogni articolo, offriamo una doppia prospettiva: una spiegazione semplice per chiunque sia curioso e un riassunto tecnico dettagliato per i ricercatori. Questo approccio garantisce che le ultime novità scientifiche siano chiare, accurate e immediatamente disponibili.

Di seguito trovate i documenti più recenti pubblicati da bioRxiv nel settore della bioinformatica, pronti per essere esplorati nelle vostre forme più accessibili.

💻 bioinformatics

Interpretable Machine Learning Reveals Complementary Age-Related Signatures in the Oral and Gut Microbiome

Impiegando l'interpretabilità basata su SHAP su dati accoppiati del microbioma orale e intestinale, questo studio rivela che, sebbene i modelli combinati non superino la perfetta accuratezza predittiva dei soli dati intestinali nel distinguere i neonati dagli adulti, essi scoprono firme biologiche complementari e non ridondanti dalla cavità orale che altrimenti verrebbero trascurate dalle metriche di accuratezza convenzionali.

Ruthbah, C. A., Sadi, T. H., Jahan, N. E. S., Adib, A. N. M. T.2026-09-15
💻 bioinformatics

pydreg: a fast Python package for identifying active cis-regulatory elements from nascent transcription

Il documento presenta pydreg, una reimplementazione in Python veloce e manutenibile dell'algoritmo dREG per l'identificazione di elementi cis-regolatori attivi dalla trascrizione nascente, che riduce significativamente i tempi di esecuzione e l'uso della memoria preservando al contempo l'accuratezza e la compatibilità con l'infrastruttura informatica moderna del metodo originale.

He, A. Y., Danko, C. G.2026-09-13
💻 bioinformatics

Matched full-UDG and non-UDG ancient DNA libraries reveal trade-offs in post-mortem damage correction for imputation and kinship inference

Confrontando librerie di DNA antico appaiate, sia full-UDG che non-UDG, da individui mongoli medievali, questo studio dimostra che, mentre vari metodi computazionali di correzione del danno (trimming, rescaling e masking) bilanciano in modo differenziato la ritenzione dei siti rispetto alla riduzione degli errori, la scelta ottimale dipende dall'analisi a valle specifica, con i dati corretti che si rivelano essenziali per un'inferenza accurata della parentela nelle librerie non-UDG.

Ravdandorj, O., Sampildondov, C., Janchiv, K., Gakuhari, T.2026-09-13
💻 bioinformatics

A Framework for Quantifying DNA Methylation Heterogeneity and Detecting Co-methylated loci from Native Nanopore Sequencing

Questo articolo presenta un framework scalabile integrato nel pacchetto DMRcaller che sfrutta il sequenziamento nativo di Oxford Nanopore per quantificare l'eterogeneità della metilazione del DNA a singola molecola e rilevare i loci co-metilati, rivelando schemi epigenetici e interazioni regolatorie oscurati dalle tradizionali analisi medie a livello di sito.

Kim, Y. J., Zabet, N. R.2026-09-13
💻 bioinformatics

Towards reconstruction of the human interactome from positive and negative experimental evidence

Questo articolo presenta una metodologia per ricostruire lo spazio di ricerca sperimentale degli screening delle interazioni proteina-proteina (PPI) al fine di inferire probabili coppie di proteine non interagenti, consentendo così una migliore stima del tasso di errore, la calibrazione dei modelli e un miglioramento dell'addestramento del machine learning per una mappatura più accurata e completa dell'interattoma umano.

As, J., Pelz, K., Bernett, J., Battini, F., List, M., Blumenthal, D. B., Schaefer, M. H.2026-09-13
💻 bioinformatics

Inverse FoldDir: Structure-conditioned Protein Sequence Design by Dirichlet Flow Matching

Il documento introduce Inverse FoldDir, un metodo di folding inverso controllabile basato sul Dirichlet flow matching che genera sequenze proteiche diverse e validatate sperimentalmente con vincoli definiti dall'utente attraverso l'esecuzione di una denoising iterativa sul simplesso delle probabilità degli amminoacidi, raggiungendo metriche di recupero strutturale allo stato dell'arte e un riuscito ridisegno funzionale di un nanobody anti-GFP.

TARTICI, A., Stojkovic, M., Tian, A., Jewett, M. C., Altman, R. B., Wittmann, B. J.2026-09-11✓ Author reviewed
💻 bioinformatics

Perturbation-Aware Neural ODE (pNODE) Learns Microbiome Dynamics from Clinical Data and Predicts Gut-Borne Bloodstream Infections in Patients Receiving Cancer Treatment

Questo studio introduce il framework pNODE (Neural ODE consapevole delle perturbazioni), che supera i modelli tradizionali prevedendo accuratamente la dinamica del microbioma intestinale e predicendo le infezioni batteriche del sangue di origine intestinale nei pazienti oncologici sottoposti a trapianto allogenico di cellule ematopoietiche attraverso l'integrazione delle abbondanze microbiche e delle perturbazioni antibiotiche risolte nel tempo.

Stamper, I. C., Aeria, B., Xavier, J.2026-09-10
💻 bioinformatics

Systematic benchmarking of small variant calling pipelines for long-read RNA sequencing data

Questo studio confronta sistematicamente le pipeline di small variant calling e di phasing di aploti per il sequenziamento dell'RNA a lettura lunga attraverso diversi dataset e tecnologie, rivelando che la qualità del sequenziamento è il principale determinante delle prestazioni e identificando Clair3-RNA, DeepVariant e longcallR come i migliori caller e WhatsHap o HapCUT2 come gli strumenti di phasing ottimali a seconda del contesto specifico.

Wang, J., Robinson, M. D.2026-09-10
💻 bioinformatics

Classical baselines outperform released deep-learning ITS classifiers, which collapse on ITS2 where predictions follow the flanking regions

Questo studio dimostra che, sebbene i classificatori basati sul deep learning per le sequenze ITS fungine raggiungano un'elevata accuratezza sui riferimenti a lunghezza intera, essi falliscono drasticamente sulla subregione ITS2 comunemente utilizzata affidandosi alle regioni fiancheggianti piuttosto che al barcode stesso, causando il fatto che i metodi baseline classici superino significativamente i primi in scenari realistici di metabarcoding ambientale.

O'Brien, A., Gardette, A., Marin, C., Parada, P.2026-09-10
💻 bioinformatics

Reference-guided pseudotime inference across species and biological contexts

Il documento presenta Cavebear, un framework di machine learning che sfrutta dati temporali di scRNA-seq di riferimento di una specie o condizione per inferire accuratamente il pseudotempo e mappare l'invecchiamento biologico o la progressione della malattia in contesti di query privi di etichette temporali affidabili.

Rittenhouse, N., Dannenfelser, R., Filippova, G. N., Yao, V., Deng, X., Disteche, C. M., Zhang, R.2026-09-10