La bioinformatica è l'incontro vitale tra biologia e informatica, un campo che trasforma i dati biologici complessi in conoscenza comprensibile. Qui esploriamo come algoritmi e software aiutino gli scienziati a decifrare il codice della vita, dall'analisi del DNA alla scoperta di nuovi farmaci, rendendo accessibili scoperte che altrimenti rimarrebbero confinate in database tecnici.

Su Gist.Science, monitoriamo ogni nuovo preprint inviato da bioRxiv in questa categoria. Per ogni articolo, offriamo una doppia prospettiva: una spiegazione semplice per chiunque sia curioso e un riassunto tecnico dettagliato per i ricercatori. Questo approccio garantisce che le ultime novità scientifiche siano chiare, accurate e immediatamente disponibili.

Di seguito trovate i documenti più recenti pubblicati da bioRxiv nel settore della bioinformatica, pronti per essere esplorati nelle vostre forme più accessibili.

💻 bioinformatics

Hierarchical temporal transformer for cancer grade prediction and cross cancer transfer learning from pathology reports

Questo articolo introduce l'Hierarchical Temporal Transformer (HTT), un'architettura a due livelli che sfrutta i referti patologici longitudinali e gli embedding del tipo di cancro per raggiungere uno stato dell'arte nella previsione del grado di cancro e dimostrare un efficace apprendimento per trasferimento zero-shot su tipi di cancro non visti senza penalità di prestazioni.

Brimo, N., Anand, R., Harb, H., Serdaroglu, D. C.2026-09-15
💻 bioinformatics

POME: Graph-based embeddings for partially observed mixed-type data

Il documento presenta POME, un modello di embedding basato su grafi e auto-supervisionato progettato per generare rappresentazioni a bassa dimensionalità per dati biomedici di tipo misto parzialmente osservati, raggiungendo prestazioni di imputazione allo stato dell'arte e consentendo l'efficacia in compiti a valle come la scoperta di sottogruppi di pazienti, la modellazione predittiva e la raccomandazione di terapie.

Woller, F., Arend, L., Kist, A. M., List, M., Rahimi, F., Sirocchi, C., Blumenthal, D. B.2026-09-15
💻 bioinformatics

pydreg: a fast Python package for identifying active cis-regulatory elements from nascent transcription

Il documento presenta pydreg, una reimplementazione in Python veloce e manutenibile dell'algoritmo dREG per l'identificazione di elementi cis-regolatori attivi dalla trascrizione nascente, che riduce significativamente i tempi di esecuzione e l'uso della memoria preservando al contempo l'accuratezza e la compatibilità con l'infrastruttura informatica moderna del metodo originale.

He, A. Y., Danko, C. G.2026-09-13
💻 bioinformatics

Matched full-UDG and non-UDG ancient DNA libraries reveal trade-offs in post-mortem damage correction for imputation and kinship inference

Confrontando librerie di DNA antico appaiate, sia full-UDG che non-UDG, da individui mongoli medievali, questo studio dimostra che, mentre vari metodi computazionali di correzione del danno (trimming, rescaling e masking) bilanciano in modo differenziato la ritenzione dei siti rispetto alla riduzione degli errori, la scelta ottimale dipende dall'analisi a valle specifica, con i dati corretti che si rivelano essenziali per un'inferenza accurata della parentela nelle librerie non-UDG.

Ravdandorj, O., Sampildondov, C., Janchiv, K., Gakuhari, T.2026-09-13
💻 bioinformatics

A Framework for Quantifying DNA Methylation Heterogeneity and Detecting Co-methylated loci from Native Nanopore Sequencing

Questo articolo presenta un framework scalabile integrato nel pacchetto DMRcaller che sfrutta il sequenziamento nativo di Oxford Nanopore per quantificare l'eterogeneità della metilazione del DNA a singola molecola e rilevare i loci co-metilati, rivelando schemi epigenetici e interazioni regolatorie oscurati dalle tradizionali analisi medie a livello di sito.

Kim, Y. J., Zabet, N. R.2026-09-13
💻 bioinformatics

Towards reconstruction of the human interactome from positive and negative experimental evidence

Questo articolo presenta una metodologia per ricostruire lo spazio di ricerca sperimentale degli screening delle interazioni proteina-proteina (PPI) al fine di inferire probabili coppie di proteine non interagenti, consentendo così una migliore stima del tasso di errore, la calibrazione dei modelli e un miglioramento dell'addestramento del machine learning per una mappatura più accurata e completa dell'interattoma umano.

As, J., Pelz, K., Bernett, J., Battini, F., List, M., Blumenthal, D. B., Schaefer, M. H.2026-09-13
💻 bioinformatics

Inverse FoldDir: Structure-conditioned Protein Sequence Design by Dirichlet Flow Matching

Il documento introduce Inverse FoldDir, un metodo di folding inverso controllabile basato sul Dirichlet flow matching che genera sequenze proteiche diverse e validatate sperimentalmente con vincoli definiti dall'utente attraverso l'esecuzione di una denoising iterativa sul simplesso delle probabilità degli amminoacidi, raggiungendo metriche di recupero strutturale allo stato dell'arte e un riuscito ridisegno funzionale di un nanobody anti-GFP.

TARTICI, A., Stojkovic, M., Tian, A., Jewett, M. C., Altman, R. B., Wittmann, B. J.2026-09-11✓ Author reviewed ⓘ
💻 bioinformatics

Perturbation-Aware Neural ODE (pNODE) Learns Microbiome Dynamics from Clinical Data and Predicts Gut-Borne Bloodstream Infections in Patients Receiving Cancer Treatment

Questo studio introduce il framework pNODE (Neural ODE consapevole delle perturbazioni), che supera i modelli tradizionali prevedendo accuratamente la dinamica del microbioma intestinale e predicendo le infezioni batteriche del sangue di origine intestinale nei pazienti oncologici sottoposti a trapianto allogenico di cellule ematopoietiche attraverso l'integrazione delle abbondanze microbiche e delle perturbazioni antibiotiche risolte nel tempo.

Stamper, I. C., Aeria, B., Xavier, J.2026-09-10
💻 bioinformatics

Systematic benchmarking of small variant calling pipelines for long-read RNA sequencing data

Questo studio confronta sistematicamente le pipeline di small variant calling e di phasing di aploti per il sequenziamento dell'RNA a lettura lunga attraverso diversi dataset e tecnologie, rivelando che la qualità del sequenziamento è il principale determinante delle prestazioni e identificando Clair3-RNA, DeepVariant e longcallR come i migliori caller e WhatsHap o HapCUT2 come gli strumenti di phasing ottimali a seconda del contesto specifico.

Wang, J., Robinson, M. D.2026-09-10