La bioinformatica è l'incontro vitale tra biologia e informatica, un campo che trasforma i dati biologici complessi in conoscenza comprensibile. Qui esploriamo come algoritmi e software aiutino gli scienziati a decifrare il codice della vita, dall'analisi del DNA alla scoperta di nuovi farmaci, rendendo accessibili scoperte che altrimenti rimarrebbero confinate in database tecnici.

Su Gist.Science, monitoriamo ogni nuovo preprint inviato da bioRxiv in questa categoria. Per ogni articolo, offriamo una doppia prospettiva: una spiegazione semplice per chiunque sia curioso e un riassunto tecnico dettagliato per i ricercatori. Questo approccio garantisce che le ultime novità scientifiche siano chiare, accurate e immediatamente disponibili.

Di seguito trovate i documenti più recenti pubblicati da bioRxiv nel settore della bioinformatica, pronti per essere esplorati nelle vostre forme più accessibili.

💻 bioinformatics

Pretrained gene representations transfer mean expression more broadly than spatial patterns in virtual spatial transcriptomics

Questo studio dimostra che, nella trascrittomica spaziale virtuale, le rappresentazioni geniche pre-addestrate migliorano principalmente la previsione dell'espressione media di un gene attraverso i tessuti piuttosto che la sua variazione spaziale, rivelando che la generalizzazione inter-genica è guidata più dal trasferimento dell'espressione ampia che dal recupero di specifici pattern spaziali.

Chen, T., Hicks, S. C.2026-09-18
💻 bioinformatics

Interrogating contrastive learning embeddings for structure-based virtual screening: a case study on DrugCLIP

Questo articolo valuta sistematicamente gli embedding del contrastive learning di DrugCLIP per lo screening virtuale basato sulla struttura, rivelando che mentre i suoi embedding della tasca offrono una ricerca di similarità strutturale rapida e robusta e i suoi embedding del ligando catturano pattern chimici sensibili alla tasca con una forte capacità di generalizzazione verso target non visti, le prestazioni sono significativamente limitate dalle variazioni conformazionali e dalle imprecisioni nelle tasche proteiche predette.

Sanchez Utges, J., Jones, D. T., Orengo, C.2026-09-18
💻 bioinformatics

Targeted ortholog search in unannotated genome assemblies with fDOG-Assembly

Il documento introduce fDOG-Assembly, uno strumento innovativo che consente ricerche di ortologhi mirate e consapevoli dell'architettura delle caratteristiche direttamente in assemblaggi genomici non annotati, superando così i limiti dei metodi tradizionali che si affidano a proteomi pre-annotati e rivelando nuove intuizioni biologiche, come il diffuso potenziale di biosintesi dei β\beta-lattamici nei collemboli.

Muelbaier, H., Arthen, F., Tran, V., Schaefer, I., Balint, M., Ebersberger, I.2026-09-16
💻 bioinformatics

Structured cross-omics interaction discovery with a triple-graph model

Il documento introduce TriGer, un framework a triplo grafo che supera i limiti delle associazioni a coppie frammentate nei dati multi-omici identificando moduli coordinati many-to-many interpretabili attraverso i livelli molecolari, dimostrando la sua efficacia nel recuperare segnali strutturati nelle simulazioni e nel rivelare pattern biologici specifici della malattia nella malattia infiammatoria intestinale e nel cancro del colon-retto.

YU, J., Lin, H., Chen, S.2026-09-16
💻 bioinformatics

Flow Orchestrated Regulatory Genomics Engine (FORGE): A Configurable Nextflow Pipeline for End-to-End snMultiome Analysis

FORGE è una pipeline Nextflow configurabile e containerizzata che automatizza l'analisi end-to-end del multioma a singolo nucleo integrando i dati di espressione genica e di accessibilità della cromatina per l'inferenza di reti regolatorie e il testing differenziale, migliorando così la scalabilità, la riproducibilità e l'interpretazione biologica attraverso diversi dataset.

Solano, L. E., Rahimzadeh, N., Shi, Z., Swarup, V.2026-09-16
💻 bioinformatics

ML4SD: Leveraging Machine Learning and High-Throughput Search Algorithms for an Iterative Growth-Coupled Design Innovation

Il documento introduce ML4SD, un ciclo di Design-Build-Test-Learn basato sull'apprendimento attivo che integra il machine learning con un nuovo algoritmo ad alto rendimento (gcSwarms) per identificare efficientemente design di ceppi microbici accoppiati alla crescita, ottenendo rese di carbonio significativamente più elevate con molte meno iterazioni sperimentali rispetto ai metodi di ricerca tradizionali.

Gargantilla Becerra, A., Nogales Enrique, J.2026-09-16
💻 bioinformatics

A Turing-Style Test for In-Silico Antibodies: How Sampling Mode Makes WGAN-GP Beat VAE in the Wet Lab

Questo studio dimostra che, sebbene le Wasserstein GAN abbiano superato i Variational Autoencoders nella generazione di anticorpi de novo sperimentalmente validi (99% contro 5% di successo), tale disparità è stata guidata principalmente dalla strategia di campionamento — generazione incondizionata rispetto al seeding latente con anticorpi noti — piuttosto che da una superiore superiorità architettonica intrinseca.

Kummer, A., Mahmoudinobar, F., Liu, W., Davis, J. W., Ma, E. J., Kumar, S.2026-09-16
💻 bioinformatics

Uncertainty-Aware Model Selection with a Calibrated Probability-Generating-Function-Based Bayesian Information Criterion

Questo articolo introduce una regola di selezione del modello consapevole dell'incertezza per i modelli di espressione genica stocastica che migliora la convenzionale PGF-BIC incorporando una soglia guidata dai dati, derivata tramite funzioni di influenza e l'ineguaglianza di Cantelli, per tenere conto dell'incertezza di campionamento e prevenire la sovra-selezione di modelli complessi senza sacrificare l'efficienza computazionale.

Wang, Y., Shu, Z., Gao, F., Cao, Z.2026-09-16
💻 bioinformatics

Interpretable Machine Learning Reveals Complementary Age-Related Signatures in the Oral and Gut Microbiome

Impiegando l'interpretabilità basata su SHAP su dati accoppiati del microbioma orale e intestinale, questo studio rivela che, sebbene i modelli combinati non superino la perfetta accuratezza predittiva dei soli dati intestinali nel distinguere i neonati dagli adulti, essi scoprono firme biologiche complementari e non ridondanti dalla cavità orale che altrimenti verrebbero trascurate dalle metriche di accuratezza convenzionali.

Ruthbah, C. A., Sadi, T. H., Jahan, N. E. S., Adib, A. N. M. T.2026-09-15