La bioinformatica è l'incontro vitale tra biologia e informatica, un campo che trasforma i dati biologici complessi in conoscenza comprensibile. Qui esploriamo come algoritmi e software aiutino gli scienziati a decifrare il codice della vita, dall'analisi del DNA alla scoperta di nuovi farmaci, rendendo accessibili scoperte che altrimenti rimarrebbero confinate in database tecnici.

Su Gist.Science, monitoriamo ogni nuovo preprint inviato da bioRxiv in questa categoria. Per ogni articolo, offriamo una doppia prospettiva: una spiegazione semplice per chiunque sia curioso e un riassunto tecnico dettagliato per i ricercatori. Questo approccio garantisce che le ultime novità scientifiche siano chiare, accurate e immediatamente disponibili.

Di seguito trovate i documenti più recenti pubblicati da bioRxiv nel settore della bioinformatica, pronti per essere esplorati nelle vostre forme più accessibili.

💻 bioinformatics

pLM-Guided Inverse Folding for Antibody Sequence Design

Questo articolo propone un metodo di ensemble senza addestramento che combina ProteinMPNN con il modello linguistico specifico per gli anticorpi IgLM per migliorare significativamente il recupero degli amminoacidi e la diversità delle sequenze nell'inversione del ripiegamento degli anticorpi, colmando efficacemente il divario tra i modelli strutturali generali e la progettazione specializzata degli anticorpi.

Noske, V., Koulischer, F., Marchal, K., Demeester, T.2026-06-06
💻 bioinformatics

Single-Cell Multi-Omics Dissection of Malignant Evolutionary Mechanisms and Construction of a Prognostic Model for Clear Cell Renal Cell Carcinoma

Questo studio integra il sequenziamento di RNA e ATAC a singola cellula attraverso i gradi del carcinoma a cellule chiare del rene (ccRCC) per rivelare che i cambiamenti epigenetici precedono le variazioni metaboliche e invasive, definendo al contempo una robusta firma prognostica CBG e mappando l'evoluzione dinamica dell'esaurimento immunitario e delle reti di comunicazione intercellulare.

Liu, R., Shi, Y., Xiao, Y., Ren, B., Li, L., Qi, B., Li, T., Zhang, Y., Gao, J.2026-06-06
💻 bioinformatics

Handshake: Partner-Specific Protein-Protein Binding Site Prediction at Scale Using ProstT5 and Cross-Chain Attention

Il documento introduce Handshake, un modello di deep learning basato esclusivamente sulle sequenze che sfrutta ProstT5 e l'attenzione cross-chain per prevedere accuratamente i siti di legame proteina-proteina specifici per il partner su larga scala, rivelando al contempo che l'elevata ridondanza delle sequenze nei dati di addestramento gonfia significativamente le metriche di prestazione negli benchmark esistenti.

Haspel, N.2026-06-06
💻 bioinformatics

Divergent Loop Architecture Shapes Pocket2 Variation in Shark Legumains

Questo studio identifica un loop superficiale divergente che forma la "Pocket2" come una fonte chiave di variazione strutturale e funzionale nelle legumaine degli squali, contrastando con i loro nuclei catalitici altrimenti altamente conservati e suggerendo questa regione come un obiettivo per future investigazioni sull'adattamento proteasico specifico per specie.

Eijzenga, M., Leibowitz, M., Henley, E. M.2026-06-06
💻 bioinformatics

CryoDiff: An uncertainty-aware diffusion model for Cryo-EM map enhancement

Il documento introduce CryoDiff, un modello di diffusione consapevole dell'incertezza che supera i metodi esistenti nel miglioramento delle mappe cryo-EM migliorando congiuntamente la risoluzione strutturale e fornendo stime di confidenza voxel-wise, aumentando così significativamente l'interpretabilità delle mappe e la costruzione dei modelli a valle.

Wen, B., He, B., Cheng, Y., Zhou, S., Han, R., Zhang, F.2026-06-06
💻 bioinformatics

Cellpin enables reference-based imputation and denoising of spatial transcriptomes

Il documento introduce cellpin, un autoencoder variazionale scalabile addestrato esclusivamente su dati di sequenziamento dell'RNA a singola cellula che utilizza la distillazione latente insegnante-studente e la simulazione del rumore per imputare efficacemente i geni non misurati e denoisare i profili del trascrittoma spaziale senza richiedere l'allineamento tra diverse modalità.

Putze, P., Lucarelli, D., Wellappili, D., Bahrami, M., Luecken, M. D., Theis, F. J., Saur, D.2026-06-05
💻 bioinformatics

OmniGene-4: A Unified Bio-Language MoE Model with Router-Level Interpretability

OmniGene-4 introduce un modello di base Mixture-of-Experts unificato e interpretabile da un router che dimostra come il preaddestramento continuo guidi la specializzazione cross-task mentre il calcolo degli esperti gestisce il ragionamento biologico basato sulla sequenza, raggiungendo prestazioni allo stato dell'arte nell'omologia proteica e nella conoscenza biologica generale con costi computazionali significativamente ridotti anche quando esteso a input multimodali.

Wang, L.2026-06-04
💻 bioinformatics

UnBlender: validating individual analyses in respiratory bulk RNA-seq cell type deconvolution

Il documento introduce UnBlender, una pipeline progettata per consentire agli scienziati respiratori di eseguire la deconversione dei tipi cellulari personalizzabile su dati RNA-seq bulk, validando regolarmente l'accuratezza delle proporzioni dei tipi cellulari stimate per garantire conclusioni riproducibili e affidabili.

Gillett, T. E., van den Berge, M., Nawijn, M. C., Koppelman, G. H.2026-06-04
💻 bioinformatics

An interpretable machine learning framework for dog breed inference and ancestry decomposition

Questo articolo presenta un framework di apprendimento automatico interpretabile che combina la riduzione della dimensionalità con un modello random forest multi-output per inferire accuratamente l'identità della razza e la discendenza dei cani da dati SNP a livello genomico, raggiungendo un'accuratezza del 91,7% sul dataset del Dog Aging Project e identificando al contempo loci genetici biologicamente rilevanti associati a tratti specifici della razza.

Bian, Y., Bierman, R., Snyder-Mackler, N., Promislow, D., Karlsson, E., Dog Aging Project Consortium,, Akey, J. M.2026-06-04
💻 bioinformatics

ROTS 2.0: A reproducibility-driven framework for robust statistical modeling across diverse high-throughput omics study designs

Questo articolo introduce ROTS 2.0, un framework open-source potenziato disponibile in R e Python che estende la statistica di test ottimizzata per la riproducibilità a diversi design di studi omici ad alto rendimento, inclusi i confronti multi-gruppo e l'analisi della sopravvivenza, per migliorare l'affidabilità della selezione delle caratteristiche in contesti sperimentali complessi.

Suomi, T., Kettunen, J., Pusa, T., Elo, L. L.2026-06-03